Ordonner, classer, trier des documents

Merci pour cette liste. J’ai regardé les fonctionnalités, tous ont des avantages et inconvénients, mais en synthèse ils ne conviennent pas totalement pour mon besoin :

  • OpenKM : plus open source à partir de la version 7
  • LogicalDoc : ne semble pas capable de tagguer un passage ou zone particulier
  • Paperless-ngx : ne semble pas capable de tagguer un passage ou zone particulier, semble fait uniquement pour les documents textuels
  • SeedDMS : ne semble pas proposer de tags utilisateur
  • Alfresco : usine à gaz qui ressemble plus à un ERP complet qu’à une simple GED, me donne envie de passer mon chemin
  • Papermerge : ne semble pas gérer les documents audio et vidéos
  • Zoho : j’ai rien trouvé qui ressemble à ce que je cherche

Je vais finir par croire qu’un logiciel tout simple pouvant étiqueter une zone d’une photo, ou un passage d’un audio ou d’une vidéo, n’existe pas. Et ça ne m’étonne qu’à moitié, car je réfléchissais aux interactions qu’un tel logiciel devrait avoir avec des lecteurs externes pour afficher juste les passages choisis, ça me semblait un peu complexe…

Zoho c’est Zoho Docs

C’est surtout une GED pour numériser des documents physiques.
Et ne concerne pas que des documents textuels.

Pour ce qui est des documents textuels, il suffit de faire des recherches et tu peux ainsi trouver des passages dans de nombreuse GED. Si les sources de documents ont utilisé les ALT c’est pareil (car c’est fait pour ca justement).
Pas que je sache aujourd’hui. A moins de passer par les IA pour lesquels il existe des systèmes de tag pour cela; elles en ont besoin car sinon elles ne saurait rien faire, et ça a créé toute une population de gens précaires auxquels nombres de sociétés volent littéralement le travail car ils ne sont parfois pas payé.
Si on fourni de simples images de chats sans les tagguer (yeux, oreilles, pattes, queue, etc…) à une IA elle ne sait pas reconnaître un chat.

Ouais, je veux éviter d’avoir recours aux IA. Mon but est de tagguer moi-même consciencieusement chaque document, ou chaque passage… Je vais peut-être bien finir avec une feuille de tableur (beuark) :smiley:

Un moteur de recherche suffit, sinon tu vas passer le reste de ta vie à le faire manuellement.
Tagguer des documents tous les logiciels de GED le font.
Quand à un tableur…no comment.
Chez moi je dispose de plus de 4000 documents, je ne compte aucune video ou audio dedans. S’amuser à tagguer leurs contenus au delà du document lui même est impossible si cela n’a pas été fait au fur et à mesure et nécessite d’avoir le système sous la main à chaque lecture.

Pour du texte, oui. Pour un passage précis d’une vidéo (qui n’a pas forcément de paroles à ce moment-là, sur lesquelles on pourrait lire des mots-clé), non.

faudra donc le faire au moment ou tu regardes la vidéo, avec l’appli à portée de main.

Oui c’est ça : lire la vidéo ou l’audio, noter qu’entre les timestamps HH:MM et HH:MM on parle du sujet X, et renseigner ce tag X et ces timestamps dans une appli qu’il me reste à trouver. Dans cette appli, rechercher le tag X me sort indistinctement qu’on en parle dans tel document texte, et dans tel passage de la vidéo entre les timestamps.

C’est un excellent départ pour commencer avant de passer à un SGBDR. Le travail ne sera pas perdu car le passage de fichiers cvs vers une base de données est un bon exercice ne présentant pas de grande difficulté. Il convient à un moment donné de formaliser son besoin, puis de l’affiner par écrit pour établir un cahier des charges sans quoi on peut tourner longtemps en rond sur le sujet.

Le problème du tableur c’est le risque un jour de permuter involontairement des parties de lignes. Imaginez un répertoire téléphonique ou les colonnes nom et prénom seraient triés par ordre alphabétique sans que les autres colonnes soient affectées ! Il existe aussi une autre limite, celle du nombre du lignes même si elle est de plus en plus grande.

Après réflexion, il y a trop de choses différentes pour un seul programme de création de tag, et donc une base de donnée par type me paraît être la bonne idée.

Tu peux tout à fait utiliser dans un premier temps un tableur, je te le conseille même si c’est un humain qui écrit les données à la main.

Mais il y a une certaine automatisation et pour cela, un fichier de type csv ou json ou xml sera effectivement ton format multi types.

LA question est simple :
Quelles données pour chaque type de fichier?

Ensuite tu penses à comment tu le fais.

essai pour tagguer des vidéos semi-automatiquement avec pas grand chose

  • tu regardes la vidéo avec vlc ; tu ouvres un fichier libreoofice calc avec des colonnes qui ont des titres qui t’intéresse
  • quand tu vois un truc intéressant
    • tu appuies sur imprim écran
    • dans le tableur tu écris les infos dans les bonnes colonnes
      tu obtients donc un fichier image pour chaque ligne de ton tableur
      avec un ocr tu extrais le time code de tes images

aegisub permet un peu de le faire :
tu lis une vidéo et crée un sous titre au bon moment

En fait il faut d’abord concevoir un modèle de données (au sens de MERISE par exemple).
Cela permettra d’identifier les données nécessaires à définir, les tables qui permettrons de créer ces données, et les relations/contraintes/triggers entre les tables.

C’est justement une mauvaise idée, car tu vas devoir dupliquer des données. La gestion de la base va aussi être plus lourdes avec une fiabilité qui risque de ne pas être très bonne.

Mauvaise approche aussi. Il faut d’abord définir les données indépendamment du type. Le type est une donnée associée au type.

Un sujet de ce type ne peut pas se limiter à une simple table (ne serait qu’à cause du fait qu’un fichier peut avoir plusieurs tag de passages par exemple).

Dans un tableur, il risque d’y avoir une duplication des données (au sens de l’atomicité des données d’une BDD).

à part pour le chemin, le nom et le sha256sum, des dates, une source éventuelle, je ne vois pas trop.

Evidemment le maximum de donénes communes est préférable
Il faut donc, à mon avis, commencer par réfléchir aux tags par type, PUIS essayer de metrte en commun le maximum de tags, et voir ce qui es t possible et pas possible.

Personnellement, je ne fais pas les mêmes tags entre une photo (qui, où, quoi, temps de pose/ouverture/iso/… ) et une vidéo (quoi, quels moments, des images percutantes,…) ou un fichier latex et ses dépendances.

Pour certains types je vais jusqu’à utiliser des bashs/python pour « tagguer » , et souvent je place des copies en doubles,

  • par exemple des gpx sont classés par un bash dans des dossiers séparés, par latitude et longitude , et pourquoi le gpx a été fait ( suivi d’un bateau, déplacement en vacances, points d’intérêts ), ce qui ne m’empêche pas de faire une BD en sql.
  • par exemple mes photos sont taggués par 6 bashs différents et 4 php ; le tout dans 16 tables d’une BD sql.
  • mes texs sont placés dans une BD spéciale avec le texte pour une recherche de mots-clés

Nos besoins divergent ici, moi je veux tagger les mêmes choses : savoir que tel paragraphe (page, num-ligne-début, num-ligne-fin) de tel .pdf ou .odt parle de la même chose qu’on voit dans telle zone (x, y, width, height) d’une photo. C’est justement pour ça que j’ai besoin d’un système unifié de tags.

mais rien de ce que tu dis ne nécessite de faire plusieurs bases de données. Une seule suffit.

Je confirme les propos de @zargos: il suffit d’une ou plusieurs tables mises en relation. On commence par une table puis on monte en compétence avec une autre table mise en relation.
Il ne faut pas être plus royaliste que le roi et accepter de passer par les bases essentielles en s’appuyant sur un ouvrage de référence. Dunod propose de bons ouvrages sur le sujet par exemple. Les concepts relatifs aux bases de données sont simples à comprendre mais il n’y a pas de secret car seule la pratique permet d’assimiler et d’obtenir les réflexes essentiels. En parallèle on construit, on corrige ou on adapte éventuellement le cahier des charges définissant l’expression du besoin et qui demeure tout aussi indispensable. Sans cela on tourne vite en rond et on est sur d’être déçu. Une autre manière consiste à faire usage d’un produit clef en main mais malheureusement ils ont tous leurs limites et ce n’est pas pour rien que certains produits peuvent offrir la possibilité d’entrer ses propres requêtes SQL renvoyant alors à la première méthode.

1 J'aime

pour un besoin précis j’utilise Paperwork disponible dans les dépots.
ça fait l’OCR et tags mais c’est pas rapide.
Possibilité de gérer plusieurs « dépots » de fichiers

il faut que j’essaie paperless-ngx mais ça me semble lourd pour des besoins aussi simple que les miens