Changes for new-corrections/add-Sineux-Rouille-notes/readme.md: 21 added lines, 0 removed lines.
Original line number
Diff line number
Diff line
# Quelles étapes reste-t-il pour ajouter les notes manuscrites du Rouillé de Pierre Sineux au XML ?
### 1 - Vérifications codicologiques
* S'agit-il bien exactement de la même édition ?
***Si oui**, pas besoin de se poser de questions, les notes pourront aller dans le même fichier et on peut ajouter dans `//bibl[att.xml:id='temoin']/att.corresp` une espace puis le lien vers la notice du scd d'UniCaen. **Sinon**, vérifier si le texte imprimé auquel se réfèrent les notes est identique à notre version éditée. Si c'est le cas, on peut procéder pareil. Si les changements sont minimes, on peut procéder comme pour Morisse avec des `<quote>` pour préciser le texte exact en début de note.
***Autrement** : Si ce n'est pas la même édition exactement et que le texte diffère, on devra procéder comme pour le Morisse : un fichier à part, et on transcrit aussi le texte référé (à quelle échelle ? à décider).
***Déterminer les différentes mains** et potentiellement créer un identifiant pour chaque (quitte à écrire "hand1" etc) pour différencier les notes. Il faudra aussi déclarer ces mains (cf plus loin).
### 2 - Terminer la transcription
* Si la collection a un problème sur Transkribus, les données actuelles sont inclues dans ce dossier au format Transkribus. Il faudra redonner à Transkribus ce dossier.
* Terminer la transcription sur Transkribus.
* Vérifier les lignes et leur ordre, enlever toutes les lignes inutiles, refaire les identifiants (onglet Layout, bouton "Assign unique IDs to all elements according to their current sorting".
### 3 - Exporter la transcription
* "Export document" (barre du haut)
* Dans la fenêtre d'export, prenez l'onglet "Client export" tout en haut, choisissez un chemin local pour l'export et un nom pour le dossier qui sera créé.
* Colonne de gauche ("choose export formats") : cochez *uniquement*`TEI`.
* Colonne du milieu ("Export options") : cochez `Zone per region`, `Zone per line`, `Use bounding box coordinates` et `Line tags (<l>...</l>)`.
* Ok.
### 4 - Convertir la sortie TEI-Transkribus en TEI-ConDÉ.
Changes for new-corrections/lemmatize-latin-text/readme.md: 30 added lines, 0 removed lines.
Original line number
Diff line number
Diff line
# Comment lemmatiser les textes latins
### 1 - Vérifications d'équipe
* S'assurer qu'on est le⋅a seul⋅e à travailler sur ce fichier, qu'on travaille sur la version la plus récente ([branche ameliorations du corpus](https://github.com/RIN-ConDE/editions/tree/ameliorations)) et que personne n'a de modifications à ajouter.
* Informer tout le monde qu'on s'apprête à travailler sur un témoin et qu'on doit être le⋅a seul⋅e à le modifier pendant ce temps.
* Git clone/pull sur la branche ameliorations du corpus.
### 2 - Marquer les emplacements du texte latin
* Il faut **manuellement repérer** tous les fragments latins. Certains sont déjà marqués (dans le Rouillé, les notes latines étaient clairement distinctes et ont été marquées avec un `att.xml:lang="la"`, mais il peut y avoir des fragments latins dans le texte français non repérés) mais la plupart ne le sont pas.
* On peut s'aider des informations de lemmatisation quand un `//w/att.pos='Xe'`.
* Si le fragment est une note entière ou un paragraphe entier, ou correspond entièrement à un élément structurel déjà présent, il faut ajouter un attribut `att.xml:lang="la"` à cet élément structurel.
* Si le fragment ne correspond pas exactement à un tel élément structurel, il faut ajouter un élément `<seg>` avec un attribut `att.xml:lang="la"`.
### 3 - Revoir la tokenisation
* Une fois tous les mots bien retokénisés, il faut refaire la numérotation de tous les tokens. Pour cela, on utilise le script `re-id_tokens.ipynb` sur Jupyter Notebook.
### 4 - Lemmatisation etc
* À décider : le jeu d'étiquettes utilisé. Il devra être déclaré dans le `/TEI/teiHeader/encodingDesc` en français et en anglais.
* Si on lemmatise à la main, cela se fait sur le modèle des autres témoins : un attribut lemma pour le lemme, un attribut pos pour les catégories grammaticales.
* Si on le souhaite, on peut faire une lemmatisation automatique.
* Le script `extraction_tokens.ipynb` permet de sortir les mots-formes et leurs numéros en tableau CSV.
* Le script `resync_tokens.ipynb` permet de donner aux tokens du XML les POS et lemmes déduits par le lemmatiseur. Attention à ce que les mots soient tous bien alignés avec leurs numéros et que rien ne soit décalé. Ce script est fait pour produire un fichier séparé en sortie, pour pouvoir faire les vérifications sans toucher au fichier d'origine. Donc si les modifications conviennent, on peut remplacer l'élément `<text>` de l'ancien par celui du nouveau.
### 5 - Déclarer les modifications
* Il faut ajouter un élément `/TEI/revisionDesc/listChanges/change` (cf [doc. TEI](https://www.tei-c.org/release/doc/tei-p5-doc/en/html/HD.html#HD6)) dans chaque fichier modifié pour décrire les changements opérés.
* Il faut se déclarer comme contributeurice : si on est déjà déclaré dans un `/TEI/teiHeader/fileDesc/editionStmt/respStmt/resp`, il faut mettre à jour les textes français/anglais décrivant nos rôles. Sinon, on se crée un élément `<resp>` à cet endroit sur le modèle des personnes déjà déclarées.
### 6 - Mettre la nouvelle version du fichier sur GitHub
* Si vous maîtrisez Git, vous pouvez faire un git push *sur la branche ameliorations*.
* Sinon, contactez l'équipe du projet pour que le nouveau fichier soit vérifié et changé.