Jeu de données de segmentation non normalisée- castillan médiéval
<p>Jeu de données de segmentation/tokénisation sur un corpus non régularisé en sortie d'HTR/OCR. Castillan médiéval (15e siècle); manuscrit (deux témoins,55%) et incunable (un témoin, 45%). Les normes de segmentation sont celles du castillan actuel.</p> <p>Le jeu de données fait environ 37.000 lignes pour l'instant. Il est produit à partir de mon corpus de thèse.</p> <p>Le corpus provient de deux manuscrits et d'un incunable qui contiennent le <em>Regimiento de los prínçipes</em>.</p> <ul> <li><code>Val_S</code>: Ms. 251, Universidad de Valladolid. Fols 1r-27r et 175r-197v.</li> <li><code>Sev_Z</code>: Inc/901, Bibliothèque Nationale d'Espagne. Fols 1r-114r et 153r-249v.</li> <li><code>Mad_A</code>: Inv. 15304, Bibliothèque de la Fundación Lázaro Galdiano, fols. 237v-274v.</li> <li><code>Sal_L</code>: Ms 2709, Bibliothèque Universitaire de Salamanque, fols. 365r-391r.</li> </ul> <p>Le corpus peut difficilement servir pour l'étude du texte. Les changements de folio ne sont pas toujours indiqués; certaines lignes trop mal transcrites ont été supprimées.</p> <p>Citer le corpus</p> <p>Merci de citer ma thèse de doctorat si vous utilisez ce corpus:</p> <blockquote> <p>Matthias Gille Levenson, La version B du <em>Regimiento de los prínçipes</em> glosé (1374-1494) : étude et éditions de la partie sur le gouvernement de la cité par temps de guerre (III,3), thèse de doctorat en préparation sous la direction de Carlos Heusch et de Jesús R. Velasco</p> </blockquote>
ShareScore
36/100
Overall dataset sharing score
Score breakdown
These five areas show where the dataset supports — or may limit — practical reuse.
- Stewardship
- 8
- Harmonization
- 4
- Access
- 12
- Reuse readiness
- 8
- Engagement
- 4