Skip to main content
Powered by ShareScore

Find research datasets worth reusing

Search datasets from major research repositories and use ShareScore to quickly assess how well each record supports discovery, access, and reuse.

73

datasets available to search

ShareScore release 0.9.0

Reset

Dataset results

73 results for “TEI”

Learn how ShareScore rates datasets ↗
zenodo52/100

List of TEI rolename annotations in the ISicily EpiDoc corpus

<p>This CSV file details every instance of a 'roleName' tag in the I.Sicily (sicily.classics.ox.ac.uk) EpiDoc TEI files, reporting the ID number of the file in which it appears, and the value of the @type and @subtype attributes in each case - as such it serves as an index of roleName attestations in the I.Sicily dataset (also recoverable directly from the EpiDoc files). The file will be updated in future.</p>

opencc-by-4.0Apr 2024View details →
zenodo48/100

simondschweitzer/aed-tei: AED-TEI Version 1.0

<ul> <li>Publication of more than 11000 Egyptian texts in the TEI format, and ... <ul> <li>TEI schema</li> <li>dictionary</li> <li>thesaurus</li> <li>morphological features</li> </ul> </li> <li>Project: AED - Ancient Egyptian Dictionary <a href="https://simondschweitzer.github.io/aed/">https://simondschweitzer.github.io/aed/</a></li> <li>License: CC-BY-SA-4.0</li> <li>Source: <a href="https://nbn-resolving.org/urn:nbn:de:kobv:b4-opus4-29190">https://nbn-resolving.org/urn:nbn:de:kobv:b4-opus4-29190</a></li> </ul>

opencc-by-sa-4.0Dec 2019View details →
zenodo48/100

Oráculo manual. Schopenhauer's marginalia (TEI-XML)

<p>XML-TEI file used in the project&nbsp;<em>Schopenhauer&#39;s Library.&nbsp;Annotations and marks in his Spanish books</em>&nbsp;<a href="http://schopenhauer.uni.wroc.pl">http://schopenhauer.uni.wroc.pl</a></p> <p>&nbsp;</p>

opencc-by-4.0Mar 2018View details →
zenodo44/100

TEI-XML Zürcher Stillstandsprotokolle des 17. Jahrhunderts

<p><strong>Projekt eStPZH</strong></p> <p>Die Stillstandsprotokolle&nbsp;wurden&nbsp;als Worddokumente seriell transkribiert und anschliessend als PDF gespeichert.&nbsp;Die Konvertierung der Beschl&uuml;sse in XML geschah mittels VBA-Makros.</p> <p>Siehe auch: <a href="https://archives-quickaccess.ch/search/stazh/stpzh">https://archives-quickaccess.ch/search/stazh/stpzh</a></p> <p><strong>Inhalt</strong></p> <p>Die Z&uuml;rcher Stillstandsprotokolle dokumentieren die T&auml;tigkeit der &auml;ltesten Aufsichtsbeh&ouml;rde der reformierten Kirchgemeinden, des so genannten Stillstands. Das Gremium ist so benannt, weil dessen Mitglieder nach dem Gottesdienst in der Kirche wortw&ouml;rtlich &quot;stillstanden&quot;, also stehen blieben, um monatlich unter dem Vorsitz des Pfarrers zu beraten. Der Stillstand rekrutierte sich &ndash; neben dem Pfarrer &ndash; aus ex officio in das Gremium bestellten Inhabern weltlicher &Auml;mter der Gemeinde sowie aus den von der Gemeinde gew&auml;hlten Ehegaumern. Der Stillstand war zugleich Kirchen-, Schul-, Armen- und Vormundschaftsbeh&ouml;rde, aber auch lokale Instanz in sittlichen Fragen. An einigen Orten &uuml;bernahm er zudem Funktionen der weltlichen Gemeindebeh&ouml;rden. Nach 1798 wurden seine Aufgabenbereiche auf rein kirchliche Angelegenheiten beschr&auml;nkt; sp&auml;ter wurde das Gremium durch die heutigen Kirchenpflegen ersetzt.<br> <br> Entsprechend den vielf&auml;ltigen Aufgaben des Stillstands dokumentieren die vom jeweiligen Pfarrer verfassten Protokolle die ganze Bandbreite des Alltags und des Zusammenlebens der Menschen im Gebiet des damaligen Stadtstaats Z&uuml;rich. Trotz ihrem hohen Quellenwert blieben die Z&uuml;rcher Stillstandsprotokolle lange weitgehend unerforscht, nicht zuletzt, weil es sich h&auml;ufig um eher fl&uuml;chtige, schwer lesbare Notizen in der individuellen Handschrift des Pfarrers handelt.<br> <br> Die fr&uuml;hesten Stillstandsprotokolle setzen 1631 in Br&uuml;tten und 1634 in Laufen ein, dann auf breiter Basis 1636/1637 in F&auml;llanden, Gossau, Hedingen, Kyburg, Laufen, Lindau und Stallikon, was mit einem entsprechenden Synodalbeschluss vom Mai 1636 zusammenh&auml;ngen mag, der in den Protokollen von Br&uuml;tten und F&auml;llanden angesprochen wird. Insgesamt sind (f&uuml;r unterschiedliche Zeitr&auml;ume) f&uuml;r 35 Kirchgemeinden Protokolle vorhanden.<br> &nbsp;</p> <p><strong>Technische Erschliessung</strong></p> <p>Die Konvertierung von Worddokumenten in TEI-konforme XML-Dateien geschah mittels eines VBA-Makros, welches gr&ouml;sstenteils mittels Mustererkennung die einzelnen Datenelemente voneinander abgrenzte.&nbsp;</p> <p>m&ouml;gliche Konvertierungsfehler:</p> <p>Insbesondere die Behandlung von eckigen Klammern f&uuml;r Textkommentare und Seitenumbr&uuml;che f&uuml;hrte bei der Unterscheidung zu einzelnen Konvertierungsproblemen.&nbsp;<br> Allenfalls k&ouml;nnte das in seltenen F&auml;llen noch zu fehlerhaften Dateien gef&uuml;hrt haben.</p> <p>Validierung:</p> <p>Alle Dateien sind gem&auml;ss TEI-Schema valide. Nicht valide xml-Dateien wurden manuell verbessert.</p> <p>XSL-Stylesheet:</p> <p>Das Stylesheet befindet sich im selben Ordner (&quot;Stylesheet.xsl&quot;) und ist mit leicht abweichendem, relativem Pfad eingebunden in den XML-Dateien (Zeile 2: &lt;?xml-stylesheet type=&quot;text/xsl&quot; href=&quot;../../Ressourcen/Stylesheet.xsl&quot;?&gt;).&nbsp;<br> Das Stylesheet erm&ouml;glicht eine Browseransicht, welche sich der originalen Transkription in Word ann&auml;hert.</p> <p><br> <strong>Urheberrecht</strong></p> <p>Die Daten stehen unter einer Creative Commons CC-BY-SA 4.0 Lizenz.</p> <p>Herausgeber: Staatsarchiv des Kantons Z&uuml;rich</p> <p>Technische Erschliessung: Rebekka Pl&uuml;ss, rebekka.pluess@ji.zh.ch&nbsp;</p> <p>Letztes Update: 14.08.2020</p>

opencc-by-sa-4.0Aug 2020View details →
zenodo44/100

XML Data for "Four Early Chan Texts from Dunhuang - A TEI-based Edition"

<p>This zip archive contains the XML data, schema,&nbsp;stylesheets, and associated material that are&nbsp;the basis for a print&nbsp;edition of 48 Dunhuang manuscript witnesses of four early Chan Buddhist texts. The print edition is:</p> <p>Marcus Bingenheimer 馬德偉, Chang Po-Yung 張伯雍 (eds.):&nbsp;<em>Four Early Chan Texts from Dunhuang &ndash; A TEI-based Edition</em>&nbsp;早期禪宗文獻四部 &mdash;&mdash; 以TEI標記重訂敦煌寫卷:楞伽師資記,傳法寶紀,修心要論,觀心論. Taipei: Shin Wen Feng 新文豐, 2018.<br> (Vol. 1: Facsimiles and Diplomatic Transcription 摹寫版 (ISBN: 978-957-17-2274-0), Vol. 2: Parallel, Punctuated and Annotated Edition 對照與點注版 (ISBN: 978-957-17-2275-7), Vol. 3: Calligraphy Practice 抄經版 (ISBN: &nbsp;978-957-17-2276-4).)</p> <p>See the included README.txt for further information.</p>

opencc-by-4.0Dec 2017View details →
zenodo44/100

Automatic TEI encoding of manuscripts catalogues with GROBID-Dictionaries

<p>Manuscript Sales Catalogues (MSC) are highly important for authenticating documents and studying the reception of authors. Their regular publication throughout Europe since the beginning of the 19th c. has consequently raised the interest around scaling up the means for automatically structuring their contents.&nbsp;</p> <p>Following successful first encoding tests with <em>GROBID-Dictionaries</em> on a single MSC collection, we aim in this paper to present the results of more advanced tests of the system&rsquo;s capacity to handle a larger corpus with MSC of different dealers, and therefore multiple layouts.&nbsp; Four different types of catalogues published between the middle of the 19th c. and the beginning of the 20th c. have been tested.</p>

opencc-by-4.0Sep 2019View details →
zenodo44/100

TEI-XML Zürcher Regierungsratsbeschlüsse 1803-1887

<p><strong>Projekt TKR</strong></p> <p>Zwischen 2003&ndash;2016 wurden die Protokollb&auml;nde des Regierungsrats und des Kantonsrats als Worddokumente seriell transkribiert und anschliessend in PDF und sp&auml;ter als OGD-Datens&auml;tze in TEI-XML konvertiert.<br>Die Dateien werden unter Ber&uuml;cksichtigung der gesetzlichen Schutzfristen laufend (max. 80 Jahre) publiziert.</p> <p>Siehe auch: <a href="https://archives-quickaccess.ch/search/stazh/rrb">https://archives-quickaccess.ch/search/stazh/rrb</a></p> <p><strong>Inhalt</strong></p> <p>Dieses Datenset beinhaltet die <strong>handschriftlich verfassten Regierungsratsbeschl&uuml;sse des Kantons Z&uuml;rich von 1803 bis 1887</strong>. Ab dem 1. Juli 1887 wurden die Regierungsratsbeschl&uuml;sse gedruckt.&nbsp;</p> <p>Die Beschl&uuml;sse des Regierungsrates geh&ouml;ren zu den zentralen Aktenserien des Kantons Z&uuml;rich.&nbsp;<br>In ihnen spiegelt sich ein &auml;usserst breites Spektrum an Themen, da der Regierungsrat nicht nur f&uuml;r grosse politische Entscheide, sondern oft auch f&uuml;r allt&auml;gliche Belange zust&auml;ndig war.&nbsp;<br>Neben Themen wie Auswanderung oder Aufnahme von politischen Fl&uuml;chtlingen, Bau von Eisenbahnen und Strassen oder Regulierung der stark ansteigenden Industrie besch&auml;ftigen den Regierungsrat stets auch Tagesgesch&auml;fte wie Konzessionsgesuche f&uuml;r Tavernen oder Wasserkraftanlagen, Steuerrekurse, Einb&uuml;rgerungen oder die Aufnahme von Kantonsfremden in kantonseigene Spit&auml;ler.<br>Die Metadaten eines Beschlusses (TEI/teiHeader) bestehen unter anderem aus dem K&uuml;rzel des/der Transkriptors/in, dem Transkriptionsdatum, der Signatur, dem Publikationsdatum, dem Titel des Beschlusses, dem Link zur Verzeichnung im Archivkatalog und dem Beschlussdatum.<br>Klassen und B&auml;nde bilden die hierarchische Ordnerstruktur.<br>Eine Klasse stellt jeweils den Zeitraum zwischen zwei politischen Umbr&uuml;chen dar:&nbsp;<br>Das Protokoll setzt 1803 mit der Bildung des modernen Kantons Z&uuml;rich ein, die erste Klasse schliesst mit der Annahme der neuen restaurativen Verfassung im Juni 1814.&nbsp;<br>Die dritte Klasse setzt mit der liberalen Verfassung von 1831 ein; der Bruch ist auch daran erkennbar, dass der &laquo;Kleine Rat&raquo; von nun an &laquo;Regierungsrat&raquo; genannt wird.&nbsp;<br>Mit dem konservativen &laquo;Z&uuml;riputsch&raquo; im September 1839 beginnt die vierte Klasse, welche 1849 mit einer gross angelegten Verwaltungsreform und der Integration des Kantons Z&uuml;rich in den neuen schweizerischen Bundesstaat schliesst.&nbsp;<br>Mit der demokratischen Verfassung von 1869 setzt die sechste und letzte Klasse ein, welche nicht durch ein politisches Ereignis, sondern durch die Umstellung auf das gedruckte Protokoll endet.&nbsp;<br>Dies entspricht auch der Struktur im Archivverzeichnis.</p> <p><strong>Technische Erschliessung</strong></p> <p>Die Konvertierung von Worddokumenten in TEI-konforme XML-Dateien geschah mittels eines Python-Scripts, welches mittels Mustererkennung die einzelnen Datenelemente voneinander abgrenzte.&nbsp;</p> <p>Validierung:</p> <p>Alle Dateien sind gem&auml;ss TEI-Schema valide. Nicht valide xml-Dateien wurden manuell verbessert.</p> <p>XSL-Stylesheet:</p> <p>Das Stylesheet befindet sich im Ordner Ressourcen ("\Ressourcen\Stylesheet.xsl") und ist mit relativem Pfad eingebunden in den XML-Dateien (Zeile 2: &lt;?xml-stylesheet type="text/xsl" href="../../Ressourcen/Stylesheet.xsl"?&gt;).&nbsp;<br>Das Stylesheet erm&ouml;glicht eine Browseransicht, welche sich der originalen Transkription in Word ann&auml;hert.</p> <p>Ab Version 3.0 wurden im ganzen Datensatz Eigennamen mittels maschinellem Lernen ausgezeichnet (vgl. <a href="https://github.com/machinelearningZH/named-entity-recognition_staatsarchiv">Github-Repository</a>&nbsp;zum Projekt).&nbsp;<em>Bitte beachten:&nbsp;</em>Die Auszeichnung wurde nicht manuell nachkontrolliert und kann Fehler enthalten!</p> <p><strong>Urheberrecht</strong></p> <p>Die Daten stehen unter einer Creative Commons CC-BY-SA 4.0 Lizenz.</p> <p>Herausgeber: Staatsarchiv des Kantons Z&uuml;rich</p> <p>Technische Erschliessung: Rebekka Pl&uuml;ss, rebekka.pluess@zh.ch&nbsp;</p> <p>Projektleiter TKR: Luzi Schutz</p>

opencc-by-sa-4.0Jun 2017View details →
zenodo44/100

Wikibooks-Korpus: Korpusquellen von deutschsprachigen Wikibooks im TEI-Format

<p>Das <a href="https://www.dwds.de/d/korpora/wikibooks">Wikibooks-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> enth&auml;lt Volltexte aus deutschsprachigen Lehr-, Fach- und Sachb&uuml;chern von <a href="https://de.wikibooks.org/wiki/Hauptseite">Wikibooks</a> der Wikimedia Foundation auf der Basis des <a href="https://dumps.wikimedia.org/dewikibooks/20250701/">Datenbank-Abzugs vom 1. 7. 2025</a>. Texte aus anderen Seitenarten (Diskussionen etc.) wurden nicht aufgenommen.</p> <p>Das Wikibooks-Korpus wurde nach dem Vorbild des <a href="https://www.dwds.de/d/korpora/wikipedia">Wikipedia-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> konzipiert. Es eignet sich damit insbesondere f&uuml;r die Recherche nach lexikographischen Belegen.</p> <p>Verf&uuml;gbar sind hier die Quellen des Wikibooks-Korpus auf <a href="http://www.dwds.de">dwds.de</a> im XML/TEI-Format als teiCorpus-Datei. Wie die originalen Wikibooks-Artikel stehen sie unter der Lizenz <a href="https://creativecommons.org/licenses/by-sa/4.0/">"Creative Commons Attribution/Share Alike"</a>.</p>

opencc-by-sa-4.0Jun 2023View details →
zenodo40/100

morethanbooks/XML-TEI-Bible: XML-TEI Bible: Entities and communication (66 Books)

<p>This release contains the biblical text in XML-TEI (66 books). The encoded text is in Spanish, but the codification (elements, attributes, values, ids) is in English. It makes explicit following information:</p> <ul> <li>Books, chapters, pericopes and verses.</li> <li>References to peoples, places, times, groups and books, using ids.</li> <li>Direct speech, including who is communicating, to whom and how (written, oral, prayer...).</li> </ul>

openother-openMay 2020View details →
zenodo40/100

Ancient Greek Literature for Advanced Data Processing: A Text Fabric Representation of Open Access Texts in TEI XML

<p>This data set contains a full conversion of Greek texts available in the Perseus Digital Library and the Open Greek and Latin Project to the Text Fabric data format. The main advantage of the Text Fabric datatype over the original TEI XML format is that it utilizes a strict separation of text and annotation in a flat data structure. At the same time, it permits multiple distinct formats of the same text as well as an unlimited depth of (embedded) annotations. Because of its flat data structure, it facilitates easy and clean procedures to analyze, transform, and enrich the available data. Many of these processes are very difficult to conduct while departing from the hierarchically organized XML tree representation.</p>

opencc-by-4.0Dec 2020View details →
zenodo40/100

TEI-XML-Datenset der Tagebücher, Briefe, Dokumente, Forschungsbeiträge, Chronologieeinträge und Register der edition humboldt digital

<p>Das Datenset enth&auml;lt alle edierten Texte (Tageb&uuml;cher, Briefe und weitere Dokumente) sowie Paratexte (Forschungsbeitr&auml;ge, Eintr&auml;ge der Chronologie zu Alexander von Humboldts Leben, Register und Glossar) der Version 11 der <a href="https://edition-humboldt.de">edition humboldt digital</a>, die am 4. Juni 2025 erschienen ist. Das Datenset enth&auml;lt gegen&uuml;ber der HTML-Version technische Fehlerkorrekturen, daher wird es als Version 11.0.1 ver&ouml;ffentlicht.</p> <p>Die Editionsrichtlinien stehen auf <a href="https://edition-humboldt.de/richtlinien/index.html">edition-humboldt.de</a> zur Vef&uuml;gung. Das Datenmodell ist in drei verschiedene ODDs aufgeteilt (f&uuml;r edierte Texte, Registereintr&auml;ge und Forschungsbeitr&auml;ge). Dem Datenset liegen die drei RNG-Schemata bei, die ODD-Ursprungsdateien sind im GitHub-Repository <a href="https://github.com/telota/ediarum.AVHR.data-model/">ediarum.AVHR.data-model</a> zu finden. Beachten Sie bitte, dass es f&uuml;r das Pflanzenregister derzeit noch kein Schema gibt, da dieses aus dem Tagging automatisch erstellt wird.</p> <p>Weitere Hinweise zur digitalen Methodik finden sich in <a href="https://edition-humboldt.de/H0016212">Dumont 2024</a> und zum Editionsvorhaben im Allgemeinen in <a href="https://doi.org/10.25365/wdr-01-03-02">Kraft/Dumont 2020</a>.</p> <p>Dieses Datenset ist auch auf <a href="https://github.com/telota/edition-humboldt-digital">GitHub</a> zug&auml;nglich.</p>

opencc-by-sa-4.0Jul 2023View details →
zenodo40/100

TEI-Schema für das Patristische Textarchiv (PTA)

This dataset contains the TEI-Schema and its documentation

opengpl-3.0Jun 2023View details →
zenodo40/100

TEI survey 2021

<p>This dataset comprises the processing scripts, processed files, and summary statistics from a survey of two million publicly available TEI files on GitHub. The survey was carried out between December 2020 &ndash; May 2021 with the motivation of examining real-world usage of the Text Encoding Initiative guidelines.</p> <p>Outputs include counts of TEI and non-TEI tag usage, TEI modules, and other namespaces, languages declared, and lists of filenames/repositories.</p> <p>The processed files are plain text and consist of the tag names used within the corresponding TEI XML file, separated by spaces. E.g. file 1000001.txt contains:</p> <p>?xml TEI teiHeader fileDesc titleStmt title publicationStmt idno idno availability p p ref p ref p ref notesStmt note sourceDesc biblFull titleStmt title author extent publicationStmt date pubPlace profileDesc creation date textClass keywords term text body div div head head p p p p p pb p p pb</p> <p>Files with the XML attributes as well are available on request, due to size limitations.</p> <p>&nbsp;</p>

opencc-by-4.0Feb 2022View details →
zenodo40/100

GRETIL - Göttingen Register of Electronic Texts in Indian Languages. TEI

<p>GRETIL - G&ouml;ttingen Register of Electronic Texts in Indian Languages. TEI</p>

opencc-by-4.0Apr 2022View details →
zenodo40/100

TEI-XML Encoding of Paris, Bibliothèque nationale de France, fonds français, 24432

<p><strong>Encoding Principles</strong></p> <p>Material divisions within the codex have been marked, with <span>&lt;gb&gt;</span>, <span>&lt;pb&gt;</span>, <span>&lt;cb&gt;</span>, and <span>&lt;lb&gt;</span> tags indicating the beginning of a new quire, folio, column, and line respectively, while <span>&lt;handShift&gt;</span> is used to mark the beginning of a section of work by a particular scribe. Individual texts, and their <em>incipit</em> and <em>explicit</em> markings have been separated through use of the <span>&lt;div&gt;</span> tag, with sections of prose marked using <span>&lt;p&gt;</span>, and sections of poetry marked using <span>&lt;lg&gt;</span>, with individual lines of verse tagged using <span>&lt;l&gt;</span>. When a text is dialogic in form, this is marked using <span>&lt;spGrp&gt;</span>, with contributions by individual speakers marked using <span>&lt;sp&gt;</span>. Direct speech within non-dialogic text has been marked with <span>&lt;q&gt;</span> where such details are pertinent to our analysis.</p> <p>Labels, marginal notes, catchwords, highlighted sections, moments of damage, gaps in text, and blank spaces are marked using <span>&lt;label&gt;</span>, <span>&lt;note&gt;</span>, <span>&lt;fw&gt;</span>, <span>&lt;hi&gt;</span>, <span>&lt;damage&gt;</span>, <span>&lt;gap&gt;</span>, and <span>&lt;space&gt;</span> respectively, while the table of contents is encoded as a table using the <span>&lt;table&gt;</span>, <span>&lt;cell&gt;</span>, and <span>&lt;row&gt;</span> tags.</p> <p>Within the text of the encoding, expansions of scribal abbreviation, additions and deletions by scribal or later hands, as well as editorial regularisations, corrections, suppressions and insertions have been encoded using the <span>&lt;expan&gt;</span>, <span>&lt;add&gt;</span>,<span>&lt;del&gt;</span>, <span>&lt;reg&gt;</span>, <span>&lt;corr&gt;</span>, <span>&lt;surplus&gt;</span>, and <span>&lt;supplied&gt;</span> elements respectively, alongside the unexpanded, unregularised and uncorrected version of the text, through the <span>&lt;abbr&gt;</span>, <span>&lt;orig&gt;</span>, and <span>&lt;sic&gt;</span> elements respectively. Where more than one variant of the same segment of text has been encoded, for example in cases of expanded abbreviation and regularisation, the variants have been contained within a <span>&lt;choice&gt;</span> tag. Again, where such details have been pertinent to our analysis, personal names, geographic names, dates, and numbers have been encoded within <span>&lt;persName&gt;</span>, <span>&lt;placeName&gt;</span>, <span>&lt;date&gt;</span> and <span>&lt;num&gt;</span> elements.</p>

opencc-by-4.0Jun 2024View details →
zenodo40/100

《國臺對照活用辭典》XML-TEI

<p>《國臺對照活用辭典》(Mandarin-Taiwanese Dictionary) by 吳守禮</p> <p>(re-)digitization and conversion to XML-TEI by 阿石 (Pierre Magistry)<br> <br> In collaboration with Wikimedia Taiwan and g0v.tw</p> <p>See https://meta.wikimedia.org/wiki/Wikimedia_Taiwan/OpenWuDict<br> <br> Alpha version (trying Zenodo), contact Pierre Magistry for de</p> <p>&nbsp;</p> <p>https://meta.wikimedia.org/wiki/Wikimedia_Taiwan/OpenWuDict</p>

opencc-by-sa-4.0Jul 2018View details →
zenodo40/100

TEI-XML Zürcher Gesetzessammlung seit 1803

<p><strong>Projekt</strong></p> <p>Das Staatsarchiv des Kantons Z&uuml;rich hat s&auml;mtliche Erlasse der Z&uuml;rcher Gesetzessammlung von 1803-1998 als kontrollierten Volltext in Worddokumenten aufbereitet und anschliessend als PDF publiziert. Zus&auml;tzlich wurden diese Texte nun in TEI-XML konvertiert und als Open Government Data (OGD) online zur Verf&uuml;gung gestellt.</p> <p>Siehe auch: <a href="https://archives-quickaccess.ch/search/stazh/os">https://archives-quickaccess.ch/search/stazh/os</a></p> <p><strong>Inhalt</strong></p> <p>Die "Offizielle Sammlung der Gesetze, Beschl&uuml;sse und Verordnungen des Eidgen&ouml;ssischen Standes Z&uuml;rich" (OS) ist die Publikationsreihe f&uuml;r das kantonale Recht. S&auml;mtliche Erlasse und rechtsetzenden Vereinbarungen sowie deren Inkraftsetzung, &Auml;nderung oder Aufhebung werden darin in chronologischer Reihenfolge ver&ouml;ffentlicht.</p> <p>Die erste Offizielle Gesetzessammlung wurde in der Mediationszeit 1803 begonnen (heute als OS AF f&uuml;r "Alte Folge" bezeichnet). Nach sechs B&auml;nden stellte man dieses Werk zu Beginn der Restauration 1814 ein; an seine Stelle trat eine "Neue Folge" (OS NF), die sich in den folgenden vier B&auml;nden wieder st&auml;rker an den alten Zust&auml;nden orientierte. Dieses Unterfangen wurde seinerseits durch die liberale Verfassung vom 10. M&auml;rz 1831 abgel&ouml;st. Die damals neu begr&uuml;ndete Reihe wird bis heute fortgef&uuml;hrt (zitiert als OS).</p> <p>Fehlende oder bis dahin lediglich im Amtsblatt publizierte Erlasse wurden 1883 und 1888 in zwei Supplementb&auml;nden publiziert (OS 20, Suppl. 1 und 2). Mit der Herausgabe der systematisch geordneten Gesetzessammlung 1981 erhielten s&auml;mtliche noch g&uuml;ltigen Erlasse eine Ordnungsnummer. Diese bestimmt die systematische Einreihung innerhalb der seit 1993 st&auml;ndig aktualisierten Loseblattsammlung (LS).</p> <p>Seit 1999 publiziert die Staatskanzlei die LS und OS auch online (<a href="https://www.zh.ch/de/politik-staat/gesetze-beschluesse/gesetzessammlung.html#zhlex">https://www.zh.ch/de/politik-staat/gesetze-beschluesse/gesetzessammlung.html#zhlex</a>).</p> <p>Das Datenset umfasst s&auml;mtliche Erlasse von 1803 bis 1998. Jeder Erlass bildet eine XML-Datei. Insgesamt handelt es sich um knapp 10'000 Erlasse bzw. Dateien.</p> <p>Die Metadaten eines Beschlusses (TEI/teiHeader) bestehen unter anderem aus dem Erlasstitel, dem Erlassdatum, der Bandnummer und der Seitenzahl (Signatur) sowie der ab 1981 vorhandenen Ordnungsnummer. Zus&auml;tzlich ist auch das K&uuml;rzel des/der Transkriptors/in und das Transkriptionsdatum vermerkt. Mit dieser neuen Version 2 sind auch Verlinkungen/Bez&uuml;ge zu anderen Beschl&uuml;ssen in den Metadaten vermerkt.</p> <p>Die "Alte Folge" (OS AF) umfasst den Zeitraum der Mediation von 1803 bis Juni 1814, die "Neue Folge" (OS NF) die Jahre der Restauration von Juni 1814 bis 1831. Die heute noch fortgesetzte Folge (OS) beginnt mit der liberalen Verfassung vom 10. M&auml;rz 1831. Der Datensatz endet bei der Umstellung der gedruckten B&auml;nde auf die Online-Publikation am Jahreswechsel 1998/1999.</p> <p>Dies entspricht auch der Struktur im Archivverzeichnis.</p> <p><strong>Technische Erschliessung</strong></p> <p>Die Konvertierung von Worddokumenten in TEI-konforme XML-Dateien geschah mittels eines VBA-Makros, welches gr&ouml;sstenteils mittels Mustererkennung und Formatierungen in Word die einzelnen Datenelemente voneinander abgrenzte.</p> <p>m&ouml;gliche Konvertierungsfehler:</p> <p>Insbesondere die Behandlung von komplexeren Tabellen und Formeln mit Sonderzeichen f&uuml;hrte zu einzelnen Konvertierungsproblemen.</p> <p>Allenfalls k&ouml;nnte das in seltenen F&auml;llen noch zu Fehlern gef&uuml;hrt haben.</p> <p>Validierung:</p> <p>Alle Dateien sind gem&auml;ss TEI-Schema valide. Nicht valide xml-Dateien wurden manuell verbessert.</p> <p>XSL-Stylesheet:</p> <p>Das Stylesheet befindet sich im Ordner Ressourcen ("\Ressourcen\Stylesheet.xsl") und ist mit relativem Pfad eingebunden in den XML-Dateien (Zeile 2: &lt;?xml-stylesheet type="text/xsl" href="../../Ressourcen/Stylesheet.xsl"?&gt;).</p> <p>Das Stylesheet erm&ouml;glicht eine Browseransicht, welche sich der originalen Transkription in Word ann&auml;hert.</p> <p>Ab Version 4.0 wurden im ganzen Datensatz Eigennamen mittels maschinellem Lernen ausgezeichnet (vgl. <a href="https://github.com/machinelearningZH/named-entity-recognition_staatsarchiv">Github-Repository</a>&nbsp;zum Projekt).&nbsp;<em>Bitte beachten:&nbsp;</em>Die Auszeichnung wurde nicht manuell nachkontrolliert und kann Fehler enthalten!</p> <p><strong>Urheberrecht</strong></p> <p>Die Daten stehen unter einer Creative Commons CC-BY-SA 4.0 Lizenz.</p> <p>Herausgeber: Staatsarchiv des Kantons Z&uuml;rich</p> <p>Technische Erschliessung: Rebekka Pl&uuml;ss, rebekka.pluess@zh.ch</p> <p>Projektleiter Aufbereitung Gesetzessammlung: Rainer Hugener, rainer.hugener@ji.zh.ch</p>

opencc-by-4.0Apr 2022View details →
zenodo40/100

Tests for the TEI-CAT

<p>Test for the <a href="http://teicat.huma-num.fr">TEI Critical Apparatus Toolbox</a>, along with their outcome and summaries. They are related to an article to be published in <a href="https://ride.i-d-e.de/issues/">RIDE 14</a>.</p>

opencc-by-4.0Aug 2021View details →
zenodo36/100

The TEI, Its Foundations and Impact, and How It Fits Into Today's Needs and Practices for Language Analysis

<p>6<sup>th</sup> Lecture</p>

opencc-by-4.0Jul 2018View details →
zenodo36/100

TEI-XML Zürcher Amtsblatt 1954-2001

<p><strong>Projekt Amtsblatt</strong></p> <p>Im laufenden Projekt Amtsblatt (Start 2022) wird als vierte Serie der Zentralen Serien des Kantons Z&uuml;rch (19. und 20. Jahrhundert) das Amtsblatt zur Online-Publikation im Volltext aufbereitet.&nbsp;&nbsp;Die Jahrg&auml;nge werden dabei ab 2001 chronologisch r&uuml;ckw&auml;rts tranchenweise publiziert. Dieser Datensatz umfasst die Jahrg&auml;nge 1954-2001.</p> <p><strong>Inhalt</strong></p> <p>Das Amtsblatt ist das Publikationsorgan f&uuml;r amtliche Mitteilungen der &ouml;ffentlichen Organe des Kantons Z&uuml;rich. Es wurde im Zuge der liberalen Kantonsverfassung von 1831 eingef&uuml;hrt. W&auml;hrend der ersten Jahrzehnte waren s&auml;mtliche Mitteilungen von verschiedenen eidgen&ouml;ssischen, kantonalen, Bezirks- oder Gemeindebeh&ouml;rden gemischt, 1879 wurde der sogenannte Inseratenteil vom Textteil mit den gesetzlichen Bekanntmachungen getrennt.</p> <p>Als Informationskanal f&uuml;r die B&uuml;rger und B&uuml;rgerinnen gedacht, musste das Amtsblatt bis zur Verlagerung ins Internet in s&auml;mtlichen z&uuml;rcherischen Gastst&auml;tten ausgelegt werden. Es erschien zun&auml;chst zweimal pro Woche und ab 1995 nur noch einmal pro Woche. Ab 2002 ver&ouml;ffentlichte die Staatskanzlei das Amtsblatt zus&auml;tzlich zur gedruckten Ausgabe auch elektronisch. Seit 2018 werden die Meldungen nur noch <a href="https://www.amtsblatt.zh.ch/#!/gazette"><u>online</u></a> publiziert. Die Einzelheiten regeln das Publikationsgesetz (LS 170.5) und die Publikationsverordnung (LS 170.51).</p> <p>F&uuml;r die Online-Publikation aufbereitet wird ausschliesslich der f&uuml;r den politischen Entscheidungsfindungs- und Gesetzgebungsprozess relevante Textteil; die Anzeigen des Inseratenteils (ab 1903 im Zeitungsformat) m&uuml;ssen im fraglichen Zeitraum weiterhin vor Ort im Staatsarchiv konsultiert werden.</p> <p>Weiterf&uuml;hrende Informationen finden sich im <a href="https://suche.staatsarchiv.djiktzh.ch/detail.aspx?id=4546621">Online-Archivkatalog</a>.&nbsp;</p> <p><strong>Technische Erschliessung</strong></p> <p>Die Amtsblatt-B&auml;nde werden direkt in TEI-XML mit einem Tool der Firma Acodis (Winterthur) aufbereitet und danach mit einem vom Staatsarchiv entwickelten Skript in die einzelnen Meldungen segmentiert.&nbsp;</p> <p>Ab Version 2.0 wurden im ganzen Datensatz Eigennamen mittels maschinellem Lernen ausgezeichnet (vgl. <a href="https://github.com/machinelearningZH/named-entity-recognition_staatsarchiv">Github-Repository</a>&nbsp;zum Projekt).&nbsp;<em>Bitte beachten:&nbsp;</em>Die Auszeichnung wurde nicht manuell nachkontrolliert und kann Fehler enthalten!</p> <p><strong>Urheberrecht</strong></p> <p>Die Daten stehen unter einer Creative Commons CC-BY-SA 4.0 Lizenz.</p> <p>Herausgeber: Staatsarchiv des Kantons Z&uuml;rich</p> <p>Projektleiter Projekt Amtsblatt: Rainer Hugener, rainer.hugener@ji.zh.ch</p>

opencc-by-4.0Aug 2024View details →

ScienceDex guides

Understand access before you commit

These curated guides explain access requirements, typical timelines, costs, and reuse considerations for widely used research datasets.

Compare curated datasets

Allen Brain Atlas

Allen Brain Atlas is an Allen Institute collection of brain map atlases, datasets, APIs, and analysis tools covering mouse, human, and non-human primate brain resources.

allen-brain-atlas
neuroscienceopenDocumentation, web resources, and API references are available online.
Last verified 2026-04-30Open record

Annotated Behaviour and Observability Dataset (ABODe)

ABODe is a University of Edinburgh DataShare dataset for behavior classification in group-housed mice using home-cage video, identities, bounding boxes, ground-plate positions, and annotator labels.

abode-home-cage
behavioral-neuroscienceopenThe DataShare record exposes download links for annotations, documentation, license text, and the zipped per-snippet data directory.
Last verified 2026-04-30Open record

DANDI Archive for NWB datasets

DANDI is a BRAIN Initiative archive for publishing and sharing neurophysiology data, including electrophysiology, optophysiology, and behavioral data packaged as NWB and related standards.

dandi-nwb
electrophysiologyopenPublished Dandiset metadata and archive endpoints are available through the production DANDI API.
Last verified 2026-04-30Open record

International Brain Laboratory public data

The International Brain Laboratory public data releases expose standardized mouse decision-making experiments, including Neuropixels recordings, widefield calcium imaging, behavior, and session metadata accessed through the ONE API.

ibl
behavioral-neuroscienceopenPublic sessions can be searched and loaded from the IBL public data server through ONE.
Last verified 2026-04-29Open record

OpenNeuro

OpenNeuro is a free, open platform for sharing neuroimaging datasets, with public search, dataset pages, and download paths for web, S3, DataLad, and the OpenNeuro CLI.

openneuro
neuroscienceopenPublished datasets are available on demand over the internet.
Last verified 2026-04-29Open record