Skip to main content
Powered by ShareScore

Find research datasets worth reusing

Search datasets from major research repositories and use ShareScore to quickly assess how well each record supports discovery, access, and reuse.

21

datasets available to search

ShareScore release 0.9.0

Reset

Dataset results

21 results for “Korpus”

Learn how ShareScore rates datasets ↗
zenodo44/100

Intimes Sprechen im Spanischen Chiles - Korpus

<p>Der vorliegende Datensatz enth&auml;lt ein Sprachdatenkorpus &sbquo;intimen Sprechens&lsquo; aus dem Spanischen Chiles, das im Rahmen des Dissertationsvorhabens der Autorin mit dem Titel &bdquo;&sbquo;Intimes Sprechen&lsquo; als sprachliches Register &ndash; Eine Neukonzeption des z&auml;rtlichen Sprechens, untersucht an einem Korpus aus dem chilenischen Spanisch&lsquo; vom 14.01.2016 bis zum 24.04.2016 erhoben wurde. Das Korpus enth&auml;lt insgesamt 6298 &Auml;u&szlig;erungen von 617 Personen. Die Dissertationsschrift wurde an der Christian-Albrechts-Universit&auml;t zu Kiel unter der Betreuung von Prof. Dr. Elmar Eggert und Prof. Dr. Bettina Kluge erstellt, am 12.03.2020 eingereicht und am 19.06.2020 erfolgreich verteidigt. Eine Verlagspublikation erfolgte 2022 unter dem Titel &quot;Intimit&auml;t in der Sprache. Eine Neukonzeption des z&auml;rtlichen Sprechens am Beispiel des chilenischen Spanisch&quot; bei De Gruyter.</p> <p>F&uuml;r die Erstellung des Korpus wurden internetbasierte Discourse Completion Tasks (DCTs) genutzt, bei denen den TeilnehmerInnen verschiedene Fotos pr&auml;sentiert wurden und sie daraufhin gebeten wurden, niederzuschreiben, was sie in der betreffenden Situation sagen w&uuml;rden. Die DCTs wurden um Fragen zu soziodemographischen Merkmalen der TeilnehmerInnen und offene Fragen nach typischen Merkmalen &sbquo;intimen Sprechens&lsquo; (einerseits nonverbaler, andererseits verbaler Art) erg&auml;nzt. F&uuml;r die Online-Implementierung des Erhebungsinstruments wurde die kostenlose Software SoSci Survey (soscisurvey.de) genutzt. Da das Erhebungsinstrument urheberrechtlich gesch&uuml;tzte Fotos enth&auml;lt, ist es lediglich auf Anfrage bei der Autorin einzusehen. Ausf&uuml;hrliche Beschreibungen zur Erhebungsmethode, zum Aufbau des Erhebungsinstruments, zur Durchf&uuml;hrung der Erhebung sowie zu R&uuml;cklauf und Repr&auml;sentativit&auml;t der Daten finden sich in der erw&auml;hnten Dissertationsschrift.</p>

opencc-by-4.0Dec 2020View details →
zenodo44/100

DiBiLit-Korpus

<p>English:</p> <p>The DiBiLit corpus was created by homogenising various derivatives of texts from the &raquo;Digital Library&laquo; &ndash; originally published by DirectMedia Publishing &ndash; and extensively enriching them with (bibliographic) metadata within the collaborative project CLARIAH-DE at the BBAW. The more than 2,000 texts come from renowned authors, are DTABf-encoded and were made accessible under a CC-BY-SA 4.0 license within the DTA infrastructure. Thus, the text collection can be researched using the DDC search engine integrated in the DTA as well as other DTA tools for linguistic analysis. Further tools/services for text analysis are available, for instance via the link to the Language Resource Switchboard (LRS).</p> <p>German:</p> <p>Das DiBiLit-Korpus entstand durch die Homogenisierung verschiedener Derivate von Texten aus der &raquo;Digitalen Bibliothek&laquo; &ndash; urspr&uuml;nglich von DirectMedia Publishing ver&ouml;ffentlicht &ndash; sowie die umf&auml;ngliche Anreicherung durch (bibliographische) Metadaten im Rahmen des Verbundprojekts CLARIAH-DE an der BBAW . Die mehr als 2.000 Texte stammen von namhaften Autorinnen und Autoren, sie sind DTABf-kodiert und wurden innerhalb der DTA-Infrastruktur unter einer CC BY-SA 4.0 Lizenz zug&auml;nglich gemacht. So kann die Textsammlung mittels der im DTA integrierten DDC-Suchmaschine sowie weiterer DTA-Werkzeuge zur linguistischen Analyse beforscht werden. Weitere Werkzeuge/Dienste zur Textanalyse stehen &uuml;ber die Verkn&uuml;pfung bspw. mit dem Language Ressource Switchboard (LRS) zur Verf&uuml;gung.</p>

opencc-by-4.0Nov 2021View details →
zenodo44/100

Data dan R Markdown Notebook untuk "PENONJOLAN PERAN SEMANTIS DAN KONSTRUKSI GRAMATIKAL PASANGAN VERBA -I DAN -KAN: KAJIAN GRAMATIKA KONSTRUKSIONAL BERBASIS KORPUS ATAS MENAWARI/MENAWARKAN"

<p>Repositori <a href="https://r4ds.had.co.nz/workflow-projects.html">RStudio Project</a> yang mengandung data dan kode pemrograman R untuk analisis data dan penulisan makalah berjudul <strong>&quot;Penonjolan Peran Semantis dan Konstruksi Gramatikal Pasangan Verba -<em>i</em> dan -<em>kan</em>: Kajian Gramatika Konstruksional Berbasis Korpus atas <em>Menawari</em>/<em>Menawarkan</em>&quot;</strong>. Makalah ini diterbitkan pada jurnal <a href="https://ojs.linguistik-indonesia.org/index.php/linguistik_indonesia/index"><em>Linguistik Indonesia</em></a> di bulan Agustus, 2023.</p> <ol> <li> <p>Kode pemrograman R dan narasi teks makalah terintegrasi dalam berkas <a href="https://rmarkdown.rstudio.com">R Markdown</a> Notebook dengan nama <a href="https://github.com/gederajeg/profiled-participant-roles/blob/main/manuskrip-2.Rmd"><code>manuskrip-2.Rmd</code></a>.</p> </li> <li> <p>Data konkordansi terdapat pada berkas <a href="https://github.com/gederajeg/profiled-participant-roles/blob/main/menawari.txt"><code>menawari.txt</code></a> dan <a href="https://github.com/gederajeg/profiled-participant-roles/blob/main/menawarkan.txt"><code>menawarkan.txt</code></a>.</p> </li> <li> <p>Luaran visualisasi tersimpan pada direktori <a href="https://github.com/gederajeg/profiled-participant-roles/tree/main/plots"><code>plot</code></a>.</p> </li> </ol>

opencc-by-sa-4.0Dec 2022View details →
zenodo44/100

Wikibooks-Korpus: Korpusquellen von deutschsprachigen Wikibooks im TEI-Format

<p>Das <a href="https://www.dwds.de/d/korpora/wikibooks">Wikibooks-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> enth&auml;lt Volltexte aus deutschsprachigen Lehr-, Fach- und Sachb&uuml;chern von <a href="https://de.wikibooks.org/wiki/Hauptseite">Wikibooks</a> der Wikimedia Foundation auf der Basis des <a href="https://dumps.wikimedia.org/dewikibooks/20250701/">Datenbank-Abzugs vom 1. 7. 2025</a>. Texte aus anderen Seitenarten (Diskussionen etc.) wurden nicht aufgenommen.</p> <p>Das Wikibooks-Korpus wurde nach dem Vorbild des <a href="https://www.dwds.de/d/korpora/wikipedia">Wikipedia-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> konzipiert. Es eignet sich damit insbesondere f&uuml;r die Recherche nach lexikographischen Belegen.</p> <p>Verf&uuml;gbar sind hier die Quellen des Wikibooks-Korpus auf <a href="http://www.dwds.de">dwds.de</a> im XML/TEI-Format als teiCorpus-Datei. Wie die originalen Wikibooks-Artikel stehen sie unter der Lizenz <a href="https://creativecommons.org/licenses/by-sa/4.0/">"Creative Commons Attribution/Share Alike"</a>.</p>

opencc-by-sa-4.0Jun 2023View details →
zenodo40/100

Reichstagsprotokoll-Korpus

<p>Das Reichstagsprotokoll-Korpus umfasst die publizierten Protokolle, Stenographischen Berichte, Anlagen sowie Handbücher des Deutschen Reichstages und seiner Vorläufer von 1867–1942.</p><p>Die Bilddigitalisierung und anschließende automatische Volltextdigitalisierung (OCR) wurde von der Bayerischen Staatsbibliothek im Rahmen eines DFG-Projektes von 1997 bis 2009 durchgeführt. Die Kuration, Konvertierung sowie Bereitstellung im DTA-Basisformat wurde vom Arbeitsbereich "Historische Korpora" des Zentrums für digitale Lexikographie der deutschen Sprache (ZDL) vorgenommen. Ein Korrektur von OCR-Fehlern wurde nicht vorgenommen.</p>

opencc-by-4.0Nov 2023View details →
zenodo40/100

Narratologische Annotationen des Korpus' "Erzählen über Konflikte"

<p>Annotations of the project "Erzählen über Konflikte" in xml-format as provided by CATMA-export (cf. www.catma.de).</p>

opencc-by-sa-4.0Aug 2013View details →
zenodo40/100

VerbInd: Pangkalan data verba bahasa Indonesia berbasis korpus

<p><strong>UPDATE</strong></p> <p>Periksa dan unduh <a title="VerbInd v1.0.0" href="https://github.com/gederajeg/database-verba-bahasa-indonesia/releases/tag/1.0.0" target="_blank" rel="noopener">pembaruan repositori ini untuk versi 1.0.0 di GitHub</a>. Zenodo mengalami "error" ketika mensinkronkan pembaruan v1.0.0. dari GitHub release.</p> <p>---------</p> <p>Repositori ini menyimpan kode pemrograman R yang melandasi&nbsp;<em><a href="https://gederajeg.github.io/database-verba-bahasa-indonesia/">VerbInd</a></em>, sebuah pangkalan data digital verba bahasa Indonesia berbasis korpus. <em>VerbInd</em> merupakan luaran <a href="https://doi.org/10.6084/m9.figshare.21257211">data</a> terkait proyek penulisan bab buku berjudul <a href="https://doi.org/10.6084/m9.figshare.22336729"><em>Afiksasi verba dalam bahasa Indonesia</em></a> yang menjadi salah satu bagian dari penyusunan buku Tatabahasa Bahasa Indonesia Kontemporer (TBIK) berbasis korpus. Berikut cara mengutip <em>VerbInd</em> dalam format APA:</p> <blockquote> <p><a href="https://www.ling-phil.ox.ac.uk/people/gede-rajeg">Rajeg</a>, G. P. W., &amp; <a href="https://www.researchgate.net/profile/Karlina-Denistia">Denistia</a>, K. (2023). <em>VerbInd</em>: Pangkalan data verba bahasa Indonesia berbasis korpus (Version 1.0.0) [Data set].&nbsp;<a href="https://doi.org/10.17605/OSF.IO/VQGKX">https://doi.org/10.17605/OSF.IO/VQGKX</a> <a href="https://gederajeg.github.io/database-verba-bahasa-indonesia/">https://gederajeg.github.io/database-verba-bahasa-indonesia/</a></p> </blockquote> <p>Kunjungi <a href="https://github.com/gederajeg/afiksasi-verba-bahasa-indonesia">laman berikut</a> untuk informasi lebih lanjut terkait landasan data VerbInd.</p>

opencc-by-nc-sa-4.0May 2023View details →
zenodo36/100

Foodblog-Korpus

<p>Dieses Korpus ist als Begleitmaterial zu folgendem Lehrbuch entstanden:</p> <p>Andresen, Melanie und Heike Zinsmeister (2019): Korpuslinguistik (narr Starter). Narr Francke Attempto: T&uuml;bingen.</p> <p>Dieser Upload umfasst folgende Dateien:</p> <ul> <li>Foodblog-Korpus.zip: Ein zip-Archiv mit 150 Artikeln aus deutschsprachigen Foodblogs.</li> <li>foodblogs_all.txt: Eine konkatenierte Textdatei aus allen 150 Artikeln (im Lehrbuch in Kapitel 6.1 f&uuml;r den Upload bei WebLicht genutzt).</li> <li>Foodblog-Korpus_Metadaten.csv: tabellarische Metadaten zu den im Korpus enthaltenen Texten im csv-Format</li> <li>Foodblog-Korpus_Metadaten.xls: tabellarische Metadaten zu den im Korpus enthaltenen Texten im Excel-Format</li> <li>Textteile.xslx: Export der manuellen Annotation von Textteilen aus CATMA, im Lehrbuch in Abschnitt 6.2 beschrieben</li> </ul>

opencc-by-nc-4.0Sep 2018View details →
zenodo36/100

Dataset Review Konsumen HP untuk Analisis Kata pada Korpus Analisis Sentimen

<p>Berikut ini dataset review konsumen HP untuk analisis kata pada korpus analisis sentimen</p>

opencc-by-4.0May 2020View details →
zenodo36/100

JuBe - Jugendsprache Schweiz Korpus

<p>Jugendsprachen gelten als vielseitiger und interessanter Forschungsgegenstand in der Linguistik. Sie bilden sich oft in multikulturellen Gesellschaften, die meist Teile urbaner Gebiete sind, heraus.<br> &Uuml;blicherweise kommt es zu speziellen jugendsprachlichen Auspr&auml;gungen in den sozialen Medien, von denen einzelne Elemente schnell den Weg in die Alltagskommunikation einer ganzen Gesellschaft finden.<br> &nbsp;Jugendsprachliche Merkmale sind auch innerhalb einer einzigen Gesellschaft extrem unterschiedlich und durch starken Wandel charakterisiert.<br> Auer (2002) diskutiert ein Ph&auml;nomen, dass unter Jugendlichen sehr h&auml;ufig auftaucht und als Teil des Entstehungsprozesses von Jugendsprache gewertet werden kann. Es handelt sich dabei um die Tendenz,<br> dass auch Jugendliche ohne ethnolektalen Hintergrund Merkmale eines Ethnolekts aufnehmen und in ihrer Alltagssprache verwenden. Gem&auml;ss Auer erfolgt diese Entwicklung &uuml;ber drei Stufen, vom Gebrauch<br> &nbsp;des Ethnolekts durch Migrant*innen bis zu dessen &Uuml;bernahme durch deutschsprachige Jugendliche (De-Ethnisierung).<br> Es ist erstaunlich, dass Forschung zu Jugendsprachen und zu Ethnolekten in der Schweiz nur sehr vereinzelt zu finden ist. Welche tragende Rolle der Jugendsprache als Quelle von Innovation aber<br> auch als Mittel bei der Konstruktion der eigenen sprachlichen Identit&auml;t und schlussendlich auch bei der Bewahrung historischer Wendungen in den Dialekten zukommt, l&auml;sst sich mit Blick auf die<br> viersprachige Schweiz schnell erahnen. Neben den vier offiziellen Sprachen beherbergt die Schweiz eine Reihe verschiedener Migrant*innensprachen, womit das Szenario von Auer (2002), also die<br> &nbsp;De-Ethnisierung, zus&auml;tzlich beg&uuml;nstigt wird und sich die Untersuchung dieses Prozesses geradezu aufdr&auml;ngt.<br> Auer&sbquo; Peter (2003): &bdquo;&sbquo;T&uuml;rkenslang&lsquo;: Ein jugendsprachlicher Ethnolekt des Deutschen und seine Transformationen&ldquo;. In: H&auml;cki Buhofer, Annelies (ed.):&nbsp;Spracherwerb und Lebensalter. T&uuml;bingen/Basel,<br> &nbsp;Francke: 255&ndash;264.<br> Das Jugendsprache-Bern-Korpus soll &uuml;ber die n&auml;chsten zweieinhalb Jahre (Juni 2019 &ndash; Dez. 2021) entstehen, wobei die Daten in der Datenbank abrufbar sind. Wie f&uuml;r soziolinguistische Korpora &uuml;<br> blich werden nebst den Aufnahmen in Absprache mit den Sprecher*innen auch ausgew&auml;hlte Sozialdaten zur Verf&uuml;gung stehen (z.B. Alter, Geschlecht, Herkunft, Bildungsstand). Teilweise sind auch<br> Transkriptionen zu den vorhandenen Daten geplant, diese entstehen aber erst nach und nach im Rahmen des Projekts.<br> Die erhobenen Daten werden Studierenden f&uuml;r Abschlussarbeiten (Semester- und Masterarbeiten) zur Verf&uuml;gung stehen. Auch der wissenschaftliche Nachwuchs wird durch das neue Korpus einfacher<br> zu Ph&auml;nomenen in der Jugendsprache forschen k&ouml;nnen (Dissertationen und Habilitationen).</p> <p>&nbsp;</p>

opencc-by-4.0Nov 2021View details →
zenodo36/100

Kobalt_RST (RST German Learner Treebank): Die Annotation von rhetorischen Strukturen im Kobalt-DaF-Korpus

<p>Das <a href="https://www.linguistik.hu-berlin.de/de/institut/professuren/korpuslinguistik/forschung/kobalt-daf">Kobalt-DaF-Korpus</a> ist ein systematisch erhobenes und tief annotiertes&nbsp;Deutschlernerkorpus, welches 80 deutschsprachige argumentative Texte von deutschen L1-Sprecher:innen und Deutschlerner:innen&nbsp;unterschiedlicher&nbsp;L1 enth&auml;lt.&nbsp;Dieses Repositorium stellt&nbsp;eine zus&auml;tzliche Annotation des Kobalt-DaF-Korpus&nbsp;bzgl.&nbsp;rhetorischer Strukturen frei zur Verf&uuml;gung.&nbsp;Folgende Informationen sind hier zu finden: (1) Die Darstellung des Annotationsprozesses (Annotationsframework, -richtlinie, und -verfahren). (2) Die annotierten rs3-Dateien.</p> <p>*Versionshinweise:&nbsp;Bislang sind ausschlie&szlig;lich die Texte der chinesischen Deutschlerner:innen und der deutschen L1-Sprecher:innen (insgesamt 40 Texte) verf&uuml;gbar.&nbsp;Die Annotation der &uuml;brigen Texte folgt demn&auml;chst.&nbsp;</p> <p>*Die Annotationsarbeit wurde gef&ouml;rdert durch das Chinese Scholarship Council und die Deutsche Forschungsgemeinschaft (DFG) &ndash; SFB 1412, 416591334.</p>

opencc-by-4.0Nov 2021View details →
zenodo36/100

Korpus "Erzählen über Konflikte"

<p>Korpus "Erzählen über Konflikte"</p>

opencc-by-sa-4.0Aug 2013View details →
zenodo36/100

Klosterfrauenkorpus: Ein annotiertes Korpus zum Sprachgebrauch süddeutscher Klosterfrauen des17. Jahrhunderts

<p>Demo/beta version of a linguistic corpus of texts written by Southern German nuns in the 17th century. See <a href="https://hartmast.github.io/klosterfrauen">hartmast.github.io/klosterfrauen</a> for more information (in German).</p>

opencc-by-4.0Feb 2019View details →
zenodo36/100

BiNoKo V. 1.0 Birgitta-Notker-Korpus

<p>The Birgitta-Notker-Korpus (BiNoKo) is a resource dedicated to comparative research on historical registers. The corpus comprises two sources: The Old High German Book of Psalms by Notker III of Saint Gall and the Old Swedish Revelations of Birgitta of Sweden.&nbsp;The subcorpus of Birgitta&#39;s Revelations and the subcorpus of Notker&#39;s Psalms are available as separate zip files. The corpus format is ANNIS. For local installation, use ANNIS Desktop. The documentation for ANNIS can be found here:<br> <a href="http://corpus-tools.org/annis/">https://corpus-tools.org/annis/</a><br> <a href="https://corpus-tools.org/annis/download.html">https://corpus-tools.org/annis/download.html </a></p> <p>The guidelines (see &#39;related identifiers&#39;) are published in REALIS 2/3 and include information about the corpus design, annotation layers, meta data, and annotation principles.</p>

openApr 2023View details →
zenodo36/100

Doppelte Perfektbildungen im Zwirner-Korpus

<p>Der Datensatz umfasst 570 Belege doppelter Perfektbildungen aus dem Zwirner-Korpus und stellt die Datengrundlage der Analyse in Fischer/Gropp (2022) dar. Der Datensatz enth&auml;lt die folgenden&nbsp;Informationen f&uuml;r jeden Beleg: Transkript-ID, Erhebungsort, Orts-ID im REDE SprachGIS (<a href="https://regionalsprache.de">https://regionalsprache.de</a>), Dialektraum, Satz vor Belegsatz, Belegsatz, Satz nach Belegsatz, Beleg, Lexem des Vollverbs, Partizip des Auxiliars, Formtyp, Finitheit, Bedeutungsbereich, Spezifizierung Bedeutungsbereich (vgl. Fischer/Gropp 2022: 101&ndash;105).</p> <p>Korpus: Deutsche Mundarten: Zwirner-Korpus (ZW): <a href="https://agd.ids-mannheim.de/ZW--_extern.shtml">https://agd.ids-mannheim.de/ZW--_extern.shtml</a>. Die Korpusanfrage erfolgte im November 2019 (DGD Version 2.12).<br> <br> Fischer, Hanna/Gropp, Milena (2022): Das doppelte Perfekt als aspektuelle Form? Die Verwendung der doppelten Perfektbildungen im Zwirner-Korpus. In: Fischer, Hanna/Gillmann, Melitta/Schmuck, Mirjam (Hg.): Aspektualit&auml;t in Variet&auml;ten des Deutschen.&nbsp;Hamburg: Buske. (Linguistische Berichte, Sonderheft 32), 89&ndash;115. <a href="https://doi.org/10.46771/978-3-96769-242-6">https://doi.org/10.46771/978-3-96769-242-6</a></p>

opencc-by-4.0Nov 2022View details →
zenodo32/100

Korpus der Entscheidungen des Bundesverfassungsgerichts

<p>Korpus von Entscheidungen des Bundesverfassungsgerichts im XML-Format.&nbsp;</p> <p>Folgende Entscheidungen sind enthalten:</p> <p>1951-1997: Entscheidungen, die in der Amtlichen Sammlung ver&ouml;ffentlicht wurden (mit freundlicher Unterst&uuml;tzung durch den Mohr Siebeck Verlag).<br>1998-2022: Senats- und Kammerentscheidungen von der Website des BVerfG.</p> <p>Enth&auml;lt insbesondere folgende Annotationen: Leits&auml;tze, Rubrum, Tenor, Gr&uuml;nde, Tatbestand, Entscheidungsgr&uuml;nde, abweichende Meinung</p> <p>------------------------------------------------------------------------</p> <p>Corpus of decisions of the German Federal Constitutional Court in XML format.</p> <p>Contains:</p> <p>1951-1997: Decisions published in the official report series (courtesy of Mohr Siebeck Verlag)<br>1998-2022: Decisions published on the GFCC's website.&nbsp;</p> <p>Includes annotations, namely: headnotes (Leits&auml;tze), caption (Rubrum), judgment (Tenor), reasons (Gr&uuml;nde), fact section (Tatbestand), reasoning section (Entscheidungsgr&uuml;nde), separate opinion (abweichende Meinung)</p> <p>&nbsp;</p> <p>The creation of this dataset has been realized in the L.L.Con project graciously funded in the years 2017-2023 by means of the Gottfried-Wilhelm Leibniz prize awarded to Prof. Dr. Christoph M&ouml;llers</p>

opencc-by-nc-sa-4.0Dec 2023View details →
zenodo32/100

Wikivoyage-Korpus: Korpusquellen der deutschen Sprachversion von Wikivoyage im TEI-Format

<p>Das <a href="https://www.dwds.de/d/korpora/wikivoyage">Wikivoyage-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> enth&auml;lt Volltexte aus den Artikeln aus der <a href="https://de.wikivoyage.org/wiki/Wikivoyage:%C3%9Cber_uns">deutschen Sprachversion des Wikivoyage-Reisef&uuml;hrers</a> der Wikimedia Foundation auf der Basis des <a href="https://dumps.wikimedia.org/dewikivoyage/20250701/">Datenbank-Abzugs vom 1. 7. 2025</a>. Texte aus anderen Seitenarten (Diskussionen etc.) wurden nicht aufgenommen.</p> <p>Das Wikivoyage-Korpus wurde nach dem Vorbild des <a href="https://www.dwds.de/d/korpora/wikipedia">Wikipedia-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> konzipiert. Es eignet sich damit insbesondere f&uuml;r die Recherche nach lexikographischen Belegen.</p> <p>Verf&uuml;gbar sind hier die Quellen des Wikivoyage-Korpus auf <a href="http://www.dwds.de">dwds.de</a> im XML/TEI-Format als teiCorpus-Datei. Wie die originalen Wikivoyage-Artikel stehen sie unter der Lizenz <a href="https://creativecommons.org/licenses/by-sa/4.0/">"Creative Commons Attribution/Share Alike"</a>.</p>

opencc-by-sa-4.0Jan 2023View details →
zenodo32/100

Wikipedia-Korpus: Korpusquellen der deutschsprachigen Wikipedia im TEI-Format

<p>Das <a href="https://www.dwds.de/d/korpora/wikipedia">Wikipedia-Korpus</a> auf <a href="http://www.dwds.de">dwds.de</a> enth&auml;lt Volltexte aus den Artikeln aus der <a href="https://de.wikipedia.org/wiki/Deutschsprachige_Wikipedia">deutschsprachigen Wikipedia</a> auf der Basis des <a href="https://dumps.wikimedia.org/dewiki/20250701/">Datenbank-Abzugs vom 1.7. 2025</a>. Texte aus anderen Seitenarten (Diskussionen etc.) wurden nicht aufgenommen.</p> <p>Das Korpus wurde so konzipiert, dass es sich insbesondere f&uuml;r die Recherche nach (fach)sprachlichen lexikographischen Belegen eignet. Deshalb wurden bei der automatischen Korpuskuration die Artikeltexte so weit wie m&ouml;glich um Textteile bereinigt, die nicht satzf&ouml;rmig oder nicht deutschsprachig sind. Dies betrifft unter anderem &Uuml;berschriften, Tabellen, Literaturangaben und fremdsprachliche Zitate, soweit diese in den Wikipedia-Quellen als solche ausgezeichnet sind.</p> <p>Verf&uuml;gbar sind hier die Quellen des Wikipedia-Korpus auf <a href="http://www.dwds.de">dwds.de</a> im XML/TEI-Format als teiCorpus-Datei. Wie die originalen Wikipedia-Artikel stehen sie unter der Lizenz <a href="https://creativecommons.org/licenses/by-sa/4.0/">"Creative Commons Attribution/Share Alike"</a>.</p>

opencc-by-sa-4.0Jan 2023View details →
zenodo28/100

SkyPlus Eesti top 40 laulusõnade korpus 1994-2018

<p>Andmestik sisaldab Sky Plus Eesti top 40 hulka j&otilde;udnud laulude s&otilde;nu. Top 40 on koostatud b&auml;ndi p&auml;ritolu j&auml;rgi ja ei sisalda ainult eestikeelseid lugusid. Andmestik on m&otilde;eldud eelk&otilde;ige lihtsama tekstit&ouml;&ouml;tluse harjutamiseks.</p>

opencc-by-4.0Aug 2020View details →
zenodo24/100

Korpus der Staatsexamensarbeit "Diskursive Konstruktionen der Verwendung von geschlechterinklusiver Sprache in sozialen Medien: Identifizierung von Mustern der Ablehnung durch heterogene Gruppierungen sprachlicher Akteure und Akteurinnen."

<p>Der f&uuml;r die vorliegende Diskursanalyse relevante Datensatz setzt sich aus den digitalen Korpora der Telegram-Kan&auml;le @Gender-Wahn, @Stoppt den Gender-Wahnsinn und @GenderWelten zusammen. Die Datenerhebung erfolgt anhand der Export-Funktion auf Telegram, die erlaubt, den gesamten Chatverlauf ab der Erstellung des jeweiligen Kanals nachzuvollziehen. Die Daten wurden anhand der Anwendung SketchEngine ausgewertet.&nbsp;</p>

opencc-by-4.0Oct 2023View details →

ScienceDex guides

Understand access before you commit

These curated guides explain access requirements, typical timelines, costs, and reuse considerations for widely used research datasets.

Compare curated datasets

Allen Brain Atlas

Allen Brain Atlas is an Allen Institute collection of brain map atlases, datasets, APIs, and analysis tools covering mouse, human, and non-human primate brain resources.

allen-brain-atlas
neuroscienceopenDocumentation, web resources, and API references are available online.
Last verified 2026-04-30Open record

Annotated Behaviour and Observability Dataset (ABODe)

ABODe is a University of Edinburgh DataShare dataset for behavior classification in group-housed mice using home-cage video, identities, bounding boxes, ground-plate positions, and annotator labels.

abode-home-cage
behavioral-neuroscienceopenThe DataShare record exposes download links for annotations, documentation, license text, and the zipped per-snippet data directory.
Last verified 2026-04-30Open record

DANDI Archive for NWB datasets

DANDI is a BRAIN Initiative archive for publishing and sharing neurophysiology data, including electrophysiology, optophysiology, and behavioral data packaged as NWB and related standards.

dandi-nwb
electrophysiologyopenPublished Dandiset metadata and archive endpoints are available through the production DANDI API.
Last verified 2026-04-30Open record

International Brain Laboratory public data

The International Brain Laboratory public data releases expose standardized mouse decision-making experiments, including Neuropixels recordings, widefield calcium imaging, behavior, and session metadata accessed through the ONE API.

ibl
behavioral-neuroscienceopenPublic sessions can be searched and loaded from the IBL public data server through ONE.
Last verified 2026-04-29Open record

OpenNeuro

OpenNeuro is a free, open platform for sharing neuroimaging datasets, with public search, dataset pages, and download paths for web, S3, DataLad, and the OpenNeuro CLI.

openneuro
neuroscienceopenPublished datasets are available on demand over the internet.
Last verified 2026-04-29Open record