Skip to main content
zenodoopen

N-gram dataset of Chinese local gazetteers (中國地方誌)

<p>This dataset contains the N-grams (1-3) collected from 11083 Chinese local gazetteers&nbsp; (中國地方誌).</p> <p>The dataset comprises of the following resources:</p> <ul> <li><strong>local_gazetteer_1.7z</strong> Unigram dataset in tab separated format (one file per book, each row contains the N-gram and its count)</li> <li><strong>local_gazetteer</strong><strong>_2.7z</strong> Bigram dataset in tab separated format&nbsp;(one file per book, each row contains the N-gram and its count)</li> <li><strong>local_gazetteer</strong><strong>_3.7z</strong> Trigram dataset in tab separated format&nbsp;(one file per book, each row contains the N-gram and its count)</li> <li><strong>local_gazetteer</strong><strong>_metadata.xlsx</strong> Metadata of each book</li> </ul> <p>&nbsp;</p> <p>Dieses Datenset enth&auml;lt die in 11083 chinesischen Lokalmonographien (中國地方誌) enthaltenen&nbsp;N-Gramme (1-3).&nbsp;&nbsp;</p> <p>Das Datenset besteht aus den folgenden Dateien:</p> <ul> <li><strong>local_gazetteer</strong><strong>_1.7z</strong><em> </em>Monogramm-Datenset im .txt Dateiformat&nbsp;mit Tabstopp als&nbsp;Trennzeichen (jede Datei enth&auml;lt ein Buch, jede Zeile ein N-Gramm mit der Anzahl der Vorkommnisse im Text)</li> <li><strong>local_gazetteer</strong><strong>_2.7z</strong><em>&nbsp;</em>Bigramm-Datenset im .txt Dateiformat&nbsp;mit Tabstopp als&nbsp;Trennzeichen (jede Datei enth&auml;lt ein Buch, jede Zeile ein N-Gramm mit der Anzahl der Vorkommnisse im Text)</li> <li><strong>local_gazetteer</strong><strong>_3.7z</strong><em> </em>Trigramm-Datenset im .txt Dateiformat&nbsp;mit Tabstopp als&nbsp;Trennzeichen (jede Datei enth&auml;lt ein Buch, jede Zeile ein N-Gramm mit der Anzahl der Vorkommnisse im Text)</li> <li><strong>local_gazetteer</strong><em><strong>_</strong></em><strong>metata.xlsx</strong> Metadaten der enthaltenen B&uuml;cher</li> </ul> <p>&nbsp;</p> <p>11083 中國地方誌n元語法統計資料 (N-gram Dataset)</p> <p>以下是檔案簡說:</p> <ul> <li><strong>local_gazetteer</strong><strong>_1.7z</strong><em>&nbsp;</em>中國地方誌一元分詞(Unigram)的統計資料 (每本書一個檔案, 以tab作欄區分, 每一行紀錄該N-gram在書中出現的次數)</li> <li><strong>local_gazetteer</strong><strong>_2.7z</strong><em> </em>中國地方誌二元分詞(Bigram)的統計資料&nbsp;(每本書一個檔案, 以tab作欄區分, 每一行紀錄該N-gram在書中出現的次數)</li> <li><strong>local_gazetteer</strong><strong>_3.7z</strong><em> </em>中國地方誌三元分詞(Trigram)的統計資料 (每本書一個檔案, 以tab作欄區分, 每一行紀錄該N-gram在書中出現的次數)</li> <li><strong>local_gazetteer</strong><em><strong>_</strong></em><strong>metadata.xlsx</strong> 紀錄每本書的基本Metadata</li> </ul>

ShareScore

40/100

Overall dataset sharing score

Score breakdown

These five areas show where the dataset supports — or may limit — practical reuse.

Stewardship
8
Harmonization
4
Access
16
Reuse readiness
8
Engagement
4

Topics