Skip to main content
zenodoopen

Words in -ica from the GIGAFIDA corpus/Besede na -ica iz korpusa Gigafida

<p>Iz korpusa pisne standardne sloven&scaron;čine Gigafida 2.0 (https://viri.cjvt.si/gigafida/, Logar Berginc idr. 2012) je bil pridobljen naključni vzorec besed, ki se končujejo na "ica".&nbsp;</p> <p>Iz vzorca so bile odstranjene besede, ki niso bile primerne za analizo, saj so bile i) ortografsko podobne besede, ki nimajo zvočne podobe na -ica, kot America, ii) dvozložne besede, katerih edino možno naglasno mesto je -&iacute;ca, npr. žlica, iii) nadaljnje tvorjenke iz besed z zadnjo tvorbeno stopnjo s pripono -ica, npr. nepravica ali iv) nejasni primeri, kar je bilo preverjeno z intuicijami &scaron;estih naravnih govorcev sloven&scaron;čine (vključno z obema avtorjema prispevka). Končni vzorec vsebuje 583 besed (frekvenca na milijon besed v korpusu: povprečje 10,4, mediana 3,2, modus: 1,8, standardni odklon: 26,1; najvi&scaron;ja frekvenca: 344,5/milijon, minimalna frekvenca: 0/milijon).<br>Vse besede so bile razdeljene na morfeme. Po tem koraku je ostalo 23 besed, ki jih avtorja nista mogla gotovo razdeliti. Oblikovala sva nalogo določanja morfemskih mej, ki je vsebovala 23 nejasnih besed in 23 besed iz vzorca, katerih morfemska zgradba je bila gotovo razvidna. Nalogo so re&scaron;ili &scaron;tirje naravni govorci sloven&scaron;čine z izobrazbo na področju jezikoslovja ali slovenistike. Na podlagi rezultatov sva izključila 19 od 23 nejasnih besed, in sicer kadar se sodbe anketirancev niso skladale s sodbami avtorjev prispevka ali kadar so bile sodbe anketirancev različne. Velik del izključenih besed so bili toponimi, ki pogosto ohranjajo arhaična stanja; &scaron;e en pogost vzorec so bile tvorjenke s pripono -ica, katerih osnova je prikrita tvorjenka (npr. cesar-ica). Za potrebe čim bolj&scaron;ega nadzora nad posameznimi dejavniki sva torej iz vzorca odstranila vse primere, ki so ostali dvoumni.&nbsp;<br>Vsem besedam, ki so ostale v vzorcu, sva označila mesto naglasa (1, če je naglasno mesto na priponi, sicer 0) in frekvenco.<br>Stolpci v tabeli vsebujejo naslednje informacije:</p> <p>Stolpec A "&scaron;tevilka": &scaron;tevilka besede.<br>Stolpec B "beseda": citatna oblike besede.<br>Stolpec C "frekvenca na milijon besed": frekvenca besede v korpusu (na milijon besed).<br>Stolpec D "naglas": 1, če je naglas na prvem zlogu niza -ica (npr. prav&iacute;ca), 0, če je naglas drugje.<br>Stolpec E "predvidljiv pomen: manj&scaron;alnica": 1, če ima -ica v besedi predvidljivi pomen manj&scaron;alnice (npr. mizica), 0 v vseh drugih primerih.<br>Stolpec F "vidno kompleksna tvorjenka": 1, če beseda razen pripone -ica in korena vsebuje &scaron;e druge morfeme (npr. pis-ar-n-ica), 0, če beseda vsebuje le koren in pipono -ica.<br>Stolpec G "predvidljiv pomen: ženska ustreznica": 1, če ima beseda predvidljiv pomen ženske ustreznice (npr. članica), 0 v vseh drugih primerih.<br>Stolpec H "koren ni prost": 1, če koren ni prost (npr. opica), 0 v vseh drugih primerih.<br>Stolpec I "predvidoma izradikalne": 1, če je beseda predvidoma izradikalna, 0 v vseh drugih primerih.<br>Stolpec J "skupine besed": Povzema 5 skupin besed iz stoplpca J z o&scaron;tevilčenjem.<br>Stolpec K "skupine besed &ndash; opisno": Besede so razdeljene na 5 skupin:&nbsp;<br>1) enostavna tvorjenka z idiosinkratičnim pomenom, vezani koren,<br>2) enostavna tvorjenka z idiosinkratičnim pomenom, prosti koren,<br>3) manj&scaron;alnica,<br>4) ženska ustreznica,<br>5) vidno kompleksna tvorjenka.</p>

ShareScore

36/100

Overall dataset sharing score

Score breakdown

These five areas show where the dataset supports — or may limit — practical reuse.

Stewardship
4
Harmonization
4
Access
20
Reuse readiness
8
Engagement
0