Ìmọ̀-ẹ̀dá-èdè kọ̀mpútà àti ìdàgbàsókè kọ́pọ́sì Yorùbá ní nínú àkójọpọ̀ tí a ṣètò ti àwọn ohun-èlò lẹ́síkà, àwọn àkọsílẹ̀ ìtúmọ̀ bitext tó wà lẹ́gbẹ̀ẹ́ra, àwọn ìwọ̀n-ìdánwò fún sísàmìsí tẹ̀léra, àti àwọn àkọsílẹ̀ ohùn àsọjáde. Àwọn ohun-èlò wọ̀nyí ń ṣàkọsílẹ̀ Yorùbá Gbogbogbò (èdè Yorùbá gbogbogbò) àti àwọn ẹ̀yà-èdè ti àtìpó kọjá àwọn agbègbè pàtó, àwọn ọ̀nà ìgbàsílẹ̀, àti àwọn ìlànà ìwé-àṣẹ. Àkójọpọ̀ àyíká yìí gba orí àwọn ibi-ìpamọ́ ọ̀rọ̀ tí a ṣètò, àwọn àkójọ ohùn àsọjáde látọ̀dọ̀ ọ̀pọ̀ ènìyàn, àwọn àsọjáde kíkà tí olùsọ̀rọ̀ kan ṣoṣo gbà sílẹ̀ nínú sitúdiò, àwọn kọ́pọ́sì ìtúmọ̀ ẹ̀rọ oríṣiríṣi agbègbè, àti àwọn àkọsílẹ̀ tí a wà jáde látorí ayélujára lórí ìwọ̀n ńlá.
Ìdàgbàsókè àwọn ohun-èlò èdè Yorùbá jẹ́ èyí tí a mọ̀ pẹ̀lú ìyípadà láti orí àwọn àkójọpọ̀ ọ̀rọ̀ aládàáni ti ìbẹ̀rẹ̀ àti àwọn ìtúmọ̀ ẹ̀sìn tí kò dọ́gba sí àwọn ìwọ̀n-ìdánwò alájọṣepọ̀ agbègbè tí ó wà fún gbogbo ènìyàn, èyí tí a ṣe láti yanjú ìtọ́jú àmì-ohùn àti àmì-ìsàlẹ̀, àìdánilójú ohùn, àti àìdọ́gba agbègbè ìmọ̀. Àkọsílẹ̀ yìí pèsè àtòjọ àpèjúwe àti àtúnyẹ̀wò àtúnpín ti gbogbo àwọn kọ́pọ́sì èdè Yorùbá tí a fọwọ́sí, àwọn ìwọ̀n oníye wọn, àwọn ìwé-àṣẹ lábẹ́ òfin, àti àwọn ààlà ìlànà-iṣẹ́ wọn.
Àwọn Ibi-Ìpamọ́ Ọ̀rọ̀ àti Àwọn Ìwé-Ìtúmọ̀-Ọ̀rọ̀
Àwọn ibi-ìpamọ́ ọ̀rọ̀ ń pèsè àkójọ ìbẹ̀rẹ̀ ti àwọn lẹ́mà, àwọn àbùdá fónẹ́tíìkì, àwọn ìtumọ̀ kíkúrú, àti àwọn àpẹẹrẹ mọfọ́lọ́jì tí a nílò fún àtúnpín kọ̀mpútà. Ibi-ìpamọ́ ọ̀rọ̀ kan ṣoṣo tí ó gbòòrò jùlọ tí a kójọ fún èdè náà ni Global Yorùbá Lexical Database.
Global Yorùbá Lexical Database (v. 1.0)
Èyí tí Yíwọlá Awóyalé kójọ tí Linguistic Data Consortium (LDC) sì tẹ̀jáde ní ọdún 2008, Global Yorùbá Lexical Database jẹ́ ìwé-ìtúmọ̀-ọ̀rọ̀ oní-nọ́ńbà tí a ṣètò àti ibi-ìpamọ́ ọ̀rọ̀ tí ó tóbi jùlọ fún Yorùbá àti àwọn ẹ̀yà-èdè tí ó bá a tan [S1].
- Àpapọ̀ Iye: Ju 450,000 àwọn orí-ọ̀rọ̀ àti àkọsílẹ̀ lẹ́síkà [S1].
- Pípín Àwọn Ẹ̀ka-kọ́pọ́sì: Ju 368,000 àwọn àkọsílẹ̀ ti Yorùbá Gbogbogbò; nǹkan bí 8,000 àwọn àkọsílẹ̀ ti Lucumí (ẹ̀yà-èdè fún ìsìn tí a tọ́jú ní Cuba); nǹkan bí 3,600 àwọn àkọsílẹ̀ ti Gullah; àti nǹkan bí 1,000 àwọn àkọsílẹ̀ ti Trinidadian Yorùbá [S1].
- Ìwé-Àṣẹ àti Ìpínkiri: Aládàáni. Ìgbàwọlé ni a ń bójútó ní pàtó nípa lílo Àwọn Àdéhùn Olùlò ti LDC fún àwọn ọmọ-ẹgbẹ́ àti àwọn tí kì í ṣe ọmọ-ẹgbẹ́ lábẹ́ nọ́ńbà ìdánimọ̀ kátálọ́ọ̀gù LDC2008L03 [S1].
- Ètò Língúísíìkì: Ibi-ìpamọ́ náà fi àwọn àmì-ohùn àti àwọn àmì-ìsàlẹ̀ kún un lọ́nà tí a ṣètò kọjá àwọn ẹ̀yà gbogbogbò àti ti àtìpó, ní ṣíṣe àkọsílẹ̀ àwọn ìyípadà mọfọ́lọ́jì, àwọn ìṣẹ̀dá ọ̀rọ̀-àpapọ̀, àwọn àtúnwí-ọ̀rọ̀, àti àwọn ìyàtọ̀ ẹ̀ka-èdè. Fífikún àwọn ẹ̀yà àtìpó ti Atlantic ń pèsè ìtọ́jú lẹ́síkà fún língúísíìkì ìtàn àkfiwé àti kríólísíìkì [S1].
Database Metric Comparison:
+------------------------------------+--------------------------+
| Sub-Variety | Lexical Entries (approx) |
+------------------------------------+--------------------------+
| Standard Yorùbá | 368,000+ |
| Lucumí (Cuba) | 8,000 |
| Gullah (Sea Islands, US) | 3,600 |
| Trinidadian Yorùbá | 1,000 |
| Total Global Yorùbá Lexicon | 450,000+ |
+------------------------------------+--------------------------+
Àwọn Ìwọ̀n-Ìdánwò fún Dídámọ̀ Àwọn Orúkọ Pàtó àti Sísàmìsí Tẹ̀léra
Títí di ìgbà ìdàgbàsókè àwọn ìgbésẹ̀ pàtó láti ìsàlẹ̀ wá, àwọn iṣẹ́ sísàmìsí tẹ̀léra àti yíyọ-ìwífún-jáde nínú Yorùbá jìyà àìsí àwọn ìwọ̀n-oníwúrà tí ènìyàn fọwọ́sí fúnra rẹ̀.
MasakhaNER
Èyí tí David Ifeoluwa Adelani, Jesujoba O. Alabi, Angela Fan, Julia Kreutzer, àti ẹgbẹ́ olùwádìí Masakhane tẹ̀jáde ní ọdún 2021, MasakhaNER gbé ìwọ̀n-ìdánwò fún dídámọ̀ àwọn orúkọ pàtó (NER) kalẹ̀ tí ènìyàn sàmìsí fún àwọn èdè Áfíríkà, pẹ̀lú Yorùbá gẹ́gẹ́ bí àkọ́kọ́ nínú àfojúsùn [S2].
- Ìwọ̀n Àkójọ-Ìròyìn àti Àwọn Ìpín: Ẹ̀ka-kọ́pọ́sì Yorùbá ní gbólóhùn 9,824 nínú tí a fi ọwọ́ sàmìsí tí a fà jáde látinú àwọn ìtẹ̀jáde ìròyìn agbègbè ti ìgbàlódé, tí ó ní nǹkan bí 165,000 tókìn [S2].
- Ìpín Ìkẹ́kọ̀ọ́: 6,877 gbólóhùn.
- Ìpín Ìdàgbàsókè: 983 gbólóhùn.
- Ìpín Ìdánwò: 1,964 gbólóhùn.
- Àkójọ-Àmì: Àwọn ẹ̀ka orúkọ pàtó pẹlẹbẹ mẹ́rin tó wọ́pọ̀, tí ó ní nínú Àwọn Orúkọ Ènìyàn (PER), Àwọn Ibì (LOC), Àwọn Àjọ (ORG), àti Àwọn Ọjọ́-Oṣù (DATE) [S2].
- Ìwé-Àṣẹ: A dá a sílẹ̀ lábẹ́ ìlànà gbogbogbò níbi tí àwọn àkọsílẹ̀-àbùdá ti gba ìwé-àṣẹ lábẹ́ Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), pẹ̀lú àpapọ̀ àkójọ-ìròyìn tí a pínkiri lábẹ́ Creative Commons Attribution 4.0 International (CC BY 4.0), ní títẹ̀lé àwọn àdéhùn agbègbè olùgbàlejò fún àwọn àkọsílẹ̀ ìròyìn ìpìlẹ̀ [S2].
- Pàtàkì Ìlànà-Iṣẹ́: MasakhaNER yanjú ìkùnà títẹ̀síwájú ti ìgbégbà zero-shot oní-ọ̀pọ̀-èdè láti inú àwọn àwòṣe Indo-European tí kò ní ohùn nípa fífihàn pé àwọn tókìn inú-èdè tí ènìyàn sàmìsí tí ó gbé àwọn àmì-ohùn àti àmì-ìsàlẹ̀ tí ó tọ́ ń mú ìdámọ̀ ààlà àti ìpéye ìpínsísọ̀rí tí ó ga jù jáde [S2].
Àwọn Kọ́pọ́sì Bitext Tó Dọ́gba fún Ìtúmọ̀ Ẹ̀rọ
Àwọn àwòṣe ìtúmọ̀ ẹ̀rọ (MT) nílò àkọsílẹ̀ tó wà lẹ́gbẹ̀ẹ́ra tí a tò ní ìbámu kọjá àwọn èdè orísun àti ti àfojúsùn. Àwọn ohun-èlò tó wà lẹ́gbẹ̀ẹ́ra ti Yorùbá pín sí àwọn ìwọ̀n-ìdánwò oríṣiríṣi agbègbè tí a ṣètò, àwọn kọ́pọ́sì ẹ̀sìn tí ó wà fún gbogbo ènìyàn, àwọn ìgbéléwọ̀n oní-ọ̀nà-púpọ̀ ti àwọn akọ́ṣẹ́mọṣẹ́, àti àkọsílẹ̀ tí a wà jáde látorí ayélujára tí a kò ṣètò.
Corpus Comparison: Machine Translation Bitexts
+--------------+------------------+--------------------------+-----------------------+
| Corpus | Sentence Pairs | Primary Domain | Licence |
+--------------+------------------+--------------------------+-----------------------+
| MENYO-20k | 20,100 | News, TED, Proverbs, TV | CC BY-NC 4.0 |
| MAFAND-MT | Multi-thousand | Human-translated News | CC BY / Open |
| JW300 | Large-scale (MT) | Religious Publications | Distribution Restrict |
| FLORES-101 | 1,012 (dev/test) | Multilingual Wikipedia | CC BY-SA 4.0 |
| CCAligned | Multi-million | Web Crawled (CommonCrawl)| Web Terms (Uncleaned) |
+--------------+------------------+--------------------------+-----------------------+
MENYO-20k
Èyí tí David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Adesina Ayeni, Mofe Adeyemi, Ayodele Esther Awokoya, Cristina España-Bonet, àti Dietrich Klakow ṣe àgbékalẹ̀ rẹ̀, a dá MENYO-20k sílẹ̀ láti yanjú àṣejù dídúró lórí ẹ̀ka kan ṣoṣo tó ti nípa tẹ́lẹ̀ lórí ìwádìí ìtumọ̀ èdè Yorùbá [S3][S4].
- Size and Structure: Àwọn gbólóhùn méjì-méjì tí a gbé kọra ti èdè Gẹ̀ẹ́sì–Yorùbá tí iye wọn jẹ́ 20,100 tí a pín sí 10,070 fún ìkẹ́kọ̀ọ́, 3,397 fún ìdàgbàsókè, àti 6,633 fún ìdánwò [S3][S4].
- Domain Coverage: Ìwọ̀ntúnwọ̀nsì pípé láti inú oríṣiríṣi ẹ̀ka tí a fà yọ láti inú àwọn àpilẹ̀kọ ìròyìn (Global Voices, Voice of Nigeria), àwọn àsọyé TED talks, àkọsílẹ̀ inú sinimá, ìgbóhùnsáfẹ́fẹ́ rédíò, àwọn ìwé orí ẹ̀rọ ayélujára, àti àwọn òwe àbáláyé Yorùbá (òwe) [S4].
- Orthographic Normalization: Àkójọ-ẹ̀tọ́ náà fi ọwọ́ ṣe ìtòlẹ́sẹẹsẹ àmì ohùn (òkè, àárín, ìsàlẹ̀) àti àmì àbùdá ìsàlẹ̀ (ẹ, ọ, ṣ) láti dènà àìtòlẹ́sẹẹsẹ àmì tó wọ́pọ̀ lórí àwọn ohun àmúlò orí ẹ̀rọ ayélujára [S4].
- Licensing: Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), èyí tí àwọn àdéhùn ìtún-pín-kiri láti orísun púpọ̀ ń darí [S3].
MAFAND-MT
Èyí tí David Ifeoluwa Adelani àti àjọ Masakhane tẹ̀ jáde ní ọdún 2022, MAFAND-MT (Masakhane A Few Thousand Translations) mú àwọn ìtumọ̀ oríṣi gíga, tí àwọn akọ́ṣẹ́mọṣẹ́ ènìyàn ṣe wá, èyí tí a pọkàn pọ̀ ní pàtó lórí ẹ̀ka ìròyìn kọjá àwọn èdè ilẹ̀ Áfíríkà [S5].
- Architecture: Ó so Yorùbá pọ̀ mọ́ èdè Gẹ̀ẹ́sì àti èdè Faransé ní tààràtà láti dán àwọn ipa ọ̀nà ìtumọ̀ tààrà láti orí èdè gbogbogbòò sí èdè àbínibí wò dípò gbígbé e gba orí èdè Gẹ̀ẹ́sì nìkan [S5].
- Quality Benchmark: A ṣe ìgbéléwọ̀n rẹ̀ láti fi hàn pé kódà ẹgbẹẹgbẹ̀rún díẹ̀ nínú àwọn gbólóhùn méjì-méjì tí a gbé kọra, tí wọ́n ní ìpéye gíga, tí ènìyàn fọwọ́ sí, tí wọ́n sì ní àmì tó yẹ, dára ju ọgọ́rọ̀ọ̀rún ẹgbẹ̀rún àwọn gbólóhùn aláriwo tí a gbà láti orí ayélujára lọ nínú mímú ìtumọ̀ ẹ̀rọ neural machine translation (NMT) sunwọ̀n sí i [S5].
JW300
Èyí tí Željko Agić àti Ivan Vulić fi ẹ̀rọ fà yọ ní ọdún 2019, a ṣe àgbékalẹ̀ JW300 nípa gbígba àwọn àpilẹ̀kọ, ìwé ìròyìn, àti àwọn ìwé pẹlẹbẹ tí a gbé kọra láti jw.org kọjá ọgọ́rọ̀ọ̀rún àwọn èdè tí kò ní àlùmọ́ọ́nì púpọ̀ lórí ẹ̀rọ, títí kan Yorùbá [S6].
- Volume: Ọ̀kan lára àwọn àkójọ àkọsílẹ̀ méjì-méjì tí a gbé kọra tó tóbi jùlọ fún Yorùbá ní ti iye àwọn gbólóhùn, èyí tó mú kí àwọn àdánwò ìpìlẹ̀ ìbẹ̀rẹ̀ ti deep neural MT ṣeé ṣe [S6].
- Distribution and Legal Status: A dá pípín JW300 dúró lẹ́yìn náà tí a sì fòfin dè é nítorí àwọn ẹ̀sùn rúfin ẹ̀tọ́ àwòkọ tí àwọn olùní ẹ̀tọ́ àwòkọ láti orísun gbé kalẹ̀ [S6].
- Domain Limitation: Ìlò-èdè náà dá lórí ẹ̀sìn àti àkọsílẹ̀ ìkọ́nilẹ́kọ̀ọ́ nípa ìwà rere nìkan. Ìtò-ọ̀rọ̀ àti àwọn ọ̀rọ̀ inú rẹ̀ jọ ti àwọn ìwé Kristẹ́nì tí a túmọ̀, èyí tó ń mú kí àwọn àwòṣe ìṣirò yẹra fún àwọn ọ̀nà ìsọ̀rọ̀ ojoojúmọ́ àti ti ìbánisọ̀rọ̀ àbáláyé [S6].
CCAligned and CCMatrix
Èyí tí a ṣe àgbékalẹ̀ rẹ̀ nípasẹ̀ àwọn ọ̀nà ìfàyọ aládàáṣiṣẹ́ láti ọwọ́ Ahmed El-Kishky àti àwọn ẹlẹgbẹ́ rẹ̀ (2020) àti Holger Schwenk àti àwọn ẹlẹgbẹ́ rẹ̀ (2021), CCAligned àti CCMatrix wa àwọn àkọsílẹ̀ méjì-méjì tí a gbé kọra jáde láti inú àkójọ ayélujára Common Crawl nípa lílo ìtòlẹ́sẹẹsẹ àkọsílẹ̀ àti gbólóhùn kọjá-èdè [S7][S8].
- Characteristics: Iye àwọn ọ̀rọ̀ (tokens) tó pọ̀ jaburata, tí ń pèsè àkọsílẹ̀ ayélujára tútù fún ìwádìí àti ìfàyọ fìrìgbon [S7][S8].
- Documented Deficiencies: Ìgbéléwọ̀n àwọn onímọ̀ fi hàn pé àìbáramu gbólóhùn pọ̀ nínú rẹ̀, pípín èdè sí ẹ̀ka tí kò tọ́ (bíbí àpapọ̀ Yorùbá mọ́ àwọn èdè Ìwọ̀-oòrùn Áfíríkà mìíràn), gígé ìgbékalẹ̀ kúrú, àti yíyọ àmì ohùn àti àmì àbùdá ìsàlẹ̀ kúrò pátápátá [S7][S8].
FLORES-101 and FLORES-200
Èyí tí Nsikak Goyal àti àwọn ẹlẹgbẹ́ rẹ̀ (2022) ṣe àgbékalẹ̀ rẹ̀ tí NLLB Team (2022) sì fẹ̀ ẹ́ lójú, òṣùwọ̀n ìgbéléwọ̀n FLORES ní nínú àwọn ìtumọ̀ akọ́ṣẹ́mọṣẹ́ ènìyàn ti 101 dé 200+ àwọn èdè tí a gbé ka àwọn àpilẹ̀kọ Wikipedia lédè Gẹ̀ẹ́sì [S9].
- Role: Ó ń ṣiṣẹ́ gẹ́gẹ́ bí ìpín ìgbéléwọ̀n tí a gbé kọra ti ọ̀pọ̀-ọ̀nà tí ó jẹ́ ìwọ̀n tó péye, èyí tí ó ń jẹ́ kí a ṣe àfiwé àwọn àkóónú tí ó jọra pọ́nnńbélé kọjá àwọn ẹbí èdè oríṣiríṣi lábẹ́ àwọn ìlànà àkọtọ́ tí a ṣe déédéé [S9].
Speech and Acoustic Corpora
Àwọn àkójọ-ẹ̀tọ́ ọ̀rọ̀-ẹnu nílò àwọn ohùn tí a gbà sílẹ̀ tí a so mọ́ àkọsílẹ̀ àkọtọ́ tí ó péye. Àwọn àkójọ-ẹ̀tọ́ ìmọ̀-ẹ̀rọ ọ̀rọ̀-ẹnu Yorùbá yàtọ̀ síra nínú oríṣiríṣi àwọn olùsọ̀rọ̀, ìwọ̀n àyẹ̀wò ìró-ohùn, àyíká tí a ti gba ohùn sílẹ̀, àti gbogbo àpapọ̀ wákàtí.
Acoustic Speech Datasets: Parameters and Licensing
+---------------------+-------------+-------------+------------+--------------------+
| Dataset | Audio Hours | Sample Rate | Speakers | Licence |
+---------------------+-------------+-------------+------------+--------------------+
| BibleTTS (SLR129) | ~33.3 hrs | 48 kHz | 1 (studio) | CC BY-SA 4.0 |
| Mozilla Common Voice| ~6–10+ hrs | Variable | Mult./Crowd| CC0 1.0 (Public) |
| OpenSLR SLR86 | ~4.1 hrs | 48 kHz | 36 | CC BY-SA 4.0 |
| Lagos-NWU | ~2.75 hrs | 16 kHz | 33 | CC BY 2.5 ZA |
| ALFFA | 0 hrs (N/A) | N/A | N/A | MIT (No Yorùbá) |
+---------------------+-------------+-------------+------------+--------------------+
OpenSLR SLR86 (Crowdsourced Yorùbá Speech Dataset)
Èyí tí Alexander Gutkin, Işın Demirşahin, Oddur Kjartansson, Clara Rivera, àti Kọ́lá Túbọ̀sún gbé jáde ní ọdún 2020, SLR86 jẹ́ àkójọ-ọ̀rọ̀ ọ̀rọ̀-ẹnu tí ó wà fún gbogbo ènìyàn tí a ṣe àgbékalẹ̀ rẹ̀ ní pàtó láti ṣe àtìlẹ́yìn fún ìdàgbàsókè ìmọ̀ríràn ọ̀rọ̀-ẹnu (ASR) àti yíyí àkọsílẹ̀ sí ọ̀rọ̀-ẹnu (TTS) [S10].
- Recorded Audio: Nǹkan bí wákàtí 4.1 ti ohùn dídára gíga, èyí tí àwùjọ kó jọ [S10].
- Acoustic Details: A gbà á sílẹ̀ ní ìwọ̀n ìṣàyẹ̀wò àbínibí ti 48 kHz láti ọwọ́ àwọn olùsọ̀rọ̀ àbínibí Yorùbá 36 tí wọ́n ka àwọn àkọsílẹ̀ tí a fún wọn [S10].
- Licensing: A pín in fún gbogbo ènìyàn lábẹ́ ìwé àṣẹ Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) nípasẹ̀ ibi-ìfipamọ́ OpenSLR [S10].
- Quality Assurance: A ṣe àgbékalẹ̀ àwọn àkọsílẹ̀ náà ní ọ̀nà tí ó tòlẹ́sẹẹsẹ pẹ̀lú àmì ohùn àti àmì àbùdá tí a fọwọ́ sí láti rí i dájú pé bí ohùn ṣe ń gbé ga tàbí rẹlẹ̀ nínú ohùn tí a gbà sílẹ̀ bá àkọsílẹ̀ àkọtọ́ mu ní pípéye [S10].
BibleTTS (Yorùbá Subset / SLR129)
Ní àgbékalẹ̀ ní ọdún 2022 láti ọwọ́ Josh Meyer, David Ifeoluwa Adelani, Edresson Casanova, Alp Öktem, Daniel Whitenack, Julian Weber, àti àwọn alájọṣiṣẹpọ̀, BibleTTS dúró gẹ́gẹ́ bí orísun ohùn ńlá tí a gbà ní sitúdíò fún àkópọ̀-ohùn èdè Áfíríkà [S11].
- Ohùn Tí A Gbà Sílẹ̀: Nǹkan bí wákàtí 33.3 ti ohùn sitúdíò tí ó mọ́, tí ẹnì kan ṣoṣo sọ, èyí tí a yọ tí a sì pín sí wẹ́wẹ́ láti inú ohùn kíkà Ìwé Mímọ́ tí kò tíì gbà àtúnṣe tí ó sì kún fún dídára tó lé ní wákàtí 80 [S11].
- Àwọn Kúlẹ̀kúlẹ̀ Físíìsì Ohùn: Ohùn dídára gíga 48 kHz, tí a pín ní pípé tí a sì tò bọ́ sí ipele ẹsẹ Bíbélì [S11].
- Ìwé Àṣẹ: Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) tí a gbé sí orí pẹpẹ gẹ́gẹ́ bí àkójọ data OpenSLR SLR129 [S11].
- Àwọn Ìdíwọ́: Àkójọ data náà mọ mọ́ olùsọ̀rọ̀ kan ṣoṣo, èyí tí ó dín oríṣiríṣi ìyàtọ̀ ohùn kù fún ìmọ̀-ohùn ọ̀pọ̀ olùsọ̀rọ̀, ó sì ń lo àwọn èdè ìjọ tàbí ti ẹ̀sìn pàtó [S11].
Àkójọ Ohùn Lagos-NWU Yorùbá
Tí a ṣe àgbékalẹ̀ rẹ̀ ní àjọṣepọ̀ ní ọdún 2012 láti ọwọ́ Daniel R. van Niekerk, Etienne Barnard, Oluwapelumi Giwa, àti Azeez Sosimi nípasẹ̀ àjọṣepọ̀ láàárín Centre for Text Technology (CTexT) ní North-West University àti University of Lagos, àkójọ data yìí pèsè ìwọ̀n ìṣe àkọ́kọ́ ti ohùn fún ìmọ̀ ẹ̀rọ ìṣètò ohùn [S12].
- Ohùn Tí A Gbà Sílẹ̀: Nǹkan bí wákàtí 2.75 ti ọ̀rọ̀ sísọ [S12].
- Àwọn Kúlẹ̀kúlẹ̀ Físíìsì Ohùn: A gbà á sílẹ̀ ní 16 kHz láti ọ̀dọ̀ àwọn olùsọ̀rọ̀ 33 (obìnrin 16, ọkùnrin 17), pẹ̀lú ẹnì kọ̀ọ̀kan tí ó ka nǹkan bí 130 gbólóhùn tí a pèsè lọ́nà fònẹ́tíìkì tí ó wà ní ìwọ́ntúnwọ̀nsì [S12].
- Ìwé Àṣẹ: Creative Commons Attribution 2.5 South Africa (CC BY 2.5 ZA) [S12].
- Àtúnyẹ̀wò Fònẹ́tíìkì: Ó wá pẹ̀lú àwọn ìwádìí àtúnyẹ̀wò tí ń ṣe àkọsílẹ̀ àmúyẹ ohùn gíga-àti-kíkorò, ìtòlẹ́sẹẹsẹ ohùn ti fundamental frequency ($F_0$), àti oríṣiríṣi ìyàtọ̀ dídára fáwẹ́lì lórí àwọn ipele ohùn [S12].
Mozilla Common Voice (Yorùbá)
Mozilla Common Voice jẹ́ pẹpẹ oní-èdè-púpọ̀ ńlá, tí a kó jọ láti ọ̀dọ̀ àwùjọ, tí gbogbo ènìyàn lè lò, tí a sì tẹ̀ jáde lábẹ́ àwọn àdéhùn agbègbè gbogbogbòò [S13].
- Ìwọ̀n: Ó ń pọ̀ sí i díẹ̀díẹ̀ nípasẹ̀ àwọn ojú-ìwé ìgbàsílẹ̀ àti ìfọwọ́sí láti ọ̀dọ̀ gbogbo ènìyàn. Ìmúwọlé àkọ́kọ́ pèsè nǹkan bí wákàtí 6 tí a fọwọ́ sí, pẹ̀lú àwọn àgbéjáde àkójọ data tuntun tí ń gbòòrò sí wákàtí 6 sí 10+ tí a fọwọ́ sí [S13].
- Ìwé Àṣẹ: Creative Commons Zero Universal 1.0 (CC0 1.0, Public Domain Dedication) [S13].
- Oríṣiríṣi Ohùn: Ó ní oríṣiríṣi ìpín àwùjọ tí ó gbòòrò, tí ń gba oríṣiríṣi máíkrofóònù, àyíká ariwo ẹ̀yìn, àwọn àkànṣe-ohùn, àti àwọn ipele ọjọ́ orí, bí ó tilẹ̀ jẹ́ pé ìyàtọ̀ nínú bí àkọsílẹ̀ ọ̀rọ̀ ṣe péye tó ń béèrè fún fílítà aládàáṣiṣẹ́ [S13].
Ìṣàlàyé lórí Àkọsílẹ̀ Iṣẹ́ Àkànṣe ALFFA
Wọ́n máa ń tọ́ka sí iṣẹ́ àkànṣe African Languages in the Field: speech Fundamentals and Automation (ALFFA) (Besacier et al., 2016) léraléra nínú àwọn ìwé ìmọ̀ NLP Áfíríkà gẹ́gẹ́ bí ìgbìyànjú ASR tí ó ṣí sílẹ̀ tí ó sì jẹ́ aṣáájú-ọ̀nà [S14].
- Àkíyèsí Àkọsílẹ̀: Ibùdó àkójọ àkọ́kọ́ ti ALFFA kò ní àkójọ data ohùn Yorùbá kankan [S14].
- Àkópọ̀ Tí A Ṣe Àkọsílẹ̀ Rẹ̀: Iṣẹ́ àkànṣe ALFFA ṣe àkójọ, àkọsílẹ̀, àti ìtúsílẹ̀ àwọn àkójọ data ohùn ní ti iṣẹ́ fún Amharic, Swahili, Wolof, Fongbe, àti Hausa (bíbẹ̀rẹ̀ láti OpenSLR SLR25) [S14].
- Ìṣàlàyé Onímọ̀: Bó tilẹ̀ jẹ́ pé àwọn àtúnyẹ̀wò ìwádìí míràn máa ń so ALFFA pọ̀ ní gbogbogbòò mọ́ àwọn ètò ohùn ní agbègbè ìsàlẹ̀ Sahara, kò sí àkójọ ohùn Yorùbá àkọ́kọ́ kankan tí a ṣe lábẹ́ iṣẹ́ àkànṣe náà [S14].
The Lacuna Fund àti Àwọn Ìrànwọ́ Owó fún Ètò Ìpìlẹ̀
The Lacuna Fund, èyí tí a ń darí nípasẹ̀ Meridian Institute, International Development Research Centre (IDRC), àti àwọn àjọ alájọṣiṣẹpọ̀, ń ṣiṣẹ́ bí ètò ìpèsè owó pàtó láti dín àlàfo data kù ní àwọn àyíká tí orísun wọn kéré [S15]. Kì í ṣe àkójọ data àdáṣe kan ṣoṣo, ṣùgbọ́n ó ń pèsè owó fún ọ̀wọ́ àwọn orísun NLP Yorùbá tí ó ṣí sílẹ̀ fún gbogbo ènìyàn [S15]:
- NaijaSenti: Àkójọ data ńlá fún àtúnyẹ̀wò èrò lórí Twitter tí ó ní nǹkan bí 30,000 tweets Yorùbá tí ènìyàn ṣe àkọsílẹ̀ sí [S15].
- MasakhaNER 2.0 / African POS: Àwọn àkójọ data ìdámọ̀ orúkọ tí a gbòòrò síi àti àkọsílẹ̀ ẹ̀yà-ọ̀rọ̀ (POS) tí ó kan oríṣiríṣi ìròyìn ti òde-òní àti àwọn agbègbè orí ẹ̀rọ ayélujára [S15].
- AFRIDOC-MT: Ìwọ̀n àyẹ̀wò tí a tò pẹ́sẹ́pẹ́sẹ́ ti àwọn àkọsílẹ̀ tí ó bára mu ti English–African tí ó tó 605 tí ń pèsè àyíká ọ̀rọ̀ tó bára mu ní ipele àkọsílẹ̀ títí kan Yorùbá [S15].
- NaijaVoices: Ètò ohùn ńlá tí ń fojúsùn nǹkan bí wákàtí 1,000 ti data ohùn láti ọ̀dọ̀ ọ̀pọ̀ olùsọ̀rọ̀ kọjá Yorùbá, Igbo, àti Hausa [S15].
- Ìlànà Ìwé Àṣẹ: Ó fi dandan lé àwọn ìlànà ìwé àṣẹ tí ó ṣí sílẹ̀, pẹ̀lú lílo Creative Commons Attribution 4.0 International (CC BY 4.0) ní pàtàkì pẹ̀lú àmì àìlo-fún-owó (CC BY-NC 4.0) tí a lò níbi tí àwọn ìdíwọ́ orísun data bá ti béèrè fún un [S15].
Àwọn Ìpèníjà Èdè àti Àwọn Ọ̀ràn Tí Kò Tíì Yanjú nínú Àwọn Àkójọ Data Dijítáà
Ìṣètò àwọn àkójọ data Yorùbá ń gbé àwọn ìpèníjà èdè, àkọtọ́, àti ètò wá tí ó ya ìṣètò èdè olóhùn sọ́tọ̀ kúrò nínú ìṣètò èdè tí kì í ṣe olóhùn.
Tone and Vowel Marking in Standard Yorùbá Orthography:
+--------+------------------+------------------+-----------------------+
| Vowel | High Tone (Ó) | Mid Tone (O) | Low Tone (Ò) |
+--------+------------------+------------------+-----------------------+
| e | é [e˥] | e [e˧] | è [e˩] |
| ẹ | ẹ́ [ɛ˥] | ẹ [ɛ˧] | ẹ̀ [ɛ˩] |
| o | ó [o˥] | o [o˧] | ò [o˩] |
| ọ | ọ́ [ɔ˥] | ọ [ɔ˧] | ọ̀ [ɔ˩] |
+--------+------------------+------------------+-----------------------+
Lílo Àmì Ohùn àti Àìdánilójú Ohùn
Yorùbá Ìwọ̀ntúnwọ̀nsì ń lo àwọn ohùn ipele mẹ́ta tí ń fúnra wọn yàtọ̀: Ó Ga (tí a fi àmì síwájú hàn: ´), Àárín (láìsí àmì), àti Ó Rẹlẹ̀ (tí a fi àmì sẹ́yìn hàn: `) [S4][S10]. Síwájú sí i, ó ń lo àwọn àmì àbẹ́ tàbí ìlà tààrà lábẹ́ àwọn fáwẹ́lì àti kọ́nsónáǹtì pàtó láti ya àwọn fáwẹ́lì àárín-síṣí sọ́tọ̀ kúrò lára àwọn fáwẹ́lì àárín-títì, àti kọ́nsónáǹtì postalveolar fricative kúrò lára alveolar sibilant:
- ẹ ([ɛ]) vs e ([e])
- ọ ([ɔ]) vs o ([o])
- ṣ ([ʃ]) vs s ([s])
Nígbà tí àwọn ẹ̀rọ afa-ọ̀rọ̀-ayélujára tàbí àwọn ọ̀nà ìkójọpọ̀ tí a kò ṣàtúnṣe bá fa àkọsílẹ̀ yọ láti àwọn pẹpẹ ayélujára, a máa ń bọ́ àwọn àmì kíkọ wọ̀nyí kúrò léraléra nítorí àwọn ààlà ìyípadà àkọsílẹ̀ bọ́tìnnì tàbí àìgbọ́ràn àwọn lẹ́tà dáradára [S4][S7]. Bíbọ́ àwọn àmì kíkọ kúrò ń dá àròpọ̀ àti àìṣe-kedere tó le gan-an sílẹ̀ nínú ìtumọ̀ ọ̀rọ̀. Fún àpẹẹrẹ, àkọsílẹ̀ lásán bí owo lè dúró fún àwọn ọ̀rọ̀ mẹ́rin ọ̀tọ̀ọ̀tọ̀ ní ìbámu pátápátá pẹ̀lú àwọn àmì ohùn àti àmì abẹ́ rẹ̀:
- owó (owó / owó ìnáwó)
- ọwọ́ (ọwọ́ / apá)
- ọ̀wọ̀ (ọ̀wọ̀ / ìbọ̀wọ̀ / ọwọ̀)
- òwò (òwò / iṣẹ́ ajé / ìṣòwò)
Àwọn àpẹẹrẹ ẹ̀rọ ìyípadà èdè tí a kọ́ lórí àwọn ọ̀rọ̀-méjì tí kò ní àmì ń gbé àwọn àbájáde tí kò dára jáde nítorí pé àìsí àmì ohùn àti àmì abẹ́ ń fọwọ́kọ àwọn ẹ̀ka ìtumọ̀ ọ̀tọ̀ọ̀tọ̀ sínú àwọn ọ̀rọ̀ tí wọ́n jọra ní ojú lásán [S4][S8].
Àìbáradọ́gba Ẹ̀ka Èdè
Àríyànjiyàn pàtàkì kan nínú ìgbékalẹ̀ àkójọpọ̀ ọ̀rọ̀ Yorùbá ni àìbáradọ́gba ẹ̀ka èdè. Àwọn ohun-èlò ọ̀rọ̀-méjì tó tóbi jùlọ tí ó wà fún gbogbo ènìyàn láti ìbẹ̀rẹ̀ wá láti àwọn ilé-iṣẹ́ ẹ̀sìn (bó tilẹ̀ jẹ́ ìyípadà Bíbélì ti ọdún 1884 àti àkójọpọ̀ dátà JW300) [S6]. Nípa báyìí, àwọn àpẹẹrẹ iṣirò àti ti ẹ̀rọ ìbẹ̀rẹ̀ fi iṣẹ́ tó ga hàn lórí àwọn èdè ẹ̀sìn àti ti ìwé àtijọ́, ṣùgbọ́n wọ́n dín kù nígbà tí a bá fi wọ́n wé àwọn àkọsílẹ̀ òde-òní ti òfin, ti ìmọ̀ ìṣègùn, ti ìmọ̀ ẹ̀rọ kọ̀ǹpútà, tàbí ti òṣèlú. Mímú MENYO-20k, MasakhaNER, àti MAFAND-MT wá ti dín àlàfo yìí kù ní apá kan nípa dídá àwọn ìlànà ìwọ̀n fún ìròyìn, ìbánisọ̀rọ̀, àti ti ayélujára sílẹ̀ [S2][S4][S5].
Àwọn Ìdènà Ìwé-àṣẹ àti Ìráyè Ṣíṣí-sílẹ̀
Ìpínyà tó wà gidi wà láàárín àwọn àkójọpọ̀ ọ̀rọ̀ ti aládàáni àti àwọn ìlànà ìwọ̀n ti àwùjọ tó ṣí sílẹ̀:
- Àwọn àkójọpọ̀ dátà aládàáni (bó tilẹ̀ jẹ́ Global Yorùbá Lexical Database lábẹ́ ìwé-àṣẹ LDC) ń béèrè fún ìforúkọsílẹ̀ ilé-iṣẹ́, èyí sì ń dí àwọn aṣẹ̀dá ètò kọ̀ǹpútà aládàáni tàbí ti orílẹ̀-èdè Nàìjíríà lọ́wọ́ [S1].
- Àwọn àríyànjiyàn lórí ẹ̀tọ́ àwòkọ (bó tilẹ̀ jẹ́ yíyọ kúrò àti àwọn ìdènà pípín JW300) ti tẹnumọ́ ewu tí ó wà nínú kíkó àwọn ọ̀rọ̀ láti àwọn ibi ti ìṣòwò tàbí ti àjọ láìsí àwọn ìwé-àṣẹ ṣíṣí sílẹ̀ tí ó ṣe kedere [S6].
- Àwọn ìgbésẹ̀ ṣíṣí sílẹ̀ (bó tilẹ̀ jẹ́ àwọn iṣẹ́-àkànṣe OpenSLR, Common Voice, àti Masakhane lábẹ́ àwọn ìwé-àṣẹ CC BY, CC BY-SA, àti CC0) ti dá àwọn ibi-ìtọ́jú tí a lè rí lò sílẹ̀, èyí tí ó fàyè gba pípín kiri láìsí ìdènà àti títún àwọn àpẹẹrẹ ohùn àti ọ̀rọ̀ kíkọ kọ́ [S2][S10][S13].
Àwọn Orísun [S1] Yíwọlá Awóyalé, Global Yoruba Lexical Database v. 1.0 (Linguistic Data Consortium, Philadelphia, 2008). Catalog No. LDC2008L03, DOI: 10.35111/6sp6-8p36. [S2] David Ifeoluwa Adelani, Jesujoba O. Alabi, Angela Fan, Julia Kreutzer, et al., "MasakhaNER: Named Entity Recognition for African Languages," Transactions of the Association for Computational Linguistics (TACL), Vol. 9 (MIT Press, 2021), pp. 1116–1131. [S3] David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Ayodele Awokoya, Cristina España-Bonet, and Dietrich Klakow, "MENYO-20k: A Multi-domain English-Yorùbá Corpus for Machine Translation and Domain Adaptation," Proceedings of the 1st Workshop on NLP for Positive Impact (Association for Computational Linguistics, 2021), pp. 11–18. [S4] David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Adesina Ayeni, Mofe Adeyemi, Ayodele Esther Awokoya, and Cristina España-Bonet, "The Effect of Domain and Diacritics in Yoruba–English Neural Machine Translation," Proceedings of Machine Translation Summit XVIII: Research Track (Association for Machine Translation in the Americas, 2021), pp. 61–73. [S5] David Ifeoluwa Adelani et al., "A Few Thousand Translations Go a Long Way! High Quality Translation Datasets for African Languages," Findings of the Association for Computational Linguistics: ACL 2022 (Association for Computational Linguistics, 2022), pp. 3053–3070. [S6] Željko Agić and Ivan Vulić, "JW300: A Wide-Coverage Parallel Corpus for Low-Resource Languages," Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics (Association for Computational Linguistics, 2019), pp. 3204–3210. [S7] Ahmed El-Kishky, Vishrav Chaudhary, Francisco Guzmán, and Philipp Koehn, "CCAligned: A Massive Collection of Cross-lingual Web-Document Pairs," Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) (Association for Computational Linguistics, 2020), pp. 5960–5969. [S8] Holger Schwenk, Guillaume Wenzek, Sergey Edunov, Edouard Grave, Armand Joulin, and Angela Fan, "CCMatrix: Mining Billions of High-Quality Parallel Sentences on the Web," Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (Association for Computational Linguistics, 2021), pp. 3890–3900. [S9] Naman Goyal, Cynthia Gao, Vishrav Chaudhary, Peng-Jen Chen, Guillaume Wenzek, Da Ju, Sanjana Krishnan, Marc'Aurelio Ranzato, Francisco Guzmán, Angela Fan, "The FLORES-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation," Transactions of the Association for Computational Linguistics (TACL), Vol. 10 (MIT Press, 2022), pp. 522–538; àti NLLB Team et al., "No Language Left Behind," arXiv preprint arXiv:2207.04672 (2022). [S10] Alexander Gutkin, Işın Demirşahin, Oddur Kjartansson, Clara Rivera, and Kọ́lá Túbọ̀sún, "Developing an Open-Source Corpus of Yoruba Speech," Proceedings of Interspeech 2020 (International Speech Communication Association, 2020), pp. 404–408. [S11] Josh Meyer, David Ifeoluwa Adelani, Edresson Casanova, Alp Öktem, Daniel Whitenack, Julian Weber, et al., "BibleTTS: a large, high-fidelity, multilingual, and uniquely African speech corpus," Proceedings of Interspeech 2022 (International Speech Communication Association, 2022), pp. 2868–2872. [S12] Daniel R. van Niekerk, Etienne Barnard, Oluwapelumi Giwa, and Azeez Sosimi, "Lagos-NWU Yoruba Speech Corpus / Tone realisation in a Yorùbá speech recognition corpus," North-West University CTexT & University of Lagos (2012); àti "Tone Realisation in a Yorùbá Speech Recognition Corpus," Spoken Language Technologies for Under-resourced Languages (SLTU 2012) (2012), pp. 88–93. [S13] Rosana Ardila, Megan Branson, Kelly Davis, Michael Henretty, Michael Kohler, Josh Meyer, Reuben Morais, Lindsay Saunders, Francis M. Tyers, and Gregor Weber, "Common Voice: A Massively-Multilingual Speech Corpus," Proceedings of the 12th Language Resources and Evaluation Conference (LREC 2020) (European Language Resources Association, 2020), pp. 4218–4222. [S14] Elodie Gauthier, Laurent Besacier, Sylvie Voisin, Michael Melese, and Uriel Pascal Elingui, Elodie Gauthier, Sylvie Voisin, Michael Melese, and Pascal Elingui, "Collecting Resources in Sub-Saharan African Languages for Automatic Speech Recognition: a Case Study of Wolof," Proceedings of the 10th International Conference on Language Resources and Evaluation (LREC 2016) (European Language Resources Association, 2016), pp. 1195–1200. [S15] Lacuna Fund Steering Committee & Secretariat, Lacuna Fund: Open Datasets & Use Cases (Meridian Institute / IDRC, 2020–lọ́wọ́lọ́wọ́). https://lacunafund.org