Yorùbá Natural Language Processing and Speech Technology
A comprehensive scholarly survey of Yorùbá computational linguistics, covering automatic diacritic restoration, machine translation, speech recognition, speech synthesis, and community benchmarks.
Yorùbá Ìṣiṣẹ́ Èdè Àdánidá (Natural Language Processing - NLP) àti ìmọ̀ ẹ̀rọ ohùn ní nínú àwọn ọ̀nà ìṣirò kọ̀ǹpútà, àwọn àkójọ dátà, àti àwọn ìgbékalẹ̀ ẹ̀kọ́ ẹ̀rọ tí a gbé kalẹ̀ láti ṣiṣẹ́ lórí, túmọ̀, kọ sílẹ̀ láti inú ohùn, àti láti pèsè ohùn èdè Yorùbá. Nítorí pé Yorùbá jẹ́ èdè olóhùn tí a kọ nínú àkọtọ́ Látìnì tí a ṣàtúnṣe pẹ̀lú àwọn àmì abẹ́ àti àwọn àmì ohùn, àwọn ètò kọ̀ǹpútà ń dojú kọ àwọn ìdènà ìgbékalẹ̀ pàtàkì tí àwọn ọ̀nà ìṣiṣẹ́ lórí ọ̀rọ̀ tí a mọ̀ kò lè gba ààyè fún. Ní ogún ọdún sẹ́yìn, ẹ̀ka ìmọ̀ yìí ti gbèrú láti orí àwọn àwòṣe ìgbékalẹ̀ ohùn aláfiyèsí àti ti ìbẹ̀rẹ̀ tí a gbé karí òfin ní àwọn yàrá ìṣèwádìí yunifásítì sí àwọn ìwọ̀n àfiwé ìkópa gbòòrò, àwọn àkójọ ọ̀rọ̀ ìtúmọ̀ oríṣiríṣi agbègbè, àti àwọn ètò ohùn fún iṣòwò [S1][S2][S6][S9].
Àkọsílẹ̀ yìí ṣe àlàyé lẹ́sẹẹsẹ lórí ipò ìmọ̀ ẹ̀dá èdè ti kọ̀ǹpútà fún Yorùbá kọjá gbogbo àwọn agbègbè iṣẹ́ pàtàkì. Ó ṣe àyẹ̀wò àwọn àgbékalẹ̀ ìmọ̀ ẹ̀rọ tó wà láàárín àwọn àmì àkọtọ́ àti ìpéye ìtumọ̀, ó ṣe àtúnyẹ̀wò àwọn àkójọ dátà tí a fìdí wọn múlẹ̀ àti àwọn ìwọ̀n àfiwé alálugoridimu, ó ṣe ìgbéléwọ̀n ìyípadà láti orí àwọn ètò títìpa sí àwọn àgbékalẹ̀ ìkópa gbogbogbòò tí ó ṣí sílẹ̀, ó sì ṣe àkọsílẹ̀ àwọn ìwọ̀ntúnwọ̀nsì ìgbékalẹ̀ tí ó ṣì ń dojú kọ àwọn olùṣèwádìí.
The Orthographic and Phonological Landscape in Computation
Àkọtọ́ Yorùbá gbòòrò gbáralé àwọn àmì láti sàmì sí bí fáwẹ́lì sẹ́gímẹ́ntì ṣe rí àti àwọn àgbéga-ìrẹ̀lẹ̀ ohùn súpúrasẹ́gímẹ́ntì. Àwọn fáwẹ́lì tí ó ní àmì abẹ́ tàbí àmì inágan ìsàlẹ̀, pàápàá ẹ ([ɛ]), ọ ([ɔ]), àti kọ́ńsónáǹtì ṣ ([ʃ]), dúró fún àwọn fóníìmù ọ̀tọ̀ yàtọ̀ sí àwọn ẹlẹgbẹ́ wọn tí kò ní àmì bíi e ([e]), o ([o]), àti s ([s]). Ohùn súpúrasẹ́gímẹ́ntì ní ìpele ohùn mẹ́ta: òkè (tí a sàmì sí pẹ̀lú àmì òkè, bí nínú á), àárín (láìsí àmì, bí nínú a), àti ìsàlẹ̀ (tí a sàmì sí pẹ̀lú àmì ìsàlẹ̀, bí nínú à). A máa ń fi àmì àránmú hàn nínú àkọtọ́ pẹ̀lú lẹ́tà n tí ó tẹ̀lé e (fún àpẹẹrẹ, an, ẹn, in, ọn, un).
Owo (mid-mid): Hand / Broom
Owó (mid-high): Money
Ọwọ̀ (subdot low - subdot low): Respect / Honor
Ọ̀wọ́ (subdot low - subdot high): Group / Broom cluster
Ní àyíká ìṣirò kọ̀ǹpútà, fífò àwọn àmì wọ̀nyí dásílẹ̀ ń fa ìdàrúdàpọ̀ ìtumọ̀ ọ̀rọ̀ tí ó pọ̀ púpọ̀. Ọ̀rọ̀ kan ṣoṣo tí a kọ láìsí àmì bíi owo lè dúró fún oríṣi ọ̀rọ̀ ọ̀tọ̀ọ̀tọ̀ tí ó ju mẹ́rin lọ pẹ̀lú àwọn ìtumọ̀ tí kò tan mọ́ ara wọn rárá [S1][S3]. Nítorí pé ìgbálẹ̀ ọ̀rọ̀ orí ayélujára tí ó wọ́pọ̀ ń kó àwọn ọ̀rọ̀ Yorùbá tí a kọ sórí àwọn bọ́tìnì ìtẹ̀wé tí kò ní àtìlẹ́yìn fún àwọn lẹ́tà abínibí jọ, ọ̀pọ̀ jùlọ àwọn ọ̀rọ̀ tí a wa jáde lórí ayélujára ni kò ní àmì kankan, èyí sì ń fa ìdènà líle fún àwọn ìpele ìṣiṣẹ́ èdè tó kàn [S1][S3].
Original: Ọwọ́ tọ̀ ọ́.Literal gloss: Ọwọ́ (hand / group) tọ̀ (reach / visit) ọ́ (him / her / it).
Idiomatic English: A hand reached it / It was touched. (Rendered by corpus annotator).
Notes on the translation: Without tone marks, "Owo to o" could alternatively signify "Money is enough for him" (Owó tó o) or "Respect visits him" (Ọwọ̀ tọ̀ ọ́). The tone marks alone carry the grammatical and semantic distinctions.
Àwọn alálugoridimu ìpínyà ọ̀rọ̀ sí kékèèké (subword tokenization) tí a sábà ń lò nínú àwọn àwòṣe èdè olópolópò èdè ńlá, bíi Byte-Pair Encoding (BPE) àti WordPiece, ń sọ ìpèníjà yìí di púpọ̀ sí i. Àwọn ẹ̀rọ ìpín-ọ̀rọ̀ tí a mọ̀ máa ń pín àwọn fáwẹ́lì olóhùn sí àwọn lẹ́tà ìpìlẹ̀ àti àwọn àmì Unicode tí a kójọ lọ́tọ̀ọ̀tọ̀, èyí tí ń pín àwọn ọ̀rọ̀ Yorùbá sí oríṣiríṣi ẹ̀yà kéékèèké. Ìpínkípin yìí ń mú kí gígùn ìtòlẹ́sẹẹsẹ pọ̀ sí i, ó ń dín ìdúró ipò kù nínú àwọn àwòṣe transformer, ó sì ń mú kí ìwọ̀n àṣìṣe pọ̀ sí i nígbà ìṣàgbéjáde tó kàn [S7][S8].
Automatic Diacritic Restoration (ADR)
Nítorí pé àwọn ẹ̀rọ ìtumọ̀ èdè kọ̀ǹpútà tàbí àwọn ẹ̀rọ ìyí-ọ̀rọ̀-padà-sí-ohùn kò lè ṣàyẹ̀wò ọ̀rọ̀ tí kò ní àmì ní ọ̀nà tí ó dájú, Àtúnṣe Àmì Aládàáṣiṣẹ́ (Automatic Diacritic Restoration - ADR) jẹ́ ìgbésẹ̀ ìbẹ̀rẹ̀ pàtàkì nínú àwọn ọ̀nà ìṣiṣẹ́ lórí ọ̀rọ̀ Yorùbá [S1][S3].
+-------------------------------------------------------------+
| Automatic Diacritic Restoration |
| |
| Raw Input: owo -> [Sequence Processor] |
| Resolved Output: owó / ọwọ̀ / ọ̀wọ́ (Context Dependent) |
+-------------------------------------------------------------+
Ní àtẹ̀yìnwá, àtúnṣe àmì máa ń gbáralé wíwo àtúmọ̀-èdè, àwọn ìlànà ìṣe-ọ̀rọ̀ àti ìtò-ọ̀rọ̀ tí a gbé karí òfin, àti àwọn àwòṣe èdè n-gram nípele ọ̀rọ̀ tàbí lẹ́tà. Àwọn ọ̀nà wọ̀nyí máa ń dọ́wọ́ kọlẹ̀ nígbà tí wọ́n bá pàdé àwọn ọ̀rọ̀ tí kò sí nínú àkójọ ọ̀rọ̀, àwọn ìyípadà mọ́fọ́lọ́jì, tàbí àwọn àyíká ìtò-ọ̀rọ̀ tí ó díjú.
Ìyípadà ńlá ní ti ìlànà wáyé nígbà tí Iroro Orife fi hàn pé a lè gbé ADR Yorùbá kalẹ̀ gẹ́gẹ́ bí iṣẹ́ ìtúmọ̀ láti ìtòlẹ́sẹẹsẹ-sí-ìtòlẹ́sẹẹsẹ nípele lẹ́tà nípa lílo recurrent neural networks pẹ̀lú àwọn ẹ̀rọ àfiyèsí [S1]. Àwòṣe attentive sequence-to-sequence yìí máa ń gba gbólóhùn tí kò ní àmì gẹ́gẹ́ bí àwọn lẹ́tà àkọsínú tí ó sì ń ṣe àgbéjáde àwọn ìtòlẹ́sẹẹsẹ àkọtọ́ tí ó ní àmì ní kíkún, èyí tí ó ń gba àwọn ìbáṣepọ̀ àyíká ọ̀rọ̀ tó jìn síra wọn mú ní àṣeyọrí [S1]. Orife fi hàn pé ìgbékalẹ̀ neural yìí tayọ àwọn àbájáde ìpìlẹ̀ ti wíwo àtúmọ̀-èdè àtọwọ́dọ́wọ́ àti n-gram lọ́nà pípẹtẹ ní gbogbo àkójọ ọ̀rọ̀ ìgbéléwọ̀n tí ó wọ́pọ̀ [S1].
Open Debates and Domain Fragility
Àwọn onímọ̀ nínú NLP Yorùbá ṣì pín sí oríṣiríṣi èrò lórí ọ̀nà tí ó dára jùlọ láti gbé ADR kalẹ̀:
- Sequence Generation (Seq2Seq): Wíwo ADR gẹ́gẹ́ bí iṣẹ́ ìṣàgbéjáde ń fún àwòṣe náà láàyè láti yí gígùn ọ̀rọ̀ padà, fi àwọn àmì abẹ́ tí ó sọnù sí i, àti láti bójútó àtúntò lẹ́tà. Síbẹ̀síbẹ̀, ó ń mú ewu wíwá àwọn lẹ́tà àfikún tí kò sí wá tàbí yíyí àwọn kọ́ńsónáǹtì ìpìlẹ̀ padà [S1].
- Sequence Tagging (Token/Character Classification): Gbígbé ADR kalẹ̀ gẹ́gẹ́ bí ìṣòro fífún ìtòlẹ́sẹẹsẹ ní àmì ń fipá mú àwòṣe náà láti sọ tẹ́lẹ̀ àmì tí ó yẹ fún ipò lẹ́tà kọ̀ọ̀kan tí kò yípadà, èyí tí ń dènà ìṣẹ̀dá lẹ́tà àìtọ́. Àwọn olùtìlẹ́yìn sọ pé èyí ń rí i dájú pé àwọn lẹ́tà wà ní ìbámu dédé, nígbà tí àwọn alárìíwísí sọ pé ó ń ní ìṣòro pẹ̀lú àwọn àkọsílẹ̀ tí kò tẹ̀lé ìlànà gbòòrò níbi tí a ti yọ fáwẹ́lì kúrò tàbí tí a fẹ̀ ẹ́ sí i [S1].
Àléébù kan tí a ti fi sílẹ̀ nínú àwọn ìwé ìwádìí lórí ADR ni ìdínkù nínú agbára ìgbégbékalẹ̀ (domain transfer degradation). Àwọn àwòṣe tí a kọ́ lórí àwọn ọ̀rọ̀ ẹ̀sìn tí ó péye tí ó sì ní àmì-ohùn (irú bí àwọn ìtumọ̀ Bíbélì) máa ń ní ìsubú ńlá nínú ìpéye nígbà tí a bá ṣe àtúnyẹ̀wò wọn lórí àkọsílẹ̀ orí ẹ̀rọ ayélujára ti òde-òní tàbí àwọn ìròyìn aláìjẹ́-oníṣe tí ó ní àdàpọ̀ èdè àti àwọn ọ̀rọ̀-àdúgbò [S1][S3]. Síwájú sí i, àwọn ìwé tí a tẹ̀ jáde kò sọ ohunkóhun nípa mímú àwọn àmì-ohùn tó yàtọ̀ ní àwọn ẹ̀ka-èdè Yorùbá wà ní ìwọ̀ntúnwọ̀nsì, nítorí pé gbogbo àwọn ètò ADR tí ó wà lélẹ̀ ń ṣiṣẹ́ kìkì lórí Àkọsílẹ̀ Ìwọ̀ntúnwọ̀nsì Yorùbá [S1].
Ìtumọ̀ Ẹ̀rọ Aláìròtẹ́lẹ̀ (Neural Machine Translation) àti Ìgbẹ́kẹ̀lé lórí Àmì-ohùn
Ìtumọ̀ ẹ̀rọ fún Yorùbá ní ìtàn ìjìyà láti inú àìtó àwọn àkójọ dátà alákọsílẹ̀-méjì (parallel data) àti ìtẹ̀sí agbègbè ọ̀rọ̀ tó lágbára. Àwọn àkójọ dátà oní-èdè-púpọ̀ ti ìbẹ̀rẹ̀ gbẹ́kẹ̀lé àwọn àkójọ ọ̀rọ̀ ẹ̀sìn bíi JW300 lọ́nà tí kò dọ́gba, èyí tí ó mú kí àwọn àwòṣe náà gbé àwọn ìtumọ̀ tí ó gbó tàbí tí ó tẹ̀ sí ti Bíbélì jáde nígbà tí a bá lò wọ́n fún àkọsílẹ̀ gbogbogbò [S2][S3].
+-------------------------------------------------------------+
| The Yorùbá Translation Dilemma (MENYO-20k) |
| |
| Undiacritized Input ==> Significant BLEU Drop |
| Diacritized Input ==> High Semantic Fidelity |
| Fine-Tuned Multilingual (M2M-100) ==> +8 to +9 BLEU Gain |
+-------------------------------------------------------------+
Àwòṣe Ìkópa-pọ̀ (Masakhane)
Láti yanjú àwọn àbùkù tí ó wà nínú kíkó àkọsílẹ̀ jọ láti ibì kan, ẹgbẹ́ olùṣèwádìí Masakhane ṣe àgbékalẹ̀ ìlànà ìwádìí aláfọwọ́sowọ́pọ̀ fún ìmọ̀ ẹ̀rọ èdè àdánidá (NLP) ti Áfíríkà [S2]. Nípasẹ̀ ìtọ́sọ́nà Wilhelmina Nekoto àti àwọn ẹlẹgbẹ́ rẹ̀, ìlànà yìí so àwọn olùsọ èdè àbínibí, àwọn onímọ̀-èdè, àti àwọn onímọ̀ ẹ̀rọ kọ̀m̀pútà pọ̀ láti pèsè àwọn àkójọ dátà sísílẹ̀, láti fọwọ́sí àwọn àbájáde, àti láti kọ́ àwọn ìwọ̀n ìtọ́kasí ìtumọ̀ ẹ̀rọ fún èdè Áfíríkà tí ó ju ọgbọ̀n (30) lọ [S2]. Ìwádìí náà fìdí rẹ̀ múlẹ̀ pé àwọn àwòṣe oní-èdè-púpọ̀ ńlá tí a ń lò sábà máa ń kùnà gidigidi lórí àwọn èdè Áfíríkà àyàfi tí àwọn olùṣèwádìí agbègbè àti àwọn olùsọ èdè àbínibí bá kópa tààràtà nínú títò àwọn àkójọ dátà àti fífọwọ́sí àbájáde [S2].
Ìwọ̀n Ìtọ́kasí MENYO-20k
Nípa gbígbé karí ìlànà yìí, David Ifeoluwa Adelani àti àwọn olùfọwọ́sowọ́pọ̀ rẹ̀ ṣe àgbékalẹ̀ MENYO-20k, èyí tí í ṣe àkójọ ọ̀rọ̀ alákọsílẹ̀-méjì ti oríṣiríṣi ẹ̀ka tí a tò lọ́nà títọ́ tí ó ní àwọn gbólóhùn méjì-méjì 20,100 fún Yorùbá àti Èdè Gẹ̀ẹ́sì [S3]. Ìwọ̀n ìtọ́kasí náà gba orí ìròyìn, ìbánisọ̀rọ̀ orí ẹ̀rọ ayélujára, lítíréṣọ̀, àti àwọn ẹ̀ka ayélujára gbogbogbò kọjá.
Àwọn àdánwò MENYO-20k mú àbájáde pàtàkì méjì wá:
- Ipa tí Àmì-ohùn Ní: Yíyọ àwọn àmì-ohùn kúrò nínú àkọsílẹ̀ Yorùbá ń fa ìdínkù ńlá nínú dídára ìtumọ̀ ní gbogbo àwọn ìwọ̀n àwárí aládàáṣiṣẹ́. Nígbà tí àwọn àwòṣe bá gba àkọsílẹ̀ tí ó ní àmì-ohùn ní kíkún, ìdánilójú ìtumọ̀ ń sunwọ̀n síi gidigidi nítorí pé àwọn àìṣe-kedere nípa ohùn àti fóníìmù ni a ti mú kúrò láti orísun [S3].
- Ìbáramu pẹ̀lú Agbègbè Ọ̀rọ̀: Mímú àwọn àwòṣe oní-èdè-púpọ̀ gbogbogbò tí a ti kọ́ tẹ́lẹ̀ (bíi Facebook M2M-100) bára mu dáadáa lórí àwọn dátà mímọ́ tí ó jẹ́ ti inú agbègbè kan náà kọjá àwọn ìpìlẹ̀ ti ìṣòwò, tí ó sì mú ìlọsíwájú tí ó ju àmì BLEU +8 sí +9 wá ní ìfiwéra pẹ̀lú àwọn àwòṣe oní-èdè-púpọ̀ àbùdá tí a kàn rà láìtúnṣe [S3].
Àwọn Àbùkù Ìwọ̀n Ìdánwò
Kókó kan tí a mọ̀ sí ibi àríyànjiyàn nínú àwọn ìwé ìwádìí kan àwọn ìwọ̀n ìgbéléwọ̀n. Àwọn ìwọ̀n ìbáramu-ọ̀rọ̀ tí a mọ̀ bíi BLEU àti chrF ń ṣírò ìbáramu àmì tàbí lẹ́tà láìfi ìwọ̀n ìṣẹ̀lẹ̀ àṣìṣe àmì-ohùn tàbí àmì-ìsàlẹ̀ wọ̀n gẹ́gẹ́ bí ìbàjẹ́ tí ó lè fà sí ìtumọ̀ [S3]. Àmì-ìsàlẹ̀ kan ṣoṣo tí a gbàgbé tàbí àmì-òkè tí kò tọ́ lè yí ìtumọ̀ gbólóhùn padà pátápátá, síbẹ̀ àwọn ìwọ̀n ìbáramu-ọ̀rọ̀ ń wo àṣìṣe náà bí àìbáramu lẹ́tà kékeré kan. Àwùjọ àwọn olùṣèwádìí kò tíì fohùnṣọ̀kan lórí ìwọ̀n ìtumọ̀ ẹ̀rọ tí a gbà wọlé kárí-ayé fún pàtó Yorùbá tí yóò fìyà jẹ àwọn àṣìṣe àmì-ohùn ní ìbámu pẹ̀lú ìbàjẹ́ tí ó ṣe sí ìtumọ̀ [S3].
Ìdámọ̀ Àwọn Orúkọ Pàtó (Named Entity Recognition) àti Ẹ̀kọ́ Ìṣojú Àkọsílẹ̀
Ìdámọ̀ Àwọn Orúkọ Pàtó (NER) nínú Yorùbá ní àwọn ìpèníjà ìgbékalẹ̀ líle. Àwọn orúkọ pàtó nínú Yorùbá máa ń sábà jẹ́ àwọn gbólóhùn àdàpọ̀ tí ó ní àwọn ìtumọ̀ ọ̀rọ̀ gidi tí ó ní àwọn ìlànà àmì-ohùn, àwọn ọ̀rọ̀-ìṣe, àti àwọn ọ̀rọ̀-orúkọ nínú (fún àpẹẹrẹ, Ayọ̀délé, tí ó túmọ̀ sí "Joy has arrived home"). Lílo lẹ́tà ńlá nínú àkọsílẹ̀ orí ẹ̀rọ ayélujára kò ní ìbáramu rárá, bẹ́ẹ̀ sì ni a máa ń fi àwọn àmì-ohùn sílẹ̀ lọ́pọ̀ ìgbà, èyí tí ó ń mú kí àwọn ètò NER da orúkọ ènìyàn mọ̀ mọ́ àwọn ọ̀rọ̀-orúkọ gbogbogbò tàbí àwọn ọ̀rọ̀-ìṣe [S4].
Original: Ayọ̀délé lọ sí Èkó.Literal gloss: Ayọ̀délé (Joy-arrives-home) lọ (went) sí (to) Èkó (Lagos).
Idiomatic English: Ayodele went to Lagos. (Rendered by corpus annotator).
Notes on the translation: Without capitalization or tonal marks, "ayodele" can be read as a descriptive verb phrase rather than a proper personal name, confounding standard entity extractors.
MasakhaNER àti Ẹ̀kọ́ Ìkọ́nilẹ́kọ̀ọ́ Tẹ́lẹ̀ tí ó Bá Èdè Mu
Láti pèsè àwọn ìwọ̀n ìtọ́kasí tó péye, àwùjọ Masakhane dá MasakhaNER sílẹ̀, èyí tí í ṣe àkójọ dátà NER àkọ́kọ́ tí ènìyàn ṣe àkíyèsí sí tí ó bo àwọn èdè Áfíríkà, èyí tí a fẹ̀ síwájú sí MasakhaNER 2.0 lẹ́yìn náà [S4]. Àkójọ dátà náà ni àwọn onímọ̀-èdè tí wọ́n jẹ́ olùsọ èdè àbínibí ṣe àkọsílẹ̀ àkíyèsí sí láti mú àwọn ẹ̀ka orúkọ pàtó mẹ́rin: Orúkọ Ènìyàn (PER), Àwọn Ibì (LOC), Àwọn Àjọ (ORG), àti Àwọn Ọjọ́ (DATE) [S4].
Ìwádìí tí ó rìn pẹ̀lú rẹ̀, èyí tí David Ifeoluwa Adelani àti àwọn olùṣèwádìí ẹlẹgbẹ́ rẹ̀ kọ, fi àwọn ẹ̀kọ́ pàtàkì nínú ìṣojú àkọsílẹ̀ hàn:
- Àìtó Ìyípadà láti inú Èdè Olówó-orí (High-Resource Transfer): Ìyípadà kọjá-èdè tí a mọ̀ láti inú àwọn èdè Yúróòpù tí ó ní orísun púpọ̀ nípa lílo àwọn àwòṣe oní-èdè-púpọ̀ gbogbogbò (irú bí mBERT) ń mú àbájáde tí kò dára wá lórí àkọsílẹ̀ Yorùbá [S4].
- Ìyípadà Ìbáramu Ẹ̀ka-èdè (Typological Transfer): Ṣíṣe ìyípadà ìṣojú láàárín àwọn èdè Áfíríkà tí wọ́n jọra nípa ìrísí àti agbègbè tayọ ìyípadà láti inú Èdè Gẹ̀ẹ́sì tàbí Faransé lọ́pọ̀lọpọ̀ [S4].
- AfroXLMR: Ẹ̀kọ́ ìkọ́nilẹ́kọ̀ọ́ tẹ́lẹ̀ tí ó bá èdè mu lemọ́lemọ́ lórí àwọn àkójọ ọ̀rọ̀ Áfíríkà (tí ó ń mú àwọn àwòṣe pàtó bíi AfroXLMR jáde) ṣe àṣeyọrí tó ga jùlọ nípa ìwọ̀n F1 kọjá àwọn iṣẹ́ NER ti Yorùbá [S4].
Àwọn Ìlànà Ṣíṣe Àkíyèsí (Annotation Strategies)
Àwọn onímọ̀ ń jiyàn lórí bóyá àwọn àkójọ-data alátọwọ́dá tàbí èyí tí a bojútó láti ọ̀nà jéjì lè rọ́pò àwọn olùṣàmì-sí-ọ̀rọ̀ ènìyàn tí wọn kò pọ̀. Bó tilẹ̀ jẹ́ pé ìbojútó láti ọ̀nà jéjì ń jẹ́ kí fífẹ̀ àkójọ-data náà ní iye owó tó kéré ṣeé ṣe, Adelani et al. fi hàn pé ìbojútó láti ọ̀nà jéjì láìsí àṣẹ́kù tó mọ nípa àmì-ohùn máa ń mú àbùkù tó le wọlé, ní pípè àwọn ọ̀rọ̀ orúkọ gbogbogbòò tí ó gbára lé àmì-ohùn ní àwọn orúkọ pàtó lọ́nà tí kò tọ́ [S4]. Àkójọpọ̀ èrò wà títí di ìsinsìnyí pé àwọn ìlànà ìwọ̀n pàtàkì tí ènìyàn ṣe àmì sí ṣe kókó fún ìgbéléwọ̀n tó ṣeé gbẹ́kẹ̀lé [S4].
Ìtúpalẹ̀ Èrò àti Àwọn Àkójọ-Ọ̀rọ̀ Àjọṣepọ̀
Ṣíṣe ìmúlò èrò inú àkọsílẹ̀ oní-nọ́ńbà ní Yorùbá gba mímú èdè àìjẹ́-ti-ìfowósi, pípa-èdè-pọ̀ láàárín Yorùbá àti Nigerian English (tàbí Nigerian Pidgin), pẹ̀lú àkọtọ́ tí kò tẹ̀lé ìlànà pátápátá.
Láti gbé àwọn ìpìlẹ̀ ìṣirò-kọ̀mpútà kalẹ̀, àwùjọ náà kọ́ AfriSenti, ìwọ̀n ìtúpalẹ̀ èrò tó tóbi púpọ̀ tí ó ní àwọn àtẹ̀jáde Twitter tí a ṣàmì sí tí ó lé ní 110,000 kọjá àwọn èdè Áfíríkà 14, títí kan Yorùbá, Hausa, àti Igbo [S5]. Lábẹ́ ìdarí Shamsuddeen Hassan Muhammad àti àwọn alájọṣiṣẹ́ rẹ̀, àkójọ-data náà jẹ́ ìpìlẹ̀ fún iṣẹ́ àjọṣe SemEval-2023 Task 12 [S5].
+-------------------------------------------------------------+
| AfriSenti Benchmark Architecture |
| |
| 110,000+ Annotated Tweets across 14 African Languages |
| Includes Yorùbá, Hausa, Igbo |
| Gold standard for multi-class sentiment classification |
+-------------------------------------------------------------+
AfriSenti tẹnu mọ́ bí pípa-èdè-pọ̀ àti àwọn gbólóhùn orí ẹ̀rọ ayélujára tí kò ní àmì-ohùn ṣe ń dojú kọ àwọn ẹ̀rọ ìpín-sísọ̀rí oní-èdè-kan tí ó wọ́pọ̀ [S5]. Ṣíṣe ìgbéléwọ̀n àwọn àwòṣe lórí àkójọ-ọ̀rọ̀ yìí fihàn pé ìṣàtúnṣe tó dá lórí èdè pàtó kan lórí àwọn àkójọ-ọ̀rọ̀ àìjẹ́-ti-ìfowósi ṣe kókó fún àwọn ẹ̀rọ ìtẹ́tí-sí-àwùjọ àti ìwádìí èrò tó wúlò fún iṣẹ́ gidi [S5].
Ṣíṣe Ìmúlò Ohùn: Àwọn Ìpìlẹ̀, Àwòṣe Ìró-Ohùn, àti Àwọn Àkójọ-Ọ̀rọ̀
Àwọn ìmọ̀-ẹ̀rọ ohùn fún Yorùbá gbọ́dọ̀ ṣe àwòṣe fún àwọn ìpele àmì-ohùn mẹ́ta ọ̀tọ̀ọ̀tọ̀ (òkè, àárín, ìsàlẹ̀) pẹ̀lú àwọn àkójọ fáwẹ̀lì àti kọ́ńsónáǹtì afoníìmù tó wọ́pọ̀. Ìṣíkiri gíga-àti-ìsàlẹ̀ ohùn ń gbé ìtumọ̀ lẹ́síkà àti gírámà; ẹ̀rọ Automatic Speech Recognition (ASR) tí ó bá ṣe àkọsílẹ̀ àwọn ẹ̀yà ọ̀rọ̀ láìsí gíga-àti-ìsàlẹ̀ ohùn kò ní lè dá ìtumọ̀ ọ̀rọ̀ mọ̀, nígbà tí ẹ̀rọ Text-to-Speech (TTS) tí ó bá mú ohùn pẹẹrẹ jáde yóò dún bí èyí tí kò bá ti ẹ̀dá mu tí kò sì ṣeé gbọ́ yéye [S6][S7].
+-------------------------------------------------------------+
| Yorùbá Speech Architecture |
| |
| [F0 Fundamental Frequency] ---> [Pitch Contour Tracking] |
| [Acoustic Phonemes] ---> [Neural ASR / TTS Engine] |
| Outputs: Full Lexical Tone & Segmental Resolution |
+-------------------------------------------------------------+
Àwọn Ìpìlẹ̀ Ìbẹ̀rẹ̀: Ìmọ̀ Àmì-Ohùn àti Ìpín-Sílẹ́bù
Iṣẹ́ kọ̀mpútà ìbẹ̀rẹ̀ lórí àwòṣe ohùn Yorùbá ni a ṣe aṣáájú rẹ̀ ní Obafemi Awolowo University (OAU) láti ọwọ́ Ọdétúnjí Àjàdí Ọdẹ́jọbí [S6]. Ìwádìí Ọdẹ́jọbí's dá lórí àwọn ìgbì-ìṣíkiri ìpìlẹ̀ tí gíga-àti-ìsàlẹ̀ ohùn ($F_0$) tí a ṣe ìmúlò rẹ̀ nípasẹ̀ àwọn àwọ̀n nẹ́tíwọ́ọ̀kì atọwọ́dá láti ṣàṣeyọrí ìmọ̀ àmì-ohùn kọ̀mpútà àti ìpín-sílẹ́bù [S6].
Ọdẹ́jọbí fi hàn pé yíya àwọn ìṣíkiri gíga-àti-ìsàlẹ̀ ohùn sọ́tọ̀ àti títẹ̀lé àwọn ìyípadà ìgbì-ìṣíkiri ìpìlẹ̀ jẹ́ kí àwọn ìgbékalẹ̀ nẹ́tíwọ́ọ̀kì pín àwọn ìpele àmì-ohùn mẹ́tẹ̀ẹ̀ta ti Yorùbá sísọ̀rí lọ́nà tó péye láti inú àwọn àpẹẹrẹ ohùn àsọjáde, èyí tí ó fi ìpìlẹ̀ ìró-ohùn lélẹ̀ fún ìmúlò ohùn nípasẹ̀ ẹ̀rọ nẹ́tíwọ́ọ̀kì ti òde-òní [S6].
Àkójọ-Ọ̀rọ̀ ÌròyìnSpeech
Fún ohun tó ju ẹ̀wádún kan lẹ́yìn àwọn àyẹ̀wò ìbẹ̀rẹ̀ Ọdẹ́jọbí's, ìtẹ̀síwájú nínú ìmọ̀-ẹ̀rọ ohùn Yorùbá dojú kọ ìfàsẹ́yìn nítorí àìsí àkójọ-ọ̀rọ̀ ohùn tí ó ní àmì-ohùn lẹ́kùn-únrẹ́rẹ́ tí ó sì wà fún gbogbo ènìyàn. Ní ọdún 2024, ẹgbẹ́ àjọṣiṣẹ́ kan tí ó ní Tolúlọpẹ́ Ógúnrẹ̀mí, Kọ́lá Túbọ̀sún, Anuoluwapo Aremu, Iroro Orife, àti David Ifeoluwa Adelani ṣe ìfilọ́lẹ̀ ÌròyìnSpeech [S7].
+-------------------------------------------------------------+
| ÌròyìnSpeech Characteristics |
| |
| Total Duration: ~42 hours of diacritized speech |
| Speakers: 80 volunteer native speakers |
| Tasks Supported: ASR, Single-Speaker TTS, Multi-Speaker |
| Baseline ASR WER: 23.8% |
| TTS Data Req.: High-fidelity output at ~5 hours |
+-------------------------------------------------------------+
Àkójọ-data ÌròyìnSpeech ní nǹkan bí wákàtí 42 ti ohùn ìròyìn òde-òní tó ní àkọsílẹ̀ àmì kíkún tí ó sì dára púpọ̀, èyí tí àwọn olùsọ̀rọ̀ olùyọ̀ǹda 80 gbà sílẹ̀ [S7]. Àwọn ònkọ̀wé náà gbé àwọn ìwọ̀n ìpìlẹ̀ kalẹ̀ fún ASR àti TTS méjèèjì:
- Ìwọ̀n ASR: Ṣíṣe ìṣàtúnṣe àwọn àwòṣe ohùn ti òde-òní tí ń kọ́ ara wọn (bíi wav2vec 2.0 àti Whisper) lórí ÌròyìnSpeech gbé Word Error Rate (WER) ìpìlẹ̀ tí ó jẹ́ 23.8% kalẹ̀ lórí àwọn ìpín àdánwò tó wọ́pọ̀ [S7].
- Ìwọ̀n TTS: Ìwádìí náà fihàn pé àwọn ẹ̀rọ TTS olùsọ̀rọ̀-kan tó dára gidigidi lè gba ìdánilẹ́kọ̀ọ́ pẹ̀lú wákàtí 5 péré ti ohùn títọ́ tí ó ní àmì-ohùn kíkún, tí ó ń mú àwọn ìyípadà gíga-àti-ìsàlẹ̀ ohùn tí ó jẹ́ ti ẹ̀dá jáde kọjá àwọn ìpele àmì-ohùn [S7].
Ìyàtọ̀ Èka-Èdè àti Ìkálọ́wọ́kò ti Àkọtọ́ Ìfowósi
Àléébù ìgbékalẹ̀ pàtàkì kan nínú NLP Yorùbá ni bí a ṣe fẹ́rẹ̀ẹ́ jẹ́ pé Standard Written Yorùbá (SWY) nìkan ni a gbájúmọ́, èyí tí ó dá lórí àwọn èka-èdè Ọ̀yọ́ àti Èkó (Àríwá-Ìwọ̀-Oòrùn Yorùbá) nínú ìtàn [S7][S8].
Àwọn oríṣiríṣi èka-èdè káàkiri agbègbè tí ń sọ Yorùbá, bíi Ìjẹ̀bú, Èkìtì, Òndó, àti Ọ̀wọ̀, ń fi àwọn ìyípadà fònọ́lọ́jì, lẹ́síkà, àti ti àmì-ohùn tó hàn kedere hàn. Fún àpẹẹrẹ, àwọn ìyípadà fáwẹ̀lì pàtó, ìyọkúrò ìró, àti àwọn ọ̀rọ̀ lẹ́síkà míràn wọ́pọ̀ nínú ọ̀rọ̀ sísọ ojoojúmọ́ káàkiri àwọn àwùjọ agbègbè.
+-------------------------------------------------------------+
| Dialectal Performance Disparity |
| |
| Standard NW Yorùbá Training Data (Standard Models) |
| | |
| +---> High Accuracy on Standard News / Audio |
| | |
| +---> Severe Zero-Shot Performance Drop on |
| Regional Dialects (Ìjẹ̀bú, Èkìtì, Òndó) |
+-------------------------------------------------------------+
Láti wọn àlàfo iṣẹ́-ṣíṣe yìí, Tolúlọpẹ́ Ógúnrẹ̀mí àti àwọn akẹgbẹ́ rẹ̀ ṣe àgbékalẹ̀ YorùLect (tí a tẹ̀ jáde nínú ìgbésẹ̀ Voices Unheard) [S8]. Ìwádìí wọn ṣe ìgbéléwọ̀n àwọn àwòṣe ọ̀rọ̀ sísọ tí a kọ́ tẹ́lẹ̀ tí wọ́n gbajúmọ̀, bíi Massively Multilingual Speech (MMS) ti Meta àti Whisper ti OpenAI, kọjá àwọn ẹ̀ka-èdè agbègbè Yorùbá.
Àwọn àbájáde náà fi hàn pé àwọn àwòṣe ọ̀rọ̀ sísọ tí a kọ́ lórí Standard North-West Yorùbá nìkan máa ń ní ìdílùkù iṣẹ́-ṣíṣe zero-shot tó lágbára gidigidi nígbà tí wọ́n bá dojúkọ ohùn ẹ̀ka-èdè agbègbè [S8]. Àwọn olùkọ̀wé náà jiyàn pé kíkọ́ àwọn ìmọ̀-ẹ̀rọ ọ̀rọ̀ sísọ tí ó fi gbogbo ènìyàn sọ́kàn gba àkójọpọ̀ àkójọ ọ̀rọ̀ oní-ẹ̀ka-èdè púpọ̀ pẹ̀lú èrò tẹ́lẹ̀, dípò kíkòrò pé àwọn àwòṣe oníwọ̀n yóò ṣiṣẹ́ gbogbogbòò kọjá àwọn ààlà ẹ̀ka-èdè [S8].
Àyíká Ilé-Iṣẹ́ àti Ètò Ìpìlẹ̀ Orísun Ṣíṣí
Lẹ́gbẹ̀ẹ́ ìwádìí ilé-ẹ̀kọ́ gíga, ètò ìpìlẹ̀ ilé-iṣẹ́ àti ti orísun ṣíṣí fún ìmọ̀-ẹ̀rọ èdè Yorùbá ti jẹyọ, èyí tí ó ní àbùdá ìfọwọ́sowọ́pọ̀ láàárín àwọn ilé-iṣẹ́ tuntun ní Áfíríkà, àwọn àjọ ìjọba, àti àwọn àjọ ìwádìí àgbáyé.
+------------------------------------------------------------------+
| Yorùbá Language Tech Ecosystem |
| |
| Commercial & Startups: Spitch (STT/TTS via Cencori) |
| Open Models & Governance: Awarri & FMCIDE (Yoruba-ASR/N-ATLAS) |
| Academic / Grassroots: Masakhane, OAU Labs, ÌròyìnSpeech |
+------------------------------------------------------------------+
Àwọn Ìmúṣe Ìṣòwò: Spitch
Spitch jẹ́ ilé-iṣẹ́ ìmọ̀-ẹ̀rọ voice-AI ti Áfíríkà tí ń pèsè ètò ìpìlẹ̀ ọ̀rọ̀ sísọ tí ó yege fún lílò nínú iṣẹ́ [S9]. Tí a lè lò nípasẹ̀ àwọn application programming interface bíi Cencori AI Gateway, Spitch ń pèsè:
- Speech-to-Text (STT) fún Yorùbá, Hausa, Igbo, àti Amharic.
- Àmúlò Text-to-Speech (TTS) tí ó lágbára láti mú ohùn orin èdè ìbílẹ̀ jáde.
- Mímú Àmì Ohùn Padà Lágbára Ẹ̀rọ (Automatic Diacritics Restoration) tí a so pọ̀ mọ́ ṣíṣe àtúnṣe àkọsílẹ̀ ohùn àti àwọn ìmúṣe ilé-iṣẹ́ Interactive Voice Response (IVR) [S9].
Àwọn àkójọ ìdánilẹ́kọ̀ọ́ aládàáni àti àwọn ìwọ̀n àṣìṣe out-of-domain gangan fún àwọn ẹ̀rọ ìṣòwò tí a sé mọ́ bíi Spitch ṣì wà láìsí àkọsílẹ̀ nínú àwọn ìwé tí àwọn akẹgbẹ́ ṣe àtúpọ̀ rẹ̀, èyí tí ó fi àlàfo ìgbéléwọ̀n tí a fojú rí sílẹ̀ láàárín àwọn ìpèlé ìṣòwò àti àwọn ìwọ̀n ìdánwò gbogbogbòò.
Àwọn Ìfọwọ́sowọ́pọ̀ Orísun Ṣíṣí ti Ìjọba àti Ilé-Iṣẹ́: Awarri
Awarri, àjọ ìwádìí AI tí Silas Adekunle dá sílẹ̀, ti gbé àwọn àwòṣe ìpìlẹ̀ orísun ṣíṣí fún àwọn èdè Nàìjíríà lárugẹ nípasẹ̀ ìfọwọ́sowọ́pọ̀ pẹ̀lú àwọn ilé-iṣẹ́ ìjọba [S10].
Ní ìfọwọ́sowọ́pọ̀ pẹ̀lú Federal Ministry of Communications, Innovation, and Digital Economy (FMCIDE) ti Nàìjíríà àti National Centre for Artificial Intelligence and Robotics (NCAIR), Awarri ṣe àgbékalẹ̀ àti ìtúsílẹ̀:
Yoruba-ASR: Àwòṣe Whisper-Small orísun ṣíṣí tí a ṣe àtúnṣe rẹ̀ dáradára fún àwọn àyíká ọ̀rọ̀ sísọ ní Nàìjíríà [S10].N-ATLAS: Àwòṣe onírúurú èdè ti orísun ṣíṣí, tí ó tẹnumọ́ ohùn lákọ̀ọ́kọ́, tí ó kárí Yorùbá, Hausa, Igbo, àti Nigerian Pidgin, tí a tú sílẹ̀ láti pèsè ètò ìpìlẹ̀ èdè fún àwọn olùgbélékè aráàlú àti ti ìṣòwò [S10].
Àwọn Àlàfo, Ìforígbárí Ọ̀nà Ìṣe, àti Àwọn Ìṣòro Tí Kò Tí Ì Yanjú
Láìka ìtẹ̀síwájú kíákíá láti ọdún 2020 sí, NLP Yorùbá ṣì wà lábẹ́ ìhámọ́ àwọn àbájáde yíyàn tí a kò tí ì yanjú nínú àbá-èrò àti ọ̀nà ìṣe:
- Mímú Àmì Ohùn Ṣẹ Tipátipá vs. Agbára fún Ọ̀rọ̀ Tí Kò Ní Àmì: Àwọn olùwádìí kò fohùnṣọ̀kan lórí bóyá àwọn pipeline ìṣẹ̀dá ọ̀rọ̀ gbọ́dọ̀ pa á láṣẹ tipátipá pé mímú àmì ohùn padà lágbára ẹ̀rọ gbọ́dọ̀ jẹ́ ìgbésẹ̀ ìṣáájú tí a kò lè yẹ̀ sílẹ̀, tàbí kí wọ́n ṣe àgbékalẹ̀ àwọn encoder ìsàlẹ̀ tí wọ́n lágbára nínú ara wọn fún àwọn àmì ohùn tí kò sí. Mímú ADR ṣẹ tipátipá ń mú ìdádúró wá sínú pipeline ó sì ń sọ àwọn àṣìṣe ìmúpadà ti ìbẹ̀rẹ̀ di púpọ̀, nígbà tí fífò ADR dání ń pa àwọn àìṣe-tó-tọ́ nípa ìtumọ̀ tó lágbára mọ́ nínú latent space [S1][S3].
- Àìṣiṣẹ́-déédé Àwọn Subword Tokenizer: Àwọn algorithm subword oníwọ̀n ṣì ń pín àwọn fáwẹ́lì Yorùbá tí ó ní àmì ohùn sí àwọn lẹ́tà tí ó pín sí wẹ́wẹ́ àti àwọn Unicode combiner. Èyí ń mú kí gígùn ìtòlẹ́sẹẹsẹ pọ̀ sí i, ó sì ń mú kí lílo ìrántí-ìpamọ́ ga sí i nígbà ìdánilẹ́kọ̀ọ́. Subword tokenizer Yorùbá kan tí a yà sọ́tọ̀, tí a gbà wọlé níbi gbogbo, tí ó ń fi àwọn ẹ̀yà fáwẹ́lì-àmì papọ̀ hàn tààràtà, kò tí ì di èyí tí a fi ṣe ìlànà oníwọ̀n kọjá àwọn ibi ìfowópamọ́ àwòṣe pàtàkì [S7][S8].
- Àìsí Àkọtọ́ Ẹ̀ka-Èdè: Lẹ́yìn Yorùbá Àkọsílẹ̀ Oníwọ̀n, àwọn ẹ̀ka-èdè agbègbè tí kì í ṣe oníwọ̀n kò ní àwọn àdéhùn àkọtọ́ oníwọ̀n. Nítorí náà, iṣẹ́ ìmọ̀-ẹ̀rọ kọ̀ǹpútà lórí àwọn ẹ̀ka-èdè agbègbè dá dúró ní pàtàkì lórí ohùn ọ̀rọ̀ sísọ, nígbà tí NLP tí ó dá lórí ọ̀rọ̀ kíkọ ṣì wà ní èdè kan ṣoṣo ní North-West Yorùbá oníwọ̀n [S8].
- Àìtó Àwọn Ìwọ̀n Ìdánwò Ìṣòwò Tí Àwọn Akẹgbẹ́ Ṣe Àtúpọ̀ Rẹ̀: Bó tilẹ̀ jẹ́ pé àwọn pẹpẹ API ti ìṣòwò ń sọ pé àwọn ní ìpéye iṣẹ́ gíga lórí àwọn ìmúṣe ohùn ajùmọ̀sọ̀rọ̀, pípín àkójọ ìdánilẹ́kọ̀ọ́ wọn, bí wọ́n ṣe ń bójútó pípa-èdè-pọ̀ (code-switching), àti agbára wọn láti dènà ariwo ẹ̀yìn kò tí ì di èyí tí a fìdí rẹ̀ múlẹ̀ ní ọ̀nà ètò nínú àwọn ẹ̀kọ́ àfiwé tí àwọn akẹgbẹ́ ṣe àtúpọ̀ rẹ̀ [S9][S10].
Àkópọ̀ Àwọn Ìwọ̀n Ìdánwò àti Àkójọ Ọ̀rọ̀ Pàtàkì
| Ohun Èlò | Agbègbè Pàtàkì | Iṣẹ́ Pàtàkì | Ìtọ́kasí |
|---|---|---|---|
| MENYO-20k | Àkọsílẹ̀ oríṣiríṣi ẹ̀ka (Ìròyìn, Wẹ́ẹ̀bù, Lítíréṣọ̀) | Ìtumọ̀ Èdè Ẹ̀rọ Alájọṣepọ̀ | Adelani et al. (2021) [S3] |
| MasakhaNER / 2.0 | Ìròyìn àti Àwọn Àpilẹ̀kọ Agbègbè | Ìdámọ̀ Orúkọ Àkànṣe | Adelani et al. (2021) [S4] |
| AfriSenti | Mídíà Àwùjọ (Twitter) | Ìpínsípò Èrò Ọkàn | Muhammad et al. (2023) [S5] |
| ÌròyìnSpeech | Ọ̀rọ̀ Ìròyìn Orí Afẹ́fẹ́ (~wákàtí 42) | ASR, Ìpèsè TTS | Ógúnrẹ̀mí et al. (2024) [S7] |
| YorùLect (Voices Unheard) | Ọ̀rọ̀ Ẹ̀ka-èdè Agbègbè | Ìgbéléwọ̀n ASR fún Ẹ̀ka-èdè Púpọ̀ | Ógúnrẹ̀mí et al. (2024) [S8] |
| Yoruba-ASR / N-ATLAS | Àwọn Àwòṣe Ohùn / Èdè ti Oríṣiríṣi Ẹ̀ka | Ìdámọ̀ Ọ̀rọ̀ àti NLP Oní-ọ̀nà-púpọ̀ | Awarri & FMCIDE (2024) [S10] |