A linguística computacional e o desenvolvimento de corpora em Yorùbá compreendem um conjunto estruturado de recursos lexicais, bitextos de tradução paralela, benchmarks de rotulagem de sequências e gravações acústicas de fala. Esses recursos documentam tanto o Yorùbá padrão (èdè Yorùbá gbogbogbò) quanto variedades da diáspora em domínios específicos, modalidades de gravação e modelos de licenciamento. O ecossistema abrange bases de dados lexicais com curadoria, conjuntos de dados acústicos de fala obtidos por crowdsourcing, fala lida gravada em estúdio por um único locutor, corpora de tradução automática multidomínio e textos minerados na web.
O desenvolvimento de recursos linguísticos de Yorùbá é caracterizado pela transição de antigas compilações lexicais proprietárias e traduções religiosas fortemente enviesadas para benchmarks comunitários de acesso aberto, projetados para lidar com a preservação de diacríticos, a ambiguidade tonal e o desequilíbrio de domínios. Este documento fornece um catálogo descritivo e uma visão geral analítica de todos os corpora verificados da língua Yorùbá, seus parâmetros quantitativos, licenciamento jurídico e limitações metodológicas.
Bases de Dados Lexicais e Dicionários
As bases de dados lexicais fornecem o inventário básico de lemas, propriedades fonéticas, glosas e padrões morfológicos necessários para a análise computacional. A base de dados lexical individual mais abrangente compilada para o idioma é a Global Yorùbá Lexical Database.
Global Yorùbá Lexical Database (v. 1.0)
Compilada por Yíwọlá Awóyalé e publicada por meio do Linguistic Data Consortium (LDC) em 2008, a Global Yorùbá Lexical Database é o maior dicionário eletrônico estruturado e repositório lexical para o Yorùbá e variedades correlatas [S1].
- Volume Total: Mais de 450.000 entradas lexicais e verbetes [S1].
- Distribuição dos Subcorpora: Mais de 368.000 entradas de Yorùbá padrão; aproximadamente 8.000 entradas de Lucumí (a variedade litúrgica preservada em Cuba); aproximadamente 3.600 entradas de Gullah; e aproximadamente 1.000 entradas de Yorùbá de Trinidad [S1].
- Licenciamento e Distribuição: Proprietário. O acesso é gerenciado estritamente por meio de Contratos de Usuário padrão do LDC para membros e não membros sob o identificador de catálogo LDC2008L03 [S1].
- Arquitetura Linguística: A base de dados incorpora sistematicamente marcações de tom e diacríticos em variantes padrão e da diáspora, documentando variações morfológicas, formações de compostos, reduplicações e divergências dialetais. A inclusão de variedades da diáspora atlântica oferece preservação lexical para a linguística histórica comparada e a crioulística [S1].
Database Metric Comparison:
+------------------------------------+--------------------------+
| Sub-Variety | Lexical Entries (approx) |
+------------------------------------+--------------------------+
| Standard Yorùbá | 368,000+ |
| Lucumí (Cuba) | 8,000 |
| Gullah (Sea Islands, US) | 3,600 |
| Trinidadian Yorùbá | 1,000 |
| Total Global Yorùbá Lexicon | 450,000+ |
+------------------------------------+--------------------------+
Benchmarks de Reconhecimento de Entidades Nomeadas e Rotulagem de Sequências
Até o desenvolvimento de iniciativas comunitárias direcionadas, as tarefas de rotulagem de sequências e extração de informações em Yorùbá sofriam com a ausência de padrões-ouro humanos verificados manualmente.
MasakhaNER
Publicado em 2021 por David Ifeoluwa Adelani, Jesujoba O. Alabi, Angela Fan, Julia Kreutzer e pelo coletivo de pesquisa Masakhane, o MasakhaNER estabeleceu o benchmark padrão anotado por humanos de reconhecimento de entidades nomeadas (NER) para línguas africanas, com Yorùbá como foco principal [S2].
- Tamanho e Divisões do Conjunto de Dados: O subcorpus de Yorùbá compreende 9.824 sentenças anotadas manualmente, extraídas de publicações de notícias locais contemporâneas, contendo aproximadamente 165.000 tokens [S2].
- Divisão de Treinamento: 6.877 sentenças.
- Divisão de Desenvolvimento: 983 sentenças.
- Divisão de Teste: 1.964 sentenças.
- Conjunto de Etiquetas: Categorias planas padronizadas de entidades nomeadas em quatro classes, englobando Nomes de Pessoas (PER), Localizações (LOC), Organizações (ORG) e Datas (DATE) [S2].
- Licenciamento: Lançado sob uma estrutura aberta na qual as anotações são licenciadas sob Creative Commons Atribuição-NãoComercial 4.0 Internacional (CC BY-NC 4.0), com o conjunto de dados agregado distribuído sob Creative Commons Atribuição 4.0 Internacional (CC BY 4.0), sujeito aos termos do domínio hospedeiro para os textos jornalísticos subjacentes [S2].
- Significância Metodológica: O MasakhaNER enfrentou a persistente falha da transferência zero-shot multilíngue a partir de modelos indo-europeus não tonais, demonstrando que tokens anotados por humanos na própria língua, portando tons e marcas de ponto inferior corretos, produzem uma detecção de limites e uma precisão de classificação superiores [S2].
Corpora de Bitextos Paralelos para Tradução Automática
Modelos de tradução automática (TA) exigem textos paralelos alinhados entre as línguas de origem e de destino. Os recursos paralelos de Yorùbá dividem-se em benchmarks multidomínio com curadoria, corpora religiosos abertos, avaliações profissionais multidirecionais e textos minerados na web sem curadoria.
Corpus Comparison: Machine Translation Bitexts
+--------------+------------------+--------------------------+-----------------------+
| Corpus | Sentence Pairs | Primary Domain | Licence |
+--------------+------------------+--------------------------+-----------------------+
| MENYO-20k | 20,100 | News, TED, Proverbs, TV | CC BY-NC 4.0 |
| MAFAND-MT | Multi-thousand | Human-translated News | CC BY / Open |
| JW300 | Large-scale (MT) | Religious Publications | Distribution Restrict |
| FLORES-101 | 1,012 (dev/test) | Multilingual Wikipedia | CC BY-SA 4.0 |
| CCAligned | Multi-million | Web Crawled (CommonCrawl)| Web Terms (Uncleaned) |
+--------------+------------------+--------------------------+-----------------------+
MENYO-20k
Criado por David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Adesina Ayeni, Mofe Adeyemi, Ayodele Esther Awokoya, Cristina España-Bonet e Dietrich Klakow, o MENYO-20k foi projetado para resolver a extrema superespecialização de domínio que anteriormente afetava a pesquisa em tradução de Yorùbá [S3][S4].
- Tamanho e Estrutura: 20.100 pares de frases paralelas inglês-Yorùbá particionados em 10.070 frases de treinamento, 3.397 de desenvolvimento e 6.633 de teste [S3][S4].
- Cobertura de Domínio: Um equilíbrio multidomínio limpo, extraído de artigos de notícias (Global Voices, Voice of Nigeria), palestras do TED, transcrições de filmes, transmissões de rádio, literatura digital e provérbios tradicionais Yorùbá (òwe) [S4].
- Normalização Ortográfica: O conjunto de dados padroniza manualmente as marcas de tom (alto, médio, baixo) e os pontos subscritos (ẹ, ọ, ṣ) para contrapor a diacritização não padronizada predominante em mídias digitais brutas [S4].
- Licenciamento: Creative Commons Atribuição-NãoComercial 4.0 Internacional (CC BY-NC 4.0), regido pelos termos de redistribuição de múltiplas fontes aplicáveis a etapas posteriores [S3].
MAFAND-MT
Publicado em 2022 por David Ifeoluwa Adelani e pela rede Masakhane, o MAFAND-MT (Masakhane A Few Thousand Translations) introduziu traduções humanas profissionais e de alta qualidade, focadas especificamente em domínios de notícias em diversas línguas africanas [S5].
- Arquitetura: Emparelha explicitamente o Yorùbá tanto com o inglês quanto com o francês para testar caminhos diretos de tradução de línguas veiculares para línguas indígenas, em vez de rotear exclusivamente pelo inglês [S5].
- Referência de Qualidade: Avaliado para demonstrar que mesmo alguns milhares de frases paralelas diacritizadas, de alta precisão e verificadas por humanos superam centenas de milhares de frases ruidosas extraídas da web no ajuste fino (fine-tuning) de tradução automática neural (NMT) [S5].
JW300
Extraído automaticamente por Željko Agić e Ivan Vulić em 2019, o JW300 foi gerado por meio da raspagem de artigos, revistas e folhetos paralelos do jw.org em centenas de línguas de baixos recursos, incluindo o Yorùbá [S6].
- Volume: Um dos maiores corpora paralelos individuais para o Yorùbá em número de frases, possibilitando experimentos iniciais de linha de base com MT neural profunda [S6].
- Distribuição e Status Legal: A distribuição do JW300 foi posteriormente interrompida e restrita devido a contestações formais de violação de direitos autorais apresentadas pelos detentores dos direitos da fonte [S6].
- Limitação de Domínio: O registro linguístico é exclusivamente de prosa didática religiosa e moral. A sintaxe e o vocabulário refletem a literatura cristã traduzida, o que desvia os modelos estatísticos dos padrões naturais da fala cotidiana, conversacional e coloquial [S6].
CCAligned e CCMatrix
Gerados por meio de fluxos de extração automatizados por Ahmed El-Kishky et al. (2020) e Holger Schwenk et al. (2021), o CCAligned e o CCMatrix mineraram pares de textos paralelos dos arquivos da web do Common Crawl usando incorporações (embeddings) multilíngues de documentos e frases [S7][S8].
- Características: Contagens massivas de tokens, fornecendo texto bruto da web para mineração exploratória ampla [S7][S8].
- Deficiências Documentadas: Avaliações acadêmicas revelam altas taxas de desalinhamento de frases, classificação incorreta de idiomas (como a mistura de Yorùbá com outras línguas da África Ocidental), truncamento estrutural e a remoção sistemática de marcas de tom e pontos subscritos diacríticos [S7][S8].
FLORES-101 e FLORES-200
Elaborado por Nsikak Goyal et al. (2022) e ampliado pela Equipe NLLB (2022), o benchmark de avaliação FLORES consiste em traduções humanas profissionais de 101 a mais de 200 línguas com base em artigos da Wikipédia em inglês [S9].
- Papel: Atua como uma partição padrão de avaliação paralela multidirecional, permitindo que conteúdos estritamente idênticos sejam comparados entre diversas famílias linguísticas sob padrões ortográficos normalizados [S9].
Corpora Acústicos e de Fala
Conjuntos de dados de fala exigem gravações de áudio emparelhadas com transcrições ortográficas precisas. Os conjuntos de dados de tecnologia de fala para o Yorùbá variam em diversidade de falantes, taxas de amostragem acústica, ambientes de gravação e total de horas.
Acoustic Speech Datasets: Parameters and Licensing
+---------------------+-------------+-------------+------------+--------------------+
| Dataset | Audio Hours | Sample Rate | Speakers | Licence |
+---------------------+-------------+-------------+------------+--------------------+
| BibleTTS (SLR129) | ~33.3 hrs | 48 kHz | 1 (studio) | CC BY-SA 4.0 |
| Mozilla Common Voice| ~6–10+ hrs | Variable | Mult./Crowd| CC0 1.0 (Public) |
| OpenSLR SLR86 | ~4.1 hrs | 48 kHz | 36 | CC BY-SA 4.0 |
| Lagos-NWU | ~2.75 hrs | 16 kHz | 33 | CC BY 2.5 ZA |
| ALFFA | 0 hrs (N/A) | N/A | N/A | MIT (No Yorùbá) |
+---------------------+-------------+-------------+------------+--------------------+
OpenSLR SLR86 (Conjunto de Dados de Fala de Yorùbá por Crowdsourcing)
Lançado em 2020 por Alexander Gutkin, Işın Demirşahin, Oddur Kjartansson, Clara Rivera e Kọ́lá Túbọ̀sún, o SLR86 é um corpus de fala de código aberto projetado especificamente para apoiar o desenvolvimento de reconhecimento de fala (ASR) e síntese de texto para fala (TTS) [S10].
- Áudio Gravado: Aproximadamente 4,1 horas de áudio de alta fidelidade obtido por crowdsourcing [S10].
- Detalhes Acústicos: Gravado a uma taxa de amostragem nativa de 48 kHz a partir de 36 falantes nativos de Yorùbá lendo textos de estímulo [S10].
- Licenciamento: Distribuído abertamente sob a licença Creative Commons Atribuição-CompartilhaIgual 4.0 Internacional (CC BY-SA 4.0) por meio do repositório OpenSLR [S10].
- Garantia de Qualidade: Os estímulos foram sistematicamente representados com marcas de tom e diacríticos verificados para assegurar que os contornos de altura na gravação acústica correspondessem com precisão à transcrição ortográfica [S10].
BibleTTS (Subconjunto de Yorùbá / SLR129)
Introduzido em 2022 por Josh Meyer, David Ifeoluwa Adelani, Edresson Casanova, Alp Öktem, Daniel Whitenack, Julian Weber e colaboradores, o BibleTTS representa um amplo recurso de fala gravado em estúdio para síntese de línguas africanas [S11].
- Áudio Gravado: Aproximadamente 33,3 horas de áudio limpo em estúdio com locutor único, derivado e segmentado a partir de mais de 80 horas de leituras bíblicas brutas de alta qualidade [S11].
- Detalhes Acústicos: Áudio de alta fidelidade a 48 kHz, precisamente segmentado e alinhado ao nível do versículo bíblico [S11].
- Licenciamento: Creative Commons Atribuição-CompartilhaIgual 4.0 Internacional (CC BY-SA 4.0) hospedado como o conjunto de dados OpenSLR SLR129 [S11].
- Limitações: O conjunto de dados é restrito a um único locutor, o que limita a variação acústica para o reconhecimento multi-locutor, e utiliza registros de linguagem eclesiástica especializada [S11].
Corpus de Fala Lagos-NWU Yorùbá
Desenvolvido em colaboração em 2012 por Daniel R. van Niekerk, Etienne Barnard, Oluwapelumi Giwa e Azeez Sosimi por meio de uma parceria entre o Centre for Text Technology (CTexT) da North-West University e a University of Lagos, este corpus forneceu uma referência acústica inicial para o processamento de fala [S12].
- Áudio Gravado: Aproximadamente 2,75 horas de fala [S12].
- Detalhes Acústicos: Gravado a 16 kHz em 33 locutores (16 mulheres, 17 homens), com cada participante lendo aproximadamente 130 enunciados balanceados e desenhados foneticamente [S12].
- Licenciamento: Creative Commons Atribuição 2.5 África do Sul (CC BY 2.5 ZA) [S12].
- Análise Fonética: Acompanhado por estudos analíticos que documentam a realização do contorno de tom, alinhamento tonal da frequência fundamental ($F_0$) e variações da qualidade vocálica entre registros tonais [S12].
Mozilla Common Voice (Yorùbá)
O Mozilla Common Voice é uma plataforma multilíngue massiva, com alimentação colaborativa e publicamente acessível, publicada sob termos de domínio público [S13].
- Volume: Acumula-se progressivamente por meio de interfaces públicas de gravação e validação. A integração inicial forneceu aproximadamente 6 horas validadas, com versões mais recentes do corpus expandindo para 6 a mais de 10 horas validadas [S13].
- Licenciamento: Creative Commons Zero Universal 1.0 (CC0 1.0, Dedicação ao Domínio Público) [S13].
- Diversidade Acústica: Apresenta ampla diversidade demográfica, capturando microfones variados, ambientes com ruído de fundo, sotaques e faixas etárias, embora a variação na fidelidade da transcrição exija filtragem automatizada [S13].
Esclarecimento sobre o Registro do Projeto ALFFA
O projeto African Languages in the Field: speech Fundamentals and Automation (ALFFA) (Besacier et al., 2016) é frequentemente citado na literatura mais ampla de PLN africano como um esforço seminal e aberto de ASR [S14].
- Nota de Registro: O repositório principal do ALFFA não contém nenhum conjunto de dados de fala de Yorùbá [S14].
- Cobertura Documentada: O projeto ALFFA compilou, documentou e disponibilizou oficialmente corpora de fala para Amharic, Swahili, Wolof, Fongbe e Hausa (como o OpenSLR SLR25) [S14].
- Esclarecimento Acadêmico: Embora revisões de pesquisas secundárias ocasionalmente associem o ALFFA genericamente a iniciativas de fala da África subsaariana, nenhum corpus primário de áudio de Yorùbá foi produzido no âmbito do projeto [S14].
O Lacuna Fund e Financiamentos de Infraestrutura
O Lacuna Fund, gerido por meio do Meridian Institute, do International Development Research Centre (IDRC) e de organizações associadas, opera como um mecanismo de financiamento direcionado para preencher lacunas de dados em contextos de baixos recursos [S15]. Ele não constitui um único conjunto de dados independente, mas financia uma série de recursos de PLN de Yorùbá em acesso aberto [S15]:
- NaijaSenti: Um corpus em grande escala para análise de sentimentos no Twitter, composto por aproximadamente 30.000 tuítes em Yorùbá anotados por humanos [S15].
- MasakhaNER 2.0 / African POS: Conjuntos de dados expandidos de reconhecimento de entidades nomeadas e anotações de classes gramaticais (POS) abrangendo diversos domínios contemporâneos de notícias e do meio digital [S15].
- AFRIDOC-MT: Um referencial de 605 documentos paralelos entre inglês e línguas africanas, fornecendo contexto paralelo em nível de documento, incluindo Yorùbá [S15].
- NaijaVoices: Uma iniciativa de fala em grande escala voltada para aproximadamente 1.000 horas de dados de fala de múltiplos locutores abrangendo Yorùbá, Igbo e Hausa [S15].
- Política de Licenciamento: Exige estruturas de licenciamento aberto, utilizando prioritariamente a licença Creative Commons Atribuição 4.0 Internacional (CC BY 4.0), com designações não comerciais (CC BY-NC 4.0) aplicadas quando as restrições dos dados de origem assim o exigirem [S15].
Desafios Linguísticos e Questões em Aberto em Corpora Digitais
A curadoria de corpora de Yorùbá apresenta desafios linguísticos, ortográficos e estruturais que diferenciam o processamento de línguas tonais daquele de línguas não tonais.
Tone and Vowel Marking in Standard Yorùbá Orthography:
+--------+------------------+------------------+-----------------------+
| Vowel | High Tone (Ó) | Mid Tone (O) | Low Tone (Ò) |
+--------+------------------+------------------+-----------------------+
| e | é [e˥] | e [e˧] | è [e˩] |
| ẹ | ẹ́ [ɛ˥] | ẹ [ɛ˧] | ẹ̀ [ɛ˩] |
| o | ó [o˥] | o [o˧] | ò [o˩] |
| ọ | ọ́ [ɔ˥] | ọ [ɔ˧] | ọ̀ [ɔ˩] |
+--------+------------------+------------------+-----------------------+
Diacritização e Ambiguidade Tonal
O Yorùbá padrão emprega três tons de registro contrastivos: Alto (marcado com acento agudo: ´), Médio (não marcado) e Baixo (marcado com acento grave: `) [S4][S10]. Além disso, utiliza pontos inferiores ou linhas verticais sob vogais e consoantes específicas para distinguir vogais semiabertas de vogais semifechadas, e a fricativa pós-alveolar da sibilante alveolar:
- ẹ ([ɛ]) vs. e ([e])
- ọ ([ɔ]) vs. o ([o])
- ṣ ([ʃ]) vs. s ([s])
Quando raspadores de dados (web scrapers) ou pipelines não curados extraem texto de plataformas digitais, esses sinais diacríticos são frequentemente removidos devido a limitações de codificação de teclado ou interpretações incorretas de caracteres [S4][S7]. A remoção de diacríticos gera uma severa ambiguidade semântica. Por exemplo, a sequência simples owo pode representar quatro itens lexicais distintos, dependendo inteiramente de suas configurações de tom e de pontos subscritos:
- owó (dinheiro / moeda)
- ọwọ́ (mão / braço)
- ọ̀wọ̀ (respeito / honra / vassoura)
- òwò (comércio / negócio / transação comercial)
Modelos de tradução automática treinados em bitextos não diacritizados produzem resultados degradados porque a perda de tom e de pontos subscritos colapsa categorias semânticas distintas em formas superficiais idênticas [S4][S8].
Desequilíbrio de Domínio
Uma tensão central no projeto de corpora em Yorùbá é a distorção de domínio. Os maiores recursos paralelos disponíveis publicamente derivaram historicamente de instituições religiosas (como a tradução da Bíblia de 1884 e o conjunto de dados JW300) [S6]. Consequentemente, os primeiros modelos estatísticos e neurais exibiram alto desempenho na sintaxe teológica e literária arcaica, mas degradaram quando avaliados em textos jurídicos, biomédicos, computacionais ou políticos contemporâneos. A introdução do MENYO-20k, MasakhaNER e MAFAND-MT mitigou parcialmente essa lacuna ao estabelecer referências (benchmarks) de notícias, diálogos e web [S2][S4][S5].
Barreiras de Licenciamento e Acesso Aberto
Existe uma divisão prática entre corpora proprietários e referências comunitárias abertas:
- Conjuntos de dados proprietários (como a Global Yorùbá Lexical Database sob licenciamento do LDC) exigem assinaturas institucionais, restringindo o acesso para desenvolvedores nigerianos independentes ou locais [S1].
- Disputas de direitos autorais (como a remoção e as restrições de distribuição do JW300) enfatizaram a precariedade da raspagem de domínios comerciais ou organizacionais sem licenças abertas explícitas [S6].
- Iniciativas abertas (como os projetos OpenSLR, Common Voice e Masakhane sob licenças CC BY, CC BY-SA e CC0) estabeleceram repositórios acessíveis que permitem a redistribuição e o retreinamento desimpedidos de modelos de fala e texto [S2][S10][S13].
Fontes [S1] Yíwọlá Awóyalé, Global Yoruba Lexical Database v. 1.0 (Linguistic Data Consortium, Philadelphia, 2008). Catálogo Nº LDC2008L03, DOI: 10.35111/6sp6-8p36. [S2] David Ifeoluwa Adelani, Jesujoba O. Alabi, Angela Fan, Julia Kreutzer, et al., "MasakhaNER: Named Entity Recognition for African Languages," Transactions of the Association for Computational Linguistics (TACL), Vol. 9 (MIT Press, 2021), pp. 1116–1131. [S3] David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Ayodele Awokoya, Cristina España-Bonet e Dietrich Klakow, "MENYO-20k: A Multi-domain English-Yorùbá Corpus for Machine Translation and Domain Adaptation," Proceedings of the 1st Workshop on NLP for Positive Impact (Association for Computational Linguistics, 2021), pp. 11–18. [S4] David Ifeoluwa Adelani, Dana Ruiter, Jesujoba O. Alabi, Damilola Adebonojo, Adesina Ayeni, Mofe Adeyemi, Ayodele Esther Awokoya e Cristina España-Bonet, "The Effect of Domain and Diacritics in Yoruba–English Neural Machine Translation," Proceedings of Machine Translation Summit XVIII: Research Track (Association for Machine Translation in the Americas, 2021), pp. 61–73. [S5] David Ifeoluwa Adelani et al., "A Few Thousand Translations Go a Long Way! High Quality Translation Datasets for African Languages," Findings of the Association for Computational Linguistics: ACL 2022 (Association for Computational Linguistics, 2022), pp. 3053–3070. [S6] Željko Agić e Ivan Vulić, "JW300: A Wide-Coverage Parallel Corpus for Low-Resource Languages," Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics (Association for Computational Linguistics, 2019), pp. 3204–3210. [S7] Ahmed El-Kishky, Vishrav Chaudhary, Francisco Guzmán e Philipp Koehn, "CCAligned: A Massive Collection of Cross-lingual Web-Document Pairs," Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) (Association for Computational Linguistics, 2020), pp. 5960–5969. [S8] Holger Schwenk, Guillaume Wenzek, Sergey Edunov, Edouard Grave, Armand Joulin e Angela Fan, "CCMatrix: Mining Billions of High-Quality Parallel Sentences on the Web," Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (Association for Computational Linguistics, 2021), pp. 3890–3900. [S9] Naman Goyal, Cynthia Gao, Vishrav Chaudhary, Peng-Jen Chen, Guillaume Wenzek, Da Ju, Sanjana Krishnan, Marc'Aurelio Ranzato, Francisco Guzmán, Angela Fan, "The FLORES-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation," Transactions of the Association for Computational Linguistics (TACL), Vol. 10 (MIT Press, 2022), pp. 522–538; e NLLB Team et al., "No Language Left Behind," arXiv preprint arXiv:2207.04672 (2022). [S10] Alexander Gutkin, Işın Demirşahin, Oddur Kjartansson, Clara Rivera e Kọ́lá Túbọ̀sún, "Developing an Open-Source Corpus of Yoruba Speech," Proceedings of Interspeech 2020 (International Speech Communication Association, 2020), pp. 404–408. [S11] Josh Meyer, David Ifeoluwa Adelani, Edresson Casanova, Alp Öktem, Daniel Whitenack, Julian Weber, et al., "BibleTTS: a large, high-fidelity, multilingual, and uniquely African speech corpus," Proceedings of Interspeech 2022 (International Speech Communication Association, 2022), pp. 2868–2872. [S12] Daniel R. van Niekerk, Etienne Barnard, Oluwapelumi Giwa e Azeez Sosimi, "Lagos-NWU Yoruba Speech Corpus / Tone realisation in a Yorùbá speech recognition corpus," North-West University CTexT & University of Lagos (2012); e "Tone Realisation in a Yorùbá Speech Recognition Corpus," Spoken Language Technologies for Under-resourced Languages (SLTU 2012) (2012), pp. 88–93. [S13] Rosana Ardila, Megan Branson, Kelly Davis, Michael Henretty, Michael Kohler, Josh Meyer, Reuben Morais, Lindsay Saunders, Francis M. Tyers e Gregor Weber, "Common Voice: A Massively-Multilingual Speech Corpus," Proceedings of the 12th Language Resources and Evaluation Conference (LREC 2020) (European Language Resources Association, 2020), pp. 4218–4222. [S14] Elodie Gauthier, Laurent Besacier, Sylvie Voisin, Michael Melese e Uriel Pascal Elingui, Elodie Gauthier, Sylvie Voisin, Michael Melese e Pascal Elingui, "Collecting Resources in Sub-Saharan African Languages for Automatic Speech Recognition: a Case Study of Wolof," Proceedings of the 10th International Conference on Language Resources and Evaluation (LREC 2016) (European Language Resources Association, 2016), pp. 1195–1200. [S15] Lacuna Fund Steering Committee & Secretariat, Lacuna Fund: Open Datasets & Use Cases (Meridian Institute / IDRC, 2020–presente). https://lacunafund.org