Nome do Projeto
Corpus Libras: Construção de Base de Dados para Estudos Linguísticos e Aprendizado de Máquina
Ênfase
Pesquisa
Data inicial - Data final
02/08/2026 - 02/08/2031
Unidade de Origem
Coordenador Atual
Área CNPq
Linguística, Letras e Artes
Resumo
O avanço das tecnologias de Processamento de Linguagem Natural (PLN) tem transformado a comunicação global, contudo, o Processamento de Línguas de Sinais (PLN-LS / Sign Language Processing) ainda enfrenta gargalos severos devido à escassez de recursos computacionais e estudos linguísticos estruturados em larga escala. Diante desse cenário, este projeto propõe a expansão, consolidação e o processamento computacional do Libras-UFPel Corpus. A proposta atua em duas frentes indissociáveis: serve como uma base de dados empírica voltada à extração de evidências linguísticas fundamentadas nos preceitos da Linguística de Corpus e, simultaneamente, como um ecossistema de dados para o desenvolvimento tecnológico de ferramentas de tradução automática e acessibilidade.
A pesquisa adota uma abordagem interdisciplinar na interface entre a Linguística das Línguas de Sinais, a Linguística de Corpus e o Aprendizado de Máquina, tomando como ponto de partida o material do Inventário Nacional de Libras (INL) em desenvolvimento na Universidade Federal de Pelotas (UFPel). O trabalho estrutura-se em três eixos fundamentais: (1) organização e preparação do material em vídeo de sinalização em Libras; (2) segmentação e anotação linguística densa em múltiplas camadas via software ELAN, estabelecendo critérios rigorosos de glosas padronizadas, expressões não manuais e lematização; e (3) a extração de dados linguísticos (como padrões gramaticais e estruturas sintáticas), em paralelo com a validação desses dados no treinamento de modelos computacionais de aprendizado profundo (Deep Learning) para tarefas de tradução automática neural (NMT).
Como resultado, o projeto visa fornecer à comunidade científica um corpus bilingue de referência, aberto, anotado e representativo, mitigando a sub-representação tecnológica e teórica da Libras. Para além das aplicações tecnológicas, a base de dados viabilizará investigações empíricas sobre a estrutura gramatical da Libras baseada no uso real. Espera-se, paralelamente, fortalecer o ecossistema de pesquisa local mediante a formação de recursos humanos qualificados nas subáreas de Linguística de Corpus e Processamento de Línguas de Sinais, consolidando uma linha de pesquisa estratégica e de longo prazo institucionalizada no Centro de Letras e Comunicação da UFPel.
Objetivo Geral
Consolidar e expandir o Libras-UFPel Corpus como um dataset multimodal e paralelo de referência (Libras-Português), utilizando o material do Inventário Nacional de Libras para constituir uma base de dados que sirva tanto para a extração de evidências linguísticas baseadas no uso quanto para o avanço de sistemas de tradução automática.
Justificativa
As línguas de sinais são historicamente classificadas como línguas de baixos recursos (low-resource languages) no ecossistema da inteligência artificial e carecem de grandes acervos digitais que permitam análises linguísticas em larga escala. A ausência de corpora paralelos estruturados impede tanto o avanço de tradutores automáticos eficientes quanto a realização de estudos gramaticais descritivos que superem análises baseadas apenas na intuição.
A relevância deste projeto reside no tratamento técnico-científico e linguístico de dados multimodais complexos baseados no uso real da Libras. Ao propor critérios claros de lematização e anotação padronizada em múltiplas camadas (glosas, funções sintáticas e expressões não manuais), a pesquisa resolve um problema metodológico central. Sob a ótica da Linguística de Corpus, o dataset funcionará como uma base empírica fundamental para extrair e descrever padrões de restrição sintático-espacial da língua. Sob a ótica tecnológica, validará o uso desses dados estruturados no treinamento de redes neurais. Institucionalmente, o projeto justifica-se pela necessidade de ancorar as atividades de orientação, iniciação científica e produção bibliográfica em uma estrutura de pesquisa formalizada com vigência de 5 anos junto à UFPel, com forte aderência à área de Linguística e Literatura da CAPES.
A relevância deste projeto reside no tratamento técnico-científico e linguístico de dados multimodais complexos baseados no uso real da Libras. Ao propor critérios claros de lematização e anotação padronizada em múltiplas camadas (glosas, funções sintáticas e expressões não manuais), a pesquisa resolve um problema metodológico central. Sob a ótica da Linguística de Corpus, o dataset funcionará como uma base empírica fundamental para extrair e descrever padrões de restrição sintático-espacial da língua. Sob a ótica tecnológica, validará o uso desses dados estruturados no treinamento de redes neurais. Institucionalmente, o projeto justifica-se pela necessidade de ancorar as atividades de orientação, iniciação científica e produção bibliográfica em uma estrutura de pesquisa formalizada com vigência de 5 anos junto à UFPel, com forte aderência à área de Linguística e Literatura da CAPES.
Metodologia
Metodologia
A metodologia proposta possui caráter experimental e interdisciplinar, dividida em quatro etapas operacionais:
Organização do Corpus: Seleção e preparação dos vídeos de sinalização em Libras a partir do acervo do Inventário Nacional de Libras (INL) na UFPel, assegurando o design e a representatividade dos dados.
Anotação Multimodal e Lematização: Utilização do software ELAN para a segmentação temporal dos vídeos. Serão aplicados critérios gramaticais de lematização e anotação em múltiplas camadas (tiers), mapeando glosas padronizadas, expressões não manuais e funções sintáticas.
Extração de Dados e Processamento Computacional: O corpus será explorado de forma dupla. Primeiramente, por meio de ferramentas de extração de dados linguísticos, gerando listas de frequências e concordâncias para análise da estrutura da Libras. Em segundo lugar, os dados estruturados serão aplicados em modelos de Tradução Automática Neural (NMT) baseados em arquiteturas Transformers para testar a eficiência do dataset em sistemas de aprendizado de máquina.
Disponibilização e Validação: Armazenamento dos dados em repositórios digitais acessíveis, gerando também um manual de anotação e lematização que sirva de apoio para futuras investigações na comunidade científica e no desenvolvimento de tecnologias assistivas.
A metodologia proposta possui caráter experimental e interdisciplinar, dividida em quatro etapas operacionais:
Organização do Corpus: Seleção e preparação dos vídeos de sinalização em Libras a partir do acervo do Inventário Nacional de Libras (INL) na UFPel, assegurando o design e a representatividade dos dados.
Anotação Multimodal e Lematização: Utilização do software ELAN para a segmentação temporal dos vídeos. Serão aplicados critérios gramaticais de lematização e anotação em múltiplas camadas (tiers), mapeando glosas padronizadas, expressões não manuais e funções sintáticas.
Extração de Dados e Processamento Computacional: O corpus será explorado de forma dupla. Primeiramente, por meio de ferramentas de extração de dados linguísticos, gerando listas de frequências e concordâncias para análise da estrutura da Libras. Em segundo lugar, os dados estruturados serão aplicados em modelos de Tradução Automática Neural (NMT) baseados em arquiteturas Transformers para testar a eficiência do dataset em sistemas de aprendizado de máquina.
Disponibilização e Validação: Armazenamento dos dados em repositórios digitais acessíveis, gerando também um manual de anotação e lematização que sirva de apoio para futuras investigações na comunidade científica e no desenvolvimento de tecnologias assistivas.
Indicadores, Metas e Resultados
Indicador 1: Expansão e Estruturação do Dataset
Meta: Estruturar o Libras-UFPel Corpus alcançando um volume expressivo de horas de vídeo anotadas, segmentadas e alinhadas ao português.
Resultado esperado: Disponibilização de um corpus paralelo bilingue anotado e de um repositório digital acessível.
Indicador 2: Extração de Dados e Descrição Linguística
Meta: Mapear e extrair padrões morfossintáticos e lexicais da Libras a partir das camadas anotadas, gerando insumos para investigações linguísticas.
Resultado esperado: Publicação de estudos descritivos da Libras baseados em evidências empíricas de uso (Linguística de Corpus) e elaboração de um manual de anotação e lematização.
Indicador 3: Produção Científica Interdisciplinar (Aderência CAPES)
Meta: Publicar no mínimo 4 artigos em periódicos indexados (Scopus/SciELO) e eventos qualificados na interface entre Linguística e Computação ao longo de 4 anos.
Resultado esperado: Consolidação de indicadores bibliográficos robustos para o PPGL.
Indicador 4: Formação de Recursos Humanos
Meta: Orientar e capacitar estudantes de Iniciação Científica (IC) e de pós-graduação no manejo de ferramentas de anotação (ELAN) e na análise linguística assistida por computador.
Resultado esperado: Formação de pesquisadores com competências interdisciplinares na interface Letras-Tecnologia na UFPel.
Meta: Estruturar o Libras-UFPel Corpus alcançando um volume expressivo de horas de vídeo anotadas, segmentadas e alinhadas ao português.
Resultado esperado: Disponibilização de um corpus paralelo bilingue anotado e de um repositório digital acessível.
Indicador 2: Extração de Dados e Descrição Linguística
Meta: Mapear e extrair padrões morfossintáticos e lexicais da Libras a partir das camadas anotadas, gerando insumos para investigações linguísticas.
Resultado esperado: Publicação de estudos descritivos da Libras baseados em evidências empíricas de uso (Linguística de Corpus) e elaboração de um manual de anotação e lematização.
Indicador 3: Produção Científica Interdisciplinar (Aderência CAPES)
Meta: Publicar no mínimo 4 artigos em periódicos indexados (Scopus/SciELO) e eventos qualificados na interface entre Linguística e Computação ao longo de 4 anos.
Resultado esperado: Consolidação de indicadores bibliográficos robustos para o PPGL.
Indicador 4: Formação de Recursos Humanos
Meta: Orientar e capacitar estudantes de Iniciação Científica (IC) e de pós-graduação no manejo de ferramentas de anotação (ELAN) e na análise linguística assistida por computador.
Resultado esperado: Formação de pesquisadores com competências interdisciplinares na interface Letras-Tecnologia na UFPel.
Equipe do Projeto
| Nome | CH Semanal | Data inicial | Data final |
|---|---|---|---|
| ANTONIELLE CANTARELLI MARTINS | 6 |