Harmony through alignment: unifying multimodal representations of sound and text across languages
| dc.contributor.advisor-co1 | Avila, Sandra Eliza Fontes de | |
| dc.contributor.advisor-co1Lattes | http://lattes.cnpq.br/8343699060914150 | |
| dc.contributor.advisor-co1Orcid | https://orcid.org/0000-0001-9068-938X | |
| dc.contributor.advisor1 | Silva, Nádia Félix Felipe da | |
| dc.contributor.advisor1Lattes | http://lattes.cnpq.br/7864834001694765 | |
| dc.contributor.advisor1Orcid | https://orcid.org/0000-0002-3875-2211 | |
| dc.contributor.referee1 | Silva, Nádia Félix Felipe da | |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/7864834001694765 | |
| dc.contributor.referee1Orcid | https://orcid.org/0000-0002-3875-2211 | |
| dc.contributor.referee2 | Berretta, Luciana de Oliveira | |
| dc.contributor.referee2Lattes | http://lattes.cnpq.br/0987947348533817 | |
| dc.contributor.referee2Orcid | https://orcid.org/0000-0003-1857-8989 | |
| dc.contributor.referee3 | Candido Junior, Arnaldo | |
| dc.contributor.referee3Lattes | http://lattes.cnpq.br/8769928331729891 | |
| dc.contributor.referee3Orcid | https://orcid.org/0000-0002-5647-0891 | |
| dc.creator | Ferreira, Alef Iury Siqueira | |
| dc.creator.Lattes | http://lattes.cnpq.br/1753857603723025 | |
| dc.creator.Orcid | https://orcid.org/0000-0002-9119-6357 | |
| dc.date.accessioned | 2026-09-18T13:39:27Z | |
| dc.date.available | 2026-09-18T13:39:27Z | |
| dc.date.issued | 2026-07-31 | |
| dc.description.abstract | The alignment of data modalities has achieved significant success, particularly in the text-image domain. However, extending these principles to create robust, multilingual representations of language and audio introduces distinct challenges that remain partially unaddressed in the literature. These include the scarcity of linguistically diverse text-audio datasets and the prohibitively high computing cost of training large-scale models. To address the high computational and data costs associated with multimodal expansion, this dissertation first introduces CACARA, a framework designed to integrate new modalities efficiently. CACARA employs an emergent alignment learning strategy. In our case, a new modality, audio, is aligned with a pre-trained and frozen multilingual image-text model. The model inherits the text encoder's rich multilingual capabilities by training our framework using only English data. This approach enables zero-shot cross-lingual and cross-modal retrieval, reducing training time and energy consumption. As a complementary contribution, this research presents PALMA (Pre-trained Audio-Language Multilingual Alignment via Mixture-of-Layers), a framework for the systematic design and optimization of bimodal language-audio models. PALMA goes beyond conventional methods by comprehensively evaluating state-of-the-art (SOTA) encoders and advanced training paradigms. Its central innovation is the “Mixture-of-Layers” (MoL) method. This learnable aggregation strategy fuses features from multiple encoder layers to create a richer, more nuanced audio representation. Empirical evaluations validate the proposed approaches, which achieve competitive results. Our findings give strong evidence that emergent alignment is a viable, scalable, and low-cost multimodal expansion strategy. This work contributes to the development of more accessible, efficient, and linguistically inclusive multimodal systems. | eng |
| dc.description.resumo | O alinhamento entre modalidades alcançou avanços significativos, especialmente no domínio textoimagem. Entretanto, a criação de representações robustas e multilíngues de linguagem e áudio ainda apresenta desafios, como a escassez de conjuntos de dados texto-áudio linguisticamente diversos e o elevado custo computacional do treinamento em larga escala. Para enfrentar essas limitações, esta dissertação apresenta o CACARA (Cross-Modal Alignment Leveraging a Text-Centric Approach for CostEffective Multimodal and Multilingual Learning), um framework para integrar novas modalidades de forma eficiente. O CACARA emprega uma estratégia de alinhamento emergente, na qual o áudio é alinhado a um modelo multilíngue texto-imagem pré-treinado e congelado. Utilizando apenas dados em inglês, o modelo herda as capacidades multilíngues do codificador textual, permitindo recuperação zero-shot entre línguas e modalidades, com menor tempo de treinamento e consumo de energia. Como contribuição complementar, esta pesquisa apresenta o PALMA (Pre-trained AudioLanguage Multilingual Alignment via Mixture-of-Layers), um framework para o desenvolvimento e a otimização de modelos bimodais de linguagem e áudio. O PALMA avalia codificadores de estado da arte e paradigmas modernos de treinamento multimodal. Sua principal inovação é o método “Mixture-of-Layers” (MoL), uma estratégia aprendível que combina características de múltiplas camadas do codificador para produzir representações de áudio mais ricas. As avaliações empíricas validam as abordagens propostas, que alcançam resultados competitivos. Nossos achados fornecem fortes evidências de que o alinhamento emergente é uma estratégia viável, escalável e de baixo custo para a expansão multimodal. Este trabalho contribui para o desenvolvimento de sistemas multimodais mais acessíveis, eficientes e linguisticamente inclusivos. | por |
| dc.identifier.citation | FERREIRA, Alef Iury Siqueira. Harmony through alignment: unifying multimodal representations of sound and text across languages. 2026. 239 f. Dissertação (Mestrado em Ciência da Computação) - Instituto de Informática (INF)Universidade Federal de Goiás, Goiânia, 2026. | |
| dc.identifier.uri | https://repositorio.bc.ufg.br/tede/handle/tede/15704 | |
| dc.language | Português | por |
| dc.publisher | Universidade Federal de Goiás | por |
| dc.publisher.country | Brasil | por |
| dc.publisher.department | Instituto de Informática - INF (RMG) | |
| dc.publisher.initials | UFG | por |
| dc.publisher.program | Programa de Pós-graduação em Ciência da Computação (INF) | |
| dc.rights | Acesso Aberto | |
| dc.rights.uri | https://creativecommons.org/licenses/by-nc-nd/4.0/ | |
| dc.subject | Multimodalidade | por |
| dc.subject | Alinhamento emergente | por |
| dc.subject | Aprendizado de representações | por |
| dc.subject | Aprendizado auto-supervisionado | por |
| dc.subject | Redes neurais profundas | por |
| dc.subject | Multimodality | eng |
| dc.subject | Ermergent aligment | eng |
| dc.subject | Representation learning | eng |
| dc.subject | Self-supervised learning | eng |
| dc.subject | Artificial neural networks | eng |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | |
| dc.title | Harmony through alignment: unifying multimodal representations of sound and text across languages | |
| dc.title.alternative | Harmonia por meio do alinhamento: unificando representações multimodais de áudio e texto entre línguas | por |
| dc.type | master thesis |
Arquivos
Pacote Original
1 - 1 de 1
Carregando...
- Nome:
- Dissertacao_Alef_Iury_Siqueira_Ferreira_-_2026.pdf
- Tamanho:
- 178.34 MB
- Formato:
- Adobe Portable Document Format