Harmony through alignment: unifying multimodal representations of sound and text across languages

dc.contributor.advisor-co1Avila, Sandra Eliza Fontes de
dc.contributor.advisor-co1Latteshttp://lattes.cnpq.br/8343699060914150
dc.contributor.advisor-co1Orcidhttps://orcid.org/0000-0001-9068-938X
dc.contributor.advisor1Silva, Nádia Félix Felipe da
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/7864834001694765
dc.contributor.advisor1Orcidhttps://orcid.org/0000-0002-3875-2211
dc.contributor.referee1Silva, Nádia Félix Felipe da
dc.contributor.referee1Latteshttp://lattes.cnpq.br/7864834001694765
dc.contributor.referee1Orcidhttps://orcid.org/0000-0002-3875-2211
dc.contributor.referee2Berretta, Luciana de Oliveira
dc.contributor.referee2Latteshttp://lattes.cnpq.br/0987947348533817
dc.contributor.referee2Orcidhttps://orcid.org/0000-0003-1857-8989
dc.contributor.referee3Candido Junior, Arnaldo
dc.contributor.referee3Latteshttp://lattes.cnpq.br/8769928331729891
dc.contributor.referee3Orcidhttps://orcid.org/0000-0002-5647-0891
dc.creatorFerreira, Alef Iury Siqueira
dc.creator.Latteshttp://lattes.cnpq.br/1753857603723025
dc.creator.Orcidhttps://orcid.org/0000-0002-9119-6357
dc.date.accessioned2026-09-18T13:39:27Z
dc.date.available2026-09-18T13:39:27Z
dc.date.issued2026-07-31
dc.description.abstractThe alignment of data modalities has achieved significant success, particularly in the text-image domain. However, extending these principles to create robust, multilingual representations of language and audio introduces distinct challenges that remain partially unaddressed in the literature. These include the scarcity of linguistically diverse text-audio datasets and the prohibitively high computing cost of training large-scale models. To address the high computational and data costs associated with multimodal expansion, this dissertation first introduces CACARA, a framework designed to integrate new modalities efficiently. CACARA employs an emergent alignment learning strategy. In our case, a new modality, audio, is aligned with a pre-trained and frozen multilingual image-text model. The model inherits the text encoder's rich multilingual capabilities by training our framework using only English data. This approach enables zero-shot cross-lingual and cross-modal retrieval, reducing training time and energy consumption. As a complementary contribution, this research presents PALMA (Pre-trained Audio-Language Multilingual Alignment via Mixture-of-Layers), a framework for the systematic design and optimization of bimodal language-audio models. PALMA goes beyond conventional methods by comprehensively evaluating state-of-the-art (SOTA) encoders and advanced training paradigms. Its central innovation is the “Mixture-of-Layers” (MoL) method. This learnable aggregation strategy fuses features from multiple encoder layers to create a richer, more nuanced audio representation. Empirical evaluations validate the proposed approaches, which achieve competitive results. Our findings give strong evidence that emergent alignment is a viable, scalable, and low-cost multimodal expansion strategy. This work contributes to the development of more accessible, efficient, and linguistically inclusive multimodal systems.eng
dc.description.resumoO alinhamento entre modalidades alcançou avanços significativos, especialmente no domínio textoimagem. Entretanto, a criação de representações robustas e multilíngues de linguagem e áudio ainda apresenta desafios, como a escassez de conjuntos de dados texto-áudio linguisticamente diversos e o elevado custo computacional do treinamento em larga escala. Para enfrentar essas limitações, esta dissertação apresenta o CACARA (Cross-Modal Alignment Leveraging a Text-Centric Approach for CostEffective Multimodal and Multilingual Learning), um framework para integrar novas modalidades de forma eficiente. O CACARA emprega uma estratégia de alinhamento emergente, na qual o áudio é alinhado a um modelo multilíngue texto-imagem pré-treinado e congelado. Utilizando apenas dados em inglês, o modelo herda as capacidades multilíngues do codificador textual, permitindo recuperação zero-shot entre línguas e modalidades, com menor tempo de treinamento e consumo de energia. Como contribuição complementar, esta pesquisa apresenta o PALMA (Pre-trained AudioLanguage Multilingual Alignment via Mixture-of-Layers), um framework para o desenvolvimento e a otimização de modelos bimodais de linguagem e áudio. O PALMA avalia codificadores de estado da arte e paradigmas modernos de treinamento multimodal. Sua principal inovação é o método “Mixture-of-Layers” (MoL), uma estratégia aprendível que combina características de múltiplas camadas do codificador para produzir representações de áudio mais ricas. As avaliações empíricas validam as abordagens propostas, que alcançam resultados competitivos. Nossos achados fornecem fortes evidências de que o alinhamento emergente é uma estratégia viável, escalável e de baixo custo para a expansão multimodal. Este trabalho contribui para o desenvolvimento de sistemas multimodais mais acessíveis, eficientes e linguisticamente inclusivos.por
dc.identifier.citationFERREIRA, Alef Iury Siqueira. Harmony through alignment: unifying multimodal representations of sound and text across languages. 2026. 239 f. Dissertação (Mestrado em Ciência da Computação) - Instituto de Informática (INF)Universidade Federal de Goiás, Goiânia, 2026.
dc.identifier.urihttps://repositorio.bc.ufg.br/tede/handle/tede/15704
dc.languagePortuguêspor
dc.publisherUniversidade Federal de Goiáspor
dc.publisher.countryBrasilpor
dc.publisher.departmentInstituto de Informática - INF (RMG)
dc.publisher.initialsUFGpor
dc.publisher.programPrograma de Pós-graduação em Ciência da Computação (INF)
dc.rightsAcesso Aberto
dc.rights.urihttps://creativecommons.org/licenses/by-nc-nd/4.0/
dc.subjectMultimodalidadepor
dc.subjectAlinhamento emergentepor
dc.subjectAprendizado de representaçõespor
dc.subjectAprendizado auto-supervisionadopor
dc.subjectRedes neurais profundaspor
dc.subjectMultimodalityeng
dc.subjectErmergent aligmenteng
dc.subjectRepresentation learningeng
dc.subjectSelf-supervised learningeng
dc.subjectArtificial neural networkseng
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
dc.titleHarmony through alignment: unifying multimodal representations of sound and text across languages
dc.title.alternativeHarmonia por meio do alinhamento: unificando representações multimodais de áudio e texto entre línguaspor
dc.typemaster thesis

Arquivos

Pacote Original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Dissertacao_Alef_Iury_Siqueira_Ferreira_-_2026.pdf
Tamanho:
178.34 MB
Formato:
Adobe Portable Document Format