Cérebro

Postagens

Mostrando postagens com o rótulo Processamento de Áudio

Métodos Estocásticos Aprimoram Modelagem de Prosódia em Síntese de Fala

- julho 02, 2025

Gerar prosódia expressiva para uma fala sintética continua sendo um desafio significativo na síntese de texto para fala (TTS), especialmente em sistemas que modelam explicitamente parâmetros como tom, energia e duração para maior interpretabilidade e controlabilidade. Embora métodos generativos tenham avançado rapidamente, capturar a variabilidade inerente à fala humana de forma controlável permanece uma tarefa complexa. Um estudo recente, detalhado no artigo "Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis" disponível no arXiv (arXiv:2507.00227), investiga a eficácia de métodos estocásticos para esta tarefa. A pesquisa compara abordagens estocásticas, incluindo Normalizing Flows, Conditional Flow Matching e Rectified Flows, com uma linha de base determinística tradicional e realizações de fala humana real. As avaliações extensivas, tanto subjetivas quanto objetivas, demonstram que os métodos estocásticos são capazes de produzir prosódia natura...

Leia mais »

Melhorando o Rastreamento de Voz com Embeddings de Locutor

- junho 26, 2025

Métodos tradicionais de rastreamento de locutores frequentemente dependem de observações espaciais para manter a identidade das trilhas ao longo do tempo. Contudo, essa abordagem encontra dificuldades em cenários com locutores intermitentes ou em movimento. Locutores que mudam de posição enquanto estão inativos podem gerar trajetórias espaciais descontínuas, desafiando a atribuição coerente de identidades. Um artigo recente propõe investigar o uso de *speaker embeddings* (incorporações de locutor) como uma solução para este problema. A abordagem centra-se na reatribuição de identidade pós-rastreamento, utilizando essas representações vetoriais da voz dos locutores. O método proposto aproveita informações relacionadas à trajetória fornecidas por uma etapa inicial de rastreamento, combinadas com o sinal de áudio multicanal. A técnica de *beamforming* (conformação de feixe) é empregada para realçar o sinal na direção das posições dos locutores, visando a extração de *embeddings* de ...

Leia mais »

Aprendizagem Incremental Multimodal com Modelos Pré-Treinados e Fusão Adaptativa

- junho 13, 2025

Um recente artigo disponível no repositório arXiv, intitulado "Leveraging Pre-Trained Models for Multimodal Class-Incremental Learning under Adaptive Fusion" (arXiv:2506.09999), apresenta um novo método para a Aprendizagem Incremental de Classes Multimodais (MCIL). Ao contrário das abordagens tradicionais que frequentemente se limitam às modalidades de visão e texto, este trabalho explora a MCIL abrangendo visão, áudio e texto simultaneamente. O principal desafio abordado é a integração eficaz de informações complementares dessas diferentes modalidades, enquanto se mitiga o problema do esquecimento catastrófico, comum em cenários de aprendizagem incremental. Para superar essas dificuldades, os autores propõem um método MCIL inovador baseado no uso de modelos multimodais pré-treinados. A arquitetura proposta inclui vários componentes-chave. Primeiramente, um Extrator de Características Incremental Multimodal (MIFE), baseado na estrutura Mixture-of-Experts (MoE), é introduzi...

Leia mais »

Nova Abordagem Data-Driven Explica Deepfakes de Áudio

- junho 06, 2025

Uma nova pesquisa aborda o desafio de explicar por que modelos de detecção identificam áudios como falsos (deepfakes). Avaliar técnicas de explicabilidade, como SHAP e LRP, no contexto da detecção de deepfake de áudio é difícil devido à falta de anotações de verdade fundamental claras. Mesmo quando a verdade fundamental está disponível, esses métodos tradicionais frequentemente falham em fornecer explicações precisas. Para superar essa limitação, pesquisadores propuseram uma abordagem inovadora baseada em dados para identificar regiões com artefatos em áudios deepfake. O método utiliza pares de áudios reais e "vocoded" (sintetizados por vocoder), considerando a diferença em sua representação tempo-frequência como a verdade fundamental para a explicação. Essa representação é tipicamente um espectrograma log-magnitude, e a diferença entre o áudio falso (spoof) e o áudio real (bona fide) correspondente é usada para destacar as regiões de artefato. Para obter regiões significa...

Leia mais »