Xiaomi lança modelo de reconhecimento de voz industrial Xiaomi-CocktailASR-1

A Xiaomi anunciou oficialmente e tornou open source o modelo de reconhecimento de voz para falantes-alvo de nível industrial Xiaomi-CocktailASR-1, com a notícia divulgada a 11 de setembro. De acordo com informações do Weibo oficial da Xiaomi, este modelo é especialmente desenvolvido para cenários de voz complexos com várias pessoas a falar ao mesmo tempo, focando na resolução do problema do “cocktail party” no reconhecimento de voz, ou seja, identificar e transcrever o conteúdo de voz do utilizador-alvo entre vários falantes em ambientes ruidosos.

Segundo a Xiaomi, o Xiaomi-CocktailASR-1 utiliza uma arquitetura LLM de ponta a ponta, aproveitando um segmento de áudio de referência do falante-alvo como um prompt de voz. Em situações de fala sobreposta de várias pessoas, consegue extrair e transcrever apenas o conteúdo do falante-alvo. A empresa destacou que este modelo foi treinado com dados de múltiplos falantes em larga escala e alcançou o melhor desempenho em vários conjuntos de testes de múltiplos falantes, como AliMeeting, AMI e LibriMix.

Xiaomi-CocktailASR-1 possui capacidade de reconhecimento de voz de múltiplos falantes

Além disso, o seu desempenho em cenários de falante único também é comparável aos modelos ASR de falante único mais populares, conseguindo atender tanto a cenários de falante único como de múltiplos falantes com o mesmo modelo, sem necessidade de alternar entre diferentes modelos de reconhecimento de voz. Adicionalmente, o modelo possui a capacidade de rejeição de amostras negativas, podendo gerar texto vazio quando não existe o falante-alvo no áudio, reduzindo assim o risco de erros de reconhecimento e ativação indevida causados por vozes não-alvo.

A Xiaomi também mencionou que o Xiaomi-CocktailASR-1 suporta o modo de raciocínio em cadeia, proporcionando um processo de raciocínio interpretável para os resultados de reconhecimento. Atualmente, os pesos do modelo e o código de inferência do Xiaomi-CocktailASR-1 já estão open source.

Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep