Qwen 3.8-Omni-Flash: Novo modelo da Qianwen com suporte para entrada multimodal e processamento de longos contextos

A nova geração do modelo nativo multimodal Qwen 3.8-Omni-Flash foi oficialmente lançada a 18 de setembro. Segundo informações, este modelo suporta entradas de texto, imagem, áudio e vídeo, e pode processar contextos de até 1M, sendo capaz de planear tarefas de forma autónoma, invocar ferramentas e completar criações e entregas com base na compreensão do conteúdo.

Qwen 3.8-Omni-Flash melhora a capacidade de processamento de áudio e vídeo

Em termos de funcionalidades, o Qwen 3.8-Omni-Flash mantém as capacidades de programação, processamento de texto e operação de GUI, ao mesmo tempo que expande ainda mais as capacidades de processamento de tarefas relacionadas com áudio e vídeo. Para a compreensão de longos vídeos, este modelo pode lidar com conteúdos de várias horas, decidindo quais informações visuais e sonoras focar com base nas questões apresentadas, e localizando conteúdos-chave através de múltiplos ciclos de verificação. Com a combinação de ferramentas, o modelo também pode extrair resumos, tarefas pendentes e informações de risco de reuniões, além de continuar a executar tarefas subsequentes como enviar e-mails, escrever código ou recuperar dados multimodais para gerar relatórios.

No que diz respeito à criação de áudio e vídeo, este modelo pode ser aplicado em cenários como produção de videoclipes, tradução de curtas-metragens e narração de longas-metragens. Por exemplo, na criação de videoclipes, o modelo consegue compreender a estrutura, o ritmo e a emoção da canção, produzindo letras de nível de frase com timestamps; na tradução de curtas-metragens, pode realizar identificação de personagens, tradução coloquial, clonagem de voz, remixagem de faixas de áudio e verificação de qualidade do produto final; no processamento de longas-metragens, pode realizar extração de enredos, planeamento de narrações, dublagem, edição e renderização, bem como verificação de qualidade final.

Além disso, o modelo pode transformar conteúdos de longos vídeos em ativos de informação reutilizáveis, incluindo a organização automática de pontos de conhecimento, decomposição de passos, geração de notas em PDF correspondentes a texto e imagem, e ainda transformá-los em habilidades de agente validadas e avaliadas. A versão de interação em tempo real Qwen 3.8-Omni-Flash-Realtime pode completar a percepção e a resposta de forma sincronizada durante o processo de entrada de áudio e vídeo, sendo adequada para práticas de conversação, percepção de áudio espacial e atendimento ao cliente inteligente.

No que diz respeito ao suporte, a empresa expandiu simultaneamente o Qwen-MM-Plugins, adicionando várias capacidades voltadas para a compreensão e criação de áudio e vídeo, e abriu o código do Qwen-Live Harness, para interações e execução de tarefas contínuas e em tempo real de áudio e vídeo. De acordo com dados oficiais, em um total de 30 avaliações, o Qwen 3.8-Omni-Flash teve uma pontuação média superior a 26% em comparação com a geração anterior Qwen 3.5-Omni-Plus; ao mesmo tempo, o preço de entrada de áudio por hora da API caiu mais de 98%, e o preço de entrada de vídeo por hora caiu mais de 93%.

Atualmente, este modelo já está disponível na plataforma de IA Qwen.

Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep