Plataforma de IA da Alibaba lança modelo Qwen3-Max-Flash com nova arquitectura de atenção híbrida

A plataforma de IA Qianwen, sob a Alibabá, lançou oficialmente o modelo Qwen3-Max-Flash a 27 de agosto, posicionado como uma arquitetura de especialistas híbridos multimodais (MoE), com foco na relação custo-benefício. O preço mais recente anunciado oficialmente é: cobrança de RMB¥0.80 por cada milhão de Tokens de entrada (aproximadamente HK$0), cobrança de RMB¥2.70 por cada milhão de Tokens de saída (aproximadamente HK$2), e cobrança de RMB¥0.10 por cada milhão de Tokens de cache hit (aproximadamente HK$0).

Qwen3-Max-Flash utiliza uma nova arquitetura de atenção híbrida

O Qwen3-Max-Flash adota uma arquitetura de próxima geração (Next) que é completamente diferente dos modelos anteriores da Qianwen, com um total de parâmetros na casa dos bilhões, mas apenas 6 bilhões (6B) de parâmetros ativados por inferência, afirmando redefinir o padrão de eficiência dos modelos globais. No que diz respeito ao mecanismo de atenção, o modelo introduz um mecanismo de atenção esparsa inovador chamado QSA (Qwen Sparse Attention), formando uma arquitetura de atenção híbrida que se funde eficientemente com o GDN, aumentando a velocidade de cálculo em mais de 8 vezes em cenários de alta taxa de acerto de cache e contextos longos de 1M Tokens, mantendo a precisão.

No que diz respeito à comunicação interna em camadas, o modelo utiliza um método de Gated Residual desenvolvido internamente, que divide o canal principal de informação único do Transformer em 4 canais independentes, permitindo que o modelo decida dinamicamente os caminhos de leitura e escrita conforme necessário, tornando a transmissão de informações mais eficiente e melhorando simultaneamente a estabilidade do treinamento. Este design altera o gargalo causado pelo canal único anterior, tornando o fluxo de gradientes durante o treinamento em larga escala mais suave.

51B N-gram Embedding melhora a eficiência de expansão de parâmetros

No que diz respeito à expansão de parâmetros, o modelo introduz adicionalmente 51B de parâmetros de N-gram Embedding, fornecendo uma funcionalidade eficiente de localização em tabela para o núcleo do Transformer. Este parâmetro não precisa ser ativado instantaneamente a cada cálculo de Token, mas apenas “plugado” como um manual de memória em larga escala com um consumo de recursos extremamente baixo, aumentando significativamente a eficiência de expansão de parâmetros do modelo e reduzindo os custos de treinamento. Através deste design desacoplado, o modelo consegue manter a velocidade de inferência enquanto pré-carrega mais conhecimento do mundo em parâmetros estáticos.

Em termos de ajuste de parâmetros, o Qwen3-Max-Flash adota uma estratégia de avanço colaborativo entre a estrutura do modelo e a otimização posterior, resultando em um aumento significativo na eficiência de convergência e na taxa de transferência de treinamento. Com base nas tecnologias mencionadas, o novo modelo pode fornecer serviços de inferência eficientes a um custo unitário mais baixo em cenários de tarefas reais como programação e agentes, oferecendo opções mais rentáveis para aplicações empresariais.

Item Especificações
Tipo de arquitetura Especialistas híbridos multimodais (MoE)
Total de parâmetros Na casa dos bilhões
Parâmetros ativados 6 bilhões (6B)
Parâmetros de N-gram Embedding 51B
Mecanismo de atenção Arquitetura híbrida de atenção esparsa QSA + GDN
Aumento de velocidade em contextos longos Aumento de mais de 8 vezes em cenários de alta taxa de acerto de cache de 1M Tokens
Preço de entrada RMB¥0.80 (aproximadamente HK$0)
Preço de saída RMB¥2.70 (aproximadamente HK$2)
Preço de cache hit RMB¥0.10 (aproximadamente HK$0)
Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep