A plataforma de IA Qianwen, sob a Alibabá, lançou oficialmente o modelo Qwen3-Max-Flash a 27 de agosto, posicionado como uma arquitetura de especialistas híbridos multimodais (MoE), com foco na relação custo-benefício. O preço mais recente anunciado oficialmente é: cobrança de RMB¥0.80 por cada milhão de Tokens de entrada (aproximadamente HK$0), cobrança de RMB¥2.70 por cada milhão de Tokens de saída (aproximadamente HK$2), e cobrança de RMB¥0.10 por cada milhão de Tokens de cache hit (aproximadamente HK$0).
Qwen3-Max-Flash utiliza uma nova arquitetura de atenção híbrida
O Qwen3-Max-Flash adota uma arquitetura de próxima geração (Next) que é completamente diferente dos modelos anteriores da Qianwen, com um total de parâmetros na casa dos bilhões, mas apenas 6 bilhões (6B) de parâmetros ativados por inferência, afirmando redefinir o padrão de eficiência dos modelos globais. No que diz respeito ao mecanismo de atenção, o modelo introduz um mecanismo de atenção esparsa inovador chamado QSA (Qwen Sparse Attention), formando uma arquitetura de atenção híbrida que se funde eficientemente com o GDN, aumentando a velocidade de cálculo em mais de 8 vezes em cenários de alta taxa de acerto de cache e contextos longos de 1M Tokens, mantendo a precisão.
No que diz respeito à comunicação interna em camadas, o modelo utiliza um método de Gated Residual desenvolvido internamente, que divide o canal principal de informação único do Transformer em 4 canais independentes, permitindo que o modelo decida dinamicamente os caminhos de leitura e escrita conforme necessário, tornando a transmissão de informações mais eficiente e melhorando simultaneamente a estabilidade do treinamento. Este design altera o gargalo causado pelo canal único anterior, tornando o fluxo de gradientes durante o treinamento em larga escala mais suave.
51B N-gram Embedding melhora a eficiência de expansão de parâmetros
No que diz respeito à expansão de parâmetros, o modelo introduz adicionalmente 51B de parâmetros de N-gram Embedding, fornecendo uma funcionalidade eficiente de localização em tabela para o núcleo do Transformer. Este parâmetro não precisa ser ativado instantaneamente a cada cálculo de Token, mas apenas “plugado” como um manual de memória em larga escala com um consumo de recursos extremamente baixo, aumentando significativamente a eficiência de expansão de parâmetros do modelo e reduzindo os custos de treinamento. Através deste design desacoplado, o modelo consegue manter a velocidade de inferência enquanto pré-carrega mais conhecimento do mundo em parâmetros estáticos.
Em termos de ajuste de parâmetros, o Qwen3-Max-Flash adota uma estratégia de avanço colaborativo entre a estrutura do modelo e a otimização posterior, resultando em um aumento significativo na eficiência de convergência e na taxa de transferência de treinamento. Com base nas tecnologias mencionadas, o novo modelo pode fornecer serviços de inferência eficientes a um custo unitário mais baixo em cenários de tarefas reais como programação e agentes, oferecendo opções mais rentáveis para aplicações empresariais.
| Item | Especificações |
|---|---|
| Tipo de arquitetura | Especialistas híbridos multimodais (MoE) |
| Total de parâmetros | Na casa dos bilhões |
| Parâmetros ativados | 6 bilhões (6B) |
| Parâmetros de N-gram Embedding | 51B |
| Mecanismo de atenção | Arquitetura híbrida de atenção esparsa QSA + GDN |
| Aumento de velocidade em contextos longos | Aumento de mais de 8 vezes em cenários de alta taxa de acerto de cache de 1M Tokens |
| Preço de entrada | RMB¥0.80 (aproximadamente HK$0) |
| Preço de saída | RMB¥2.70 (aproximadamente HK$2) |
| Preço de cache hit | RMB¥0.10 (aproximadamente HK$0) |

