A DeepSeek lançou recentemente o novo modelo de IA de próxima geração V4.1-Flash. De acordo com a apresentação oficial, embora a V4.1-Flash tenha um total de parâmetros e parâmetros de ativação inferiores aos da V4-Pro, o seu desempenho, velocidade de inferência e controlo de custos são mais destacados, especialmente em tarefas relacionadas com agentes inteligentes e programação, com alguns resultados de testes de referência a ultrapassarem os modelos de ponta como a V4-Pro e a GPT-5.6 Sol.
DeepSeek V4.1-Flash destaca-se em desempenho e custos
A DeepSeek indica que a V4.1-Flash utiliza uma arquitetura de mistura de especialistas, com um total de 5520 milhões de parâmetros, 80 milhões de parâmetros de ativação na fase de entrada e 160 milhões na fase de saída. Em comparação, a geração anterior, V4-Flash, tinha um total de 2840 milhões de parâmetros, enquanto a V4-Pro alcançou 1.6 biliões. Uma das principais melhorias deste modelo é a compressão significativa do cache KV, que agora ocupa cerca de 890 bytes por token, enquanto a velocidade de saída atinge aproximadamente 214.4 tokens por segundo, com um tempo de resposta para o primeiro token de 1.13 segundos.
A agência de avaliação independente AA deu uma classificação de “velocidade significativamente mais rápida”.
Em termos de desempenho, a DeepSeek afirma que a V4.1-Flash, em configurações de alta intensidade de inferência, lidera em testes de operações de terminal, correção de código e tarefas de automação em comparação com a GPT 5.6 Sol e Claude Opus 5. No entanto, em tarefas gerais de raciocínio de alta dificuldade mais amplas, o desempenho deste modelo é relativamente mediano. Os dados da AA mostram que o índice de inteligência geral da V4.1-Flash é de 40 pontos, superior à mediana da maioria dos modelos de pesos de código aberto similares, mas ainda inferior aos modelos de ponta.
É importante notar que a AA atualizou recentemente o sistema de avaliação, tornando os critérios de pontuação mais rigorosos, resultando numa diminuição das pontuações de vários modelos de alta pontuação.
Em termos de preços, os dados da AA mostram que o custo da V4.1-Flash é de US$0.30 por cada 1 milhão de tokens de entrada (cerca de HK$2), e de US$1.20 por cada 1 milhão de tokens de saída (cerca de HK$9), com um custo total de cerca de US$0.18 (cerca de HK$1), inferior à mediana dos modelos da mesma categoria. Se houver acerto no cache, o preço pode descer ainda mais para US$0.01 por cada 1 milhão de tokens (cerca de HK$0). A AA também observa que este modelo tende a gerar respostas mais longas, resultando numa quantidade total de tokens de saída significativamente superior à de modelos similares, o que pode impactar o tempo e os custos na utilização prática.
No plano técnico, a V4.1-Flash introduz uma nova estrutura chamada CED, que divide as 40 camadas de Transformer em 20 camadas de codificadores causais e 20 camadas de decodificadores, reduzindo os cálculos repetidos causados pela atenção cruzada tradicional, e combinando métodos como CSA2 e quantização FP4 para comprimir o uso de cache e memória. De uma forma geral, a atualização da DeepSeek foca na otimização da execução de agentes, capacidades de codificação e custos de implementação.

