DeepSeek API lança plano de preços em pico e vale com custos reduzidos durante períodos de inatividade

A DeepSeek anunciou oficialmente que o preço da sua API adotará uma estrutura de preços de pico e vale, onde o preço durante os períodos de baixa será metade do preço durante os períodos de pico, e isso entra em vigor a partir de hoje. Esta medida visa oferecer flexibilidade às empresas e desenvolvedores em relação à pressão de custos em diferentes ritmos de trabalho, mantendo ao mesmo tempo os nomes e modos de uso do modelo de API originais, facilitando a escolha de uma experiência consistente para os utilizadores na APP, no web e na interface da API. Os períodos de pico são definidos como sendo entre as 9:00 e as 12:00 e entre as 14:00 e as 18:00, enquanto os restantes períodos são considerados períodos de baixa. Esta alteração na estrutura de preços significa que os custos de requisição durante o meio do dia de trabalho poderão sofrer alterações significativas, o que é especialmente crítico para aplicações que requerem um grande número de tokens.

A CNMO Tecnologia, em uma reportagem multifacetada, destacou que a distribuição de custos da série DeepSeek V4 também varia em diferentes períodos. No que diz respeito à versão V4-Flash, o custo de acerto de cache de entrada durante os períodos de baixa é de aproximadamente 0,05 yuan, enquanto o custo de falha de cache de entrada é de 1,5 yuan e o custo de saída é de 4,5 yuan; durante os períodos de pico, os custos são de 0,10 yuan, 3,0 yuan e 9,0 yuan, respetivamente. A curva de custos do V4-Pro é ainda mais acentuada, com 0,15 yuan para acertos de cache de entrada, 4,5 yuan para falhas de cache e 13,5 yuan para saída durante os períodos de baixa, e 0,30 yuan, 9,0 yuan e 27,0 yuan durante os períodos de pico. Estes números específicos fornecem uma referência crucial para os desenvolvedores na avaliação de custos, especialmente em cenários que requerem inferência contínua por longos períodos ou alta concorrência.

É importante notar que, antes do lançamento da nova estrutura de preços, a versão comercial do DeepSeek V4 Pro já foi atualizada simultaneamente na APP, web e API. Os utilizadores podem optar pelo “modo especialista” na APP ou na web para utilizar o novo modelo V4 Pro em versão oficial; o nome do modelo da API permanece inalterado, garantindo que os custos de integração para os desenvolvedores existentes sejam minimizados. Ao mesmo tempo, a DeepSeek também enfatiza que, no processo de inferência moderna, o cálculo de custos será centrado na quantidade real de chamadas e na taxa de acerto de cache, incentivando as empresas a manter um nível de serviço estável durante os períodos de pico. Se está a considerar migrar para o V4 Pro para obter uma qualidade de geração superior, mas está preocupado com a volatilidade dos custos, esta nova estrutura de preços de pico e vale pode oferecer previsões de custos relativamente controláveis.

Estratégias Comerciais e Riscos sob a Nova Estrutura de Preços

Do ponto de vista da estratégia comercial, a estrutura de preços de pico e vale pode oferecer aos utilizadores uma estrutura de custos mais flexível em diferentes períodos durante os dias de trabalho, especialmente para fornecedores de SaaS que têm como núcleo a produção de conteúdo, inferência de modelos de linguagem ou serviços de perguntas e respostas, permitindo reduzir os custos operacionais durante os períodos fora de pico e, assim, impulsionar a demanda dos utilizadores através de promoções ou janelas de tempo de amortecimento. Para a DeepSeek, isso também significa que a empresa precisa de relatórios de custos e utilização mais transparentes, permitindo que os clientes empresariais otimizem os seus fluxos de trabalho com base nos padrões de utilização reais, como agendar grandes lotes de operações durante os períodos de baixa para reduzir os gastos totais. Ao mesmo tempo, para os desenvolvedores, familiarizar-se com a distribuição de custos entre as diferentes versões durante os períodos de pico e de baixa ajudará a desenhar estratégias de cache e inferência distribuída mais eficazes.

Além disso, embora a empresa ainda não tenha divulgado detalhes de SLA a longo prazo, os observadores de mercado estão geralmente preocupados com o aumento dos custos durante os períodos de pico e o impacto que isso pode ter em aplicações de interação em tempo real. Para cenários que requerem respostas de baixa latência e alta estabilidade, as empresas podem considerar a utilização mista de diferentes modelos e estratégias de agendamento, como ativar o modo especialista durante períodos de alta concentração de pedidos dos utilizadores e voltar a modelos mais rentáveis durante os períodos de baixa, a fim de manter um equilíbrio entre custos e desempenho. Com base na experiência passada de alterações de preços, a transparência nas datas de atualização de versões, a estabilidade dos nomes de API e um bom suporte documental são fundamentais para reduzir os custos e riscos de migração. Quanto à estabilidade do modelo e atualizações a longo prazo, a resposta oficial da DeepSeek indica que, embora fenómenos como “apelidos” chamem a atenção, na verdade são marcadores de contexto no processo de inferência e não serão memorizados a longo prazo. Este ponto tem implicações importantes para a confiança dos utilizadores e a proteção da privacidade.

Em termos de detalhes técnicos, a mudança mais significativa no mercado diz respeito à definição do mecanismo de cache e dos custos de saída. Um acerto de cache de entrada representa que o conteúdo previamente armazenado pode ser rapidamente utilizado pelo modelo, reduzindo o custo total de chamadas; uma falha de cache requer recálculo, o que naturalmente aumenta os custos. O custo de saída está relacionado ao comprimento do texto e à complexidade do conteúdo gerado, tendo um impacto particularmente significativo em aplicações que requerem respostas longas ou diálogos de múltiplas rodadas. Para a DeepSeek, estes pontos de dados fornecem a base para otimizar a programação durante os períodos de baixa e pico, e ajudam os desenvolvedores a fazer previsões de custos mais precisas ao desenhar estratégias de chamadas de API. No futuro, se mais especificações de versões forem divulgadas, os desenvolvedores poderão estabelecer modelos de custos mais rigorosos com base em indicadores de desempenho reais.

Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep