A DeepSeek começou a substituir modelos anteriores pelo V4.1-Flash, sistema de inteligência artificial que já está disponível na API da empresa. A nova versão foi apresentada como a menor da família atual, mas reúne 552 bilhões de parâmetros — elementos usados para processar informações e produzir respostas.
A arquitetura ativa somente uma parcela dessa capacidade em cada tarefa. São 8 bilhões de parâmetros usados para receber informações e 16 bilhões empregados na geração das respostas. A proposta é aumentar a velocidade e atender a mais solicitações com menor consumo de recursos.
Menor demanda de memória e armazenamento
A DeepSeek afirma que o V4.1-Flash também foi desenvolvido para facilitar a criação de modelos maiores. O sistema tem compreensão visual nativa e pode interpretar imagens. Em testes realizados por diferentes partes, a empresa diz que o modelo superou o V4-Pro em desempenho, custo, velocidade e tempo total de execução.
Na comparação com a geração anterior, o V4.1-Flash exige um quarto da memória HBM e um oitavo do espaço de armazenamento SSD. A empresa também afirma que a tecnologia usa menos espaço para conservar informações das interações e menos recursos para lidar com esses dados.
A redução pode diminuir os custos de serviços que usam inteligência artificial por longos períodos, especialmente agentes capazes de realizar tarefas com menor intervenção humana. “Apresentamos o menor modelo da nossa nova família de arquitetura, com compreensão visual nativa”, afirmou a DeepSeek.
Mudança na linha disponível
Os modelos V4-Flash e V4-Flash-Vision-Exp foram retirados. Temporariamente, as solicitações destinadas a essas versões serão encaminhadas ao V4.1-Flash por meio da API.
O V4-Pro também será descontinuado de forma gradual. A partir de 14 de setembro de 2026, os pedidos enviados a esse modelo serão direcionados ao V4.1-Flash e terão a cobrança correspondente à nova versão. O procedimento seguirá até o lançamento do V4.1-Pro.
Os preços da API serão alterados em 10 de setembro. A DeepSeek mantém tarifas diferentes para períodos de maior e menor demanda; fora do horário de pico, o valor será equivalente à metade da tarifa de pico. “V4.1-Flash permite atender mais usuários a um custo menor. Estamos repassando essa economia para você.” A empresa também pretende trabalhar com a comunidade de código aberto para ampliar o suporte e estudar outras formas de implantação.







