A DeepSeek lançou nesta sexta-feira (21) o V4 Flash Vision, um modelo experimental que recebe texto e imagens na mesma conversa. Ele consegue ler capturas de tela, interpretar gráficos, descrever fotografias e usar essas informações em tarefas executadas por agentes de IA, programas que combinam o modelo com ferramentas para concluir uma atividade com menos intervenção humana.
A empresa diz que o novo modelo se aproxima do Claude Opus 4.8, da Anthropic, em testes de agentes que exigem compreensão visual, mantendo o preço do V4 Flash. A comparação precisa de contexto: os resultados foram publicados pela própria DeepSeek, o modelo venceu o Opus em três de onze avaliações e ainda não há uma medição independente contra o Claude Opus 5.
A nota oficial de lançamento confirma que o V4 Flash Vision chegou à API em 21 de agosto de 2026. A DeepSeek diz que o modelo preserva as capacidades de texto do V4 Flash e se aproxima do Opus 4.8 em avaliações de agentes que precisam interpretar imagens.
A tabela publicada pela DeepSeek mostra uma comparação mais limitada do que o título pode sugerir. O novo modelo supera o Opus 4.8 em três de onze testes, fica muito próximo em alguns e perde por 12 pontos no NL2Repo. A análise do TNW também ressalta que todos os números foram produzidos pela fabricante e que não há comparação com o Opus 5.
Na página de preços, o V4 Flash Vision custa de US$ 0,22 a US$ 0,44 por milhão de tokens de entrada sem cache e de US$ 0,66 a US$ 1,32 por milhão de tokens de saída, conforme o horário. O guia de visão informa que o modelo aceita imagens, mas retorna texto.
A publicação compartilhada por Guizang no X repetiu os pontos do anúncio oficial e exibiu o gráfico da DeepSeek. Para geração de imagens, o produto correto é o Janus-Pro, família separada que entende imagens e cria resultados a partir de texto.
O que a DeepSeek lançou
O nome completo é DeepSeek-V4-Flash-Vision-Exp. A parte “Vision” indica que o modelo consegue analisar imagens, enquanto “Exp” mostra que esta é uma versão experimental, sujeita a mudanças antes de uma edição estável.
O modelo aceita JPEG, PNG, GIF e WebP junto com o texto. Na prática, um desenvolvedor pode enviar uma captura de tela e pedir que a IA encontre um erro na interface, anexar um gráfico para receber uma explicação ou fornecer a foto de um documento para extrair informações.
A novidade está disponível na API da DeepSeek, serviço usado por aplicativos e sistemas de outras empresas. Para acessar o modelo, o desenvolvedor informa `deepseek-v4-flash-vision-exp` na requisição. A DeepSeek também atualizou seu ambiente de agentes, chamado Harness, para reconhecer a nova opção.
O anúncio compartilhado no X
No anúncio publicado no X, a DeepSeek escreveu que o modelo experimental mantém as capacidades de texto do V4 Flash, incluindo agentes, raciocínio e conhecimento geral. A empresa acrescentou que o desempenho em agentes multimodais, aqueles que trabalham com texto e imagem, deu um salto e ficou próximo do Opus 4.8.
Uma publicação compartilhada pelo perfil @op7418, conhecido como Guizang, resumiu a diferença em chinês: a capacidade multimodal finalmente chegou à linha V4 Flash, o preço permaneceu igual ao da versão de texto e o novo modelo se aproximou do Opus 4.8 em tarefas de agentes com visão. O post também trouxe o gráfico de resultados divulgado pela DeepSeek.
A mensagem chama atenção para um ponto importante: “próximo” não significa melhor em tudo. O V4 Flash Vision superou o Opus 4.8 nos testes DeepSWE, Agents’ Last Exam e ZeroBench, mas ficou atrás nos outros oito. Em NL2Repo, avaliação de tarefas complexas em repositórios de código, a diferença foi de 12 pontos a favor do modelo da Anthropic.
Por que o preço chama atenção
A DeepSeek cobra por token, unidade usada para medir os trechos de texto processados ou gerados pelo modelo. Fora do horário de pico, um milhão de tokens de entrada sem cache custa US$ 0,22, e um milhão de tokens de saída custa US$ 0,66. No horário de pico, os valores sobem para US$ 0,44 e US$ 1,32, respectivamente.
As imagens também entram nessa conta. Cada arquivo é convertido em até 384 tokens, conforme suas dimensões, e cobrado como entrada de texto. A DeepSeek não acrescentou uma tarifa específica para visão, por isso o V4 Flash Vision pode sair muito mais barato do que modelos de alto desempenho da Anthropic em usos de grande volume.
Preço menor não garante o mesmo resultado. Um modelo pode funcionar bem ao ler um gráfico simples e falhar ao navegar por uma interface extensa ou alterar um projeto de programação. Empresas que pretendem usar a novidade precisam comparar respostas em tarefas reais, porque os testes da fabricante não cobrem todos os tipos de trabalho.
Ele gera imagens?
O V4 Flash Vision não gera imagens. Ele recebe texto e imagem, mas devolve texto, então pode descrever uma fotografia, ler uma captura de tela ou analisar um gráfico, sem criar um novo PNG a partir de uma instrução.
A DeepSeek possui modelos que geram imagens, mas eles pertencem a outra família. O Janus-Pro, lançado em janeiro de 2025 com código e pesos disponíveis publicamente, combina compreensão visual com geração a partir de texto. A empresa também desenvolveu o JanusFlow, voltado à criação visual.
Isso significa que a resposta depende do produto. A DeepSeek, como laboratório, tem tecnologia para gerar imagens; o novo V4 Flash Vision, especificamente, não tem essa saída. O chat comum e a API do V4 não devem ser tratados como substitutos diretos de geradores como Midjourney, DALL-E ou os modelos de imagem do Gemini.
O Janus-Pro pode ser executado por desenvolvedores ou testado em demonstrações que ofereçam o modelo, mas não é o mesmo serviço apresentado no anúncio desta sexta-feira. Quem abrir o DeepSeek e pedir uma ilustração pode receber uma descrição ou uma recusa, dependendo da versão disponível, em vez de um arquivo de imagem.
O que ele faz com uma foto
A principal função é transformar informação visual em uma resposta textual ou em uma ação. Ao receber a captura de uma página, o modelo pode identificar botões, ler mensagens de erro e orientar um agente que usa navegador. Com um gráfico, pode reconhecer eixos, comparar valores e produzir um resumo.
O modelo também pode trabalhar com ferramentas externas. Um agente pode olhar uma tela, decidir onde está um campo e preencher um formulário, desde que o aplicativo forneça os controles necessários. A IA não move o mouse por conta própria apenas porque viu a imagem; o sistema ao redor precisa permitir essa ação.
Cuidados com imagens enviadas
Uma captura de tela pode conter nome, e-mail, número de pedido, endereço, conversa privada ou chave de acesso. Antes de enviar o arquivo a uma API, recorte o que não participa da pergunta e oculte dados pessoais. O fato de o modelo ser barato não muda o risco de compartilhar informação desnecessária.
Se a imagem estiver grande demais para uma demonstração ou para o sistema que receberá o arquivo, preserve o original e comprima uma cópia para o teste. Não reduza tanto a ponto de apagar letras pequenas, porque a leitura da interface depende da nitidez do texto.
O que os testes mostram
A DeepSeek publicou resultados em onze avaliações. O V4 Flash Vision marcou 59,3 no DeepSWE, 27,3 no Agents’ Last Exam e 35 no ZeroBench, resultados ligeiramente superiores aos do Opus 4.8 nesses três testes. Em Toolathlon-Verified e Chartography, os modelos ficaram separados por menos de um ponto.
A vantagem da Anthropic apareceu com mais clareza no NL2Repo e no DSBench-Hard. O Opus 4.8 marcou 69,7 contra 57,7 no primeiro e 71,7 contra 63,6 no segundo. A tabela, portanto, sustenta a afirmação de que os modelos ficam próximos em parte das tarefas, mas não demonstra equivalência geral.
Há outra ressalva: em duas avaliações multimodais, o V4 Flash sem visão ignorava os elementos visuais. Parte do salto observado mede a diferença entre um modelo que enxerga a imagem e outro que recebe uma prova sem conseguir ler uma parte dela. A própria DeepSeek incluiu essa observação no material técnico.
Disponibilidade
O V4 Flash Vision está disponível pela API, não como uma troca garantida no aplicativo de conversa para todos os usuários. Desenvolvedores podem enviar imagens por endereço da web, em base64 ou pela Files API, e usar formatos compatíveis com as interfaces da OpenAI e da Anthropic.
O V4 Flash Vision amplia o que a API barata da DeepSeek consegue analisar, mas não transforma o chat em um gerador de imagens. Ele recebe fotos e capturas de tela para produzir texto ou orientar agentes; a criação visual continua na família Janus.
