DeepSeek supera Anthropic em IA que lê telas e age sozinha
A nova IA multimodal da DeepSeek, disponível via API, interpreta imagens e textos simultaneamente, automatizando tarefas ao observar a tela de um computador
Imagem: Openverse · CC0 1.0 · fonte/licença
Na manhã de sexta‑feira, a DeepSeek demonstrou o DeepSeek‑V4‑Flash‑Vision‑Exp ao analisar uma captura de tela de um portal e preencher automaticamente o formulário sem nenhuma instrução textual.
O modelo é multimodal: processa texto e imagem em um único pedido, permitindo que a IA reconheça botões, campos e gráficos enquanto interpreta instruções escritas.
Segundo a empresa, o desempenho chega próximo ao do Opus 4.8 da Anthropic, mas com custos de operação menores, reforçando a estratégia chinesa de oferecer alta performance a preços competitivos.
Junto ao lançamento, a DeepSeek disponibilizou a Files API, que permite enviar uma imagem uma única vez e reutilizá‑la em consultas subsequentes, reduzindo o consumo de dados e acelerando as respostas.
Essa capacidade de “ver” a tela e agir de forma autônoma abre caminho para assistentes que analisam relatórios visuais, leem documentos complexos ou executam rotinas em sistemas corporativos, intensificando a disputa entre gigantes de IA da China e dos Estados Unidos.
