A Qwen apresentou o Qwen3.8-Omni-Flash, seu primeiro modelo multimodal voltado a agentes de IA. Segundo a empresa, o sistema processa áudio e vídeo em conjunto, tira conclusões e usa ferramentas de forma autônoma para tarefas como editar vlogs, traduzir vídeos curtos e resumir filmes. O modelo está disponível pelo Qwen Studio, pelo Qwen Cloud e pela API, e tem janela de contexto de um milhão de tokens.

O dado que mais chama atenção é o preço. A API cobra US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída. A Qwen estima ainda que a entrada de áudio custe menos de US$ 0,01 por hora, enquanto vídeo 720p com áudio a um quadro por segundo fica em cerca de US$ 0,20, sem contar os custos de resposta.

A comparação é direta com o Gemini 3.8 Flash, do Google. A versão Flash cobra US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída em sua tarifa introdutória, segundo a fonte. Os preços estão programados para dobrar em 1º de janeiro de 2027. Na prática, a diferença de custo pode se tornar ainda maior se a Qwen mantiver sua tabela atual.

Com saída a US$ 0,47 por milhão de tokens, a Qwen cobra quase um oitavo do valor pedido pelo Gemini 3.8 Flash, cuja tarifa introdutória está programada para dobrar em 2027.

Em tarefas de áudio e vídeo, a Qwen afirma que o Omni-Flash chega perto do desempenho do Gemini 3.8 Flash. A ressalva é importante: trata-se de uma comparação feita pela própria empresa, sem menção a avaliação independente nos dados divulgados. O desempenho real em edição, tradução e resumo de vídeos, portanto, ainda depende de testes externos.

Além do modelo, a Qwen aposta em ferramentas para integrar agentes a fluxos multimodais. Os plugins open-source Qwen-MM-Plugins adicionam edição de vídeo, reconhecimento de locutor, notas em PDF a partir de vídeos e fluxos reutilizáveis a agentes como Claude Code, Gemini CLI e Qwen Code. Já o Qwen-Live Harness permite interação em tempo real com câmera e microfone.

Esse pacote sinaliza uma disputa que vai além do benchmark. Para desenvolvedores que constroem agentes que consomem vídeo e áudio em escala, o custo por hora de mídia e por milhão de tokens pode pesar mais do que alguns pontos percentuais de acurácia. A janela de um milhão de tokens também favorece aplicações que precisam manter longos trechos de gravação no contexto, como reuniões, aulas e produções audiovisuais.

Há pontos em aberto. A fonte não detalha licenciamento do modelo principal, limites de uso, latência ou disponibilidade regional. Também não informa se os preços da Qwen podem mudar depois de 2026. Os custos estimados para áudio e vídeo excluem as respostas geradas, o que pode elevar o gasto final em cargas intensivas.

O movimento pressiona o Google e outros fornecedores de modelos multimodais a justificar o prêmio cobrado por suas APIs. Se a promessa de desempenho próximo ao Gemini se confirmar em avaliações independentes, o Omni-Flash pode se tornar uma opção competitiva para agentes que editam, traduzem e resumem conteúdo audiovisual. O próximo desdobramento será observar a reação do mercado e se a diferença de preço se sustenta quando a tarifa introdutória do Gemini subir.