Dhauz junta-se a Quantum Rise

Gemini 3 Flash chega com custos reduzidos e latência — uma combinação poderosa para empresas

As empresas agora podem aproveitar o poder de um grande modelo de linguagem que está perto do estado da arte Google Gemini 3 Pro, mas a uma fração do custo e com maior velocidade, graças ao recém-lançado Gemini 3 Flash.

O modelo junta-se ao Gemini 3 Pro, Gemini 3 Deep Think e Gemini Agent, todos anunciados e lançados no mês passado.

Gemini 3 Flash, agora disponível na Gemini Enterprise, Google Antigravity, Gemini CLI, AI Studio, e na pré-visualização no Vertex AI, processa informações em quase tempo real e ajuda a construir aplicativos agenticos rápidos e responsivos.

A empresa disse em um post do blog que Gemini 3 Flash "constrói na série modelo que os desenvolvedores e empresas já amam, otimizado para fluxos de trabalho de alta frequência que exigem velocidade, sem sacrificar a qualidade.

O modelo também é o padrão para o modo IA no Google Search e na aplicação Gemini.

Tulsee Doshi, diretor sênior da equipe Gemini, disse em um postagem do blog separada que o modelo "demonstra que a velocidade e a escala não precisam vir ao custo da inteligência".

"Gemini 3 Flash é feito para desenvolvimento iterativo, oferecendo desempenho de codificação Pro-grade da Gemini 3 com baixa latência — é capaz de raciocinar e resolver tarefas rapidamente em fluxos de trabalho de alta frequência", disse Doshi. "Ele atinge um equilíbrio ideal para codificação agente, sistemas prontos para produção e aplicações interativas responsivas."

A adoção precoce por empresas especializadas prova a confiabilidade do modelo em campos de alto risco. Harvey, uma plataforma de IA para firmas de advocacia, relatou um salto de 7% no raciocínio sobre seu ‘BigLaw Bench’ interno, enquanto Reunir AI descobriu que Gemini 3 Flash poderia processar dados forenses complexos para detecção de deepfake 4x mais rápido do que Gemini 2.5 Pro. Estes não são apenas ganhos de velocidade; eles estão permitindo fluxos de trabalho ‘quase em tempo real’ que antes eram impossíveis.

Mais eficiente a um custo mais baixo

Construtores de IA empresariais tornaram-se mais conscientes o custo da execução de modelos de IA, especialmente porque eles tentam convencer os stakeholders a colocar mais orçamento em fluxos de trabalho agentes que funcionam em modelos caros. As organizações recorreram a modelos menores ou destilados, focando em modelos abertos ou outros técnicas de investigação e sensibilização ajudar a gerir os custos de IA inchados.

Para as empresas, a maior proposta de valor para Gemini 3 Flash é que ele oferece o mesmo nível de capacidades multimodais avançadas, como análise de vídeo complexa e extração de dados, como seus maiores homólogos Gemini, mas é muito mais rápido e mais barato.

Enquanto os materiais internos do Google destacam um aumento de velocidade de 3x sobre a série 2.5 Pro, dados de benchmarking empresa Análise Artificial adiciona uma camada de nuance crucial.

Nos testes de pré-lançamento da última organização, a Gemini 3 Flash Preview registrou um rendimento bruto de 218 tokens de saída por segundo. Isto torna 22% mais lento do que o anterior ‘non-raciocing’ Gemini 2.5 Flash, mas ainda é significativamente mais rápido do que os rivais, incluindo GPT-5.1 elevado da OpenAI (125 t/s) e DeepSeek V3.2 raciocínio (30 t/s).

Mais notavelmente, a Artificial Analysis coroou Gemini 3 Flash como o novo líder em seu benchmark de conhecimento AA-Omniscience, onde alcançou a maior precisão de conhecimento de qualquer modelo testado até o momento. No entanto, esta inteligência vem com um "imposto racional": o modelo mais do que duplica o seu uso token em comparação com a série 2.5 Flash ao abordar índices complexos.

Essa alta densidade de fichas é compensada pelos preços agressivos do Google: ao acessar a API Gemini, Gemini 3 Flash costs $0,50 por 1 milhão de fichas de entrada, em comparação com $1.25/1M tokens de entrada para Gemini 2.5 Pro, e $3/1M tokens de saída, em comparação com $ 10/1 M fichas de saída para Gemini 2.5 Pro. Isso permite que o Gemini 3 Flash reivindique o título do modelo mais eficiente em termos de custo para o seu nível de inteligência, apesar de ser um dos modelos mais ‘falativos’ em termos de volume de token bruto. Aqui está como ele empilha até oferecer LLM rival:

Modelo

Entrada (/1M)

Saída (/1M)

Custo total

Origem

Qwen 3 Turbo

$0.05

$0.20

$0.25

Nuvem Alibaba

Grok 4.1 Rápido (razão)

$0.20

$0.50

$0.70

x IA

Grok 4.1 Rápido (não razoável)

$0.20

$0.50

$0.70

x IA

deepseek-chat (V3.2-Exp)

$0.28

$0.42

$0.70

Procura Profunda

Deepseek-razoador (V3.2-Exp)

$0.28

$0.42

$0.70

Procura Profunda

Qwen 3 Plus

$0.40

$1.20

$1.60

Nuvem Alibaba

ERNIE 5.0

$0.85

$3.40

$4.25

Qianfan

Visualização do Flash de Gêmeos 3

$0.50

$3.00

$3.50

Google

Claude Haiku 4.5

$1.00

$5.00

$6.00

Antrópico

Qwen- Max

$1.60

$6.40

$8.00

Nuvem Alibaba

Gemini 3 Pro (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.2

$1.75

$14.00

$15.75

OpenAI

Claude Sonnet 4.5

$3.00

$15.00

$18.00

Antrópico

Gemini 3 Pro (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 4.5

$5.00

$25.00

$30.00

Antrópico

GPT-5.2 Pro

$21.00

$168.00

$189.00

OpenAI

Mais formas de salvar

Mas os desenvolvedores empresariais e os usuários podem reduzir ainda mais os custos eliminando a defasagem que os modelos mais maiores costumam ter, o que acumula o uso de fichas. O Google disse que o modelo "é capaz de modular o quanto ele pensa", para que ele use mais pensamento e, portanto, mais fichas para tarefas mais complexas do que para alertas rápidos. A empresa observou que Gemini 3 Flash usa 30% menos fichas do que Gemini 2.5 Pro.

Para equilibrar este novo poder de raciocínio com rigorosos requisitos de latência corporativa, o Google introduziu um parâmetro "Tinking Level". Os desenvolvedores podem alternar entre ‘Baixo’—para minimizar custos e latência para tarefas de chat simples—e «Alto»—maximizar a profundidade de raciocínio para a extração complexa de dados. Este controle granular permite que as equipes criem aplicações de ‘velocidade variável’ que só consomem ‘tokens pensantes’ caros quando um problema realmente exige nível de PhD lo

A história econômica se estende além dos preços simples. Com a inclusão padrão do Context Caching, empresas processando conjuntos de dados estáticos massivos—tais como bibliotecas legais inteiras ou repositórios de bases de código—pode ver uma redução de 90% nos custos para consultas repetidas. Quando combinado com o desconto de 50% da API Batch, o custo total de propriedade de um agente movido pela Gemini cai significativamente abaixo do limiar dos modelos de fronteira concorrentes

"A Gemini 3 Flash oferece desempenho excepcional em tarefas de codificação e agente combinadas com um preço mais baixo, permitindo que as equipes implementem custos de raciocínio sofisticados em processos de alto volume sem atingir barreiras", disse o Google.

Ao oferecer um modelo que oferece desempenho multimodal forte a um preço mais acessível, o Google está fazendo o caso de que as empresas preocupadas em controlar seus gastos de IA devem escolher seus modelos, especialmente Gemini 3 Flash.

Desempenho de referência forte

Mas como é que Gemini 3 Flash se empilha contra outros modelos em termos de seu desempenho?

Doshi disse que o modelo alcançou uma pontuação de 78% no teste de benchmark verificado SWE-Bench para agentes de codificação, superando tanto a família Gemini 2.5 anterior quanto o Gemini 3 Pro mais novo!

Para as empresas, isso significa que tarefas de manutenção de software de alto volume e correção de bugs podem agora ser descarregadas para um modelo que é mais rápido e mais barato do que os modelos emblemáticos anteriores, sem uma degradação na qualidade do código.

O modelo também se apresentou fortemente em outros benchmarks, pontuando 81,2% no benchmark MMMU Pro, comparável ao Gemini 3 Pro.

Enquanto a maioria dos modelos tipo Flash são explicitamente otimizados para tarefas curtas e rápidas, como gerar código, o Google reivindica o desempenho do Gemini 3 Flash "em raciocínio, uso de ferramentas e capacidades multimodais é ideal para desenvolvedores que procuram fazer análises de vídeo mais complexas, extração de dados e Q&A visual, o que significa que pode permitir aplicações mais inteligentes — como assistentes no jogo ou experiências de teste A/B — que exigem respostas rápidas e raciocínio profundo."

Primeiras impressões de usuários iniciais

Até agora, os primeiros usuários têm sido amplamente impressionados com o modelo, particularmente seu desempenho de referência.

O que significa para uso de IA empresarial

Com Gemini 3 Flash agora servindo como o motor padrão em Google Search e no aplicativo Gemini, estamos testemunhando a "Flash-ification" da inteligência de fronteira. Ao tornar o raciocínio Pro-level a nova linha de base, o Google está a definir uma armadilha para os operadores históricos mais lentos.

A integração em plataformas como o Google Antigravity sugere que o Google não está apenas vendendo um modelo; está vendendo a infraestrutura para a empresa autônoma.

À medida que os desenvolvedores começam a correr com velocidades 3x mais rápidas e um desconto de 90% no cache de contexto, a estratégia "Gemini-first" torna-se um argumento financeiro convincente. Na corrida de alta velocidade para o domínio de IA, Gemini 3 Flash pode ser o modelo que finalmente transforma a "codificação Vibe" de um hobby experimental em uma realidade pronta para a produção.

PortuguêsptPortuguêsPortuguês