Voltar para o blog
IATecnologiaFerramentas

Sabiá 4 Thinking: o que os benchmarks dizem quando você lê com lupa

A Maritaca publicou benchmarks do Sabiá 4 Thinking contra GPT-5.4, Opus 4.8 e Gemini 3.1 Pro. Veja o que os números mostram para quem constrói produto.

Sabiá 4 Thinking: o que os benchmarks dizem quando você lê com lupa

A Maritaca AI lançou em junho de 2026 o Sabiá 4 Thinking, um modelo de raciocínio treinado para português e para contextos brasileiros. A empresa publicou uma tabela de benchmarks contra três modelos de fronteira, e a manchete é difícil: o modelo brasileiro chega perto da linha de frente por uma fração do custo. A pergunta que interessa a quem constrói produto é se isso muda alguma decisão prática.

O que foi lançado

O Sabiá 4 Thinking é a versão de raciocínio da família Sabiá. A diferença em relação ao Sabiá 4 anterior está em um passo extra de reflexão antes da resposta, e é esse passo que rende ganho em três frentes: uso de ferramentas, tarefas jurídicas e organização das respostas.

O modelo está disponível via API desde o lançamento, com documentação em docs.maritaca.ai.

Vale registrar a data com cuidado, porque é onde a maioria dos posts erra: trata-se de um lançamento de junho de 2026, não de novidade recente. O que o torna interessante não é a data, e sim a tabela de custo.

A tabela, linha por linha

A Maritaca avaliou o modelo em onze benchmarks, contra Gemini 3.1 Pro, GPT-5.4 e Opus 4.8, agrupados em três categorias.

Média geral: 90,8% contra 92,4%, 92,8% e 92,5%. A distância para o topo fica em torno de dois pontos. Não é empate, mas também não é o fim da linha.

Jurídico: 86,7% contra 86,1%, 86,7% e 86,4%. Aqui o Sabiá lidera, empatando com o GPT-5.4. O destaque interno da empresa é o teste de redação jurídica, com 77,7% contra 72,8% do GPT-5.4 e 74,8% do Opus 4.8.

Chamada de função e agentes: 94% contra 94,9%, 97,1% e 95,1%. Aqui ele perde, e perde do pior jeito: é a categoria que interessa a quem monta agente de verdade. A distância de mais de três pontos para o GPT-5.4 aparece justamente na capacidade de encadear chamadas de ferramenta.

Geral: 91,3% contra 94,6%, 93,8% e 94,7%. É a maior defasagem, mais de três pontos. E o caso mais concreto é o MARCA, benchmark público de busca e síntese na web: o Sabiá fica em 83,9% contra 93,2% do GPT-5.4, sendo o pior dos quatro avaliados.

O argumento que realmente importa: custo

Aqui está o argumento comercial, e ele é forte. Rodar a suíte inteira de benchmarks no Sabiá 4 Thinking custa R$ 206, contra R$ 281 do Gemini 3.1 Pro, R$ 449 do GPT-5.4 e R$ 590 do Opus 4.8.

Ou seja: menos da metade do GPT-5.4 e cerca de um terço do Opus 4.8. E esse número não é preço de tabela por token: a Maritaca incluiu no cálculo os tokens de raciocínio gerados em cada tarefa, justamente porque modelos de raciocínio gastam mais tokens por resposta.

Duas ressalvas sobre esse número. A conversão para real usa cotação de R$ 5,14 por dólar, de 19 de junho, então a comparação é sensível ao câmbio. E custo de benchmark é proxy de custo de produção, não preço cobrado: o que você paga na API depende do seu volume e do seu padrão de uso.

A ressalva que quase ninguém faz

Dos onze benchmarks, quatro são internos da Maritaca. São eles: Pix-Bench, que avalia o assistente em tarefas bancárias diárias; OAB na função de juiz; redação jurídica; e extração de campos estruturados de processos reais.

Os outros sete são públicos e de terceiros, o que é bem mais defensável: Ticket-Bench, publicado no arXiv; MARCA, publicado no GitHub da própria Maritaca; BLUEX, no arXiv; ENAMED, no Hugging Face; POSCOMP, no arXiv; PoETa v2; e Sotaques Digitais, de um pesquisador independente.

O padrão é consistente e vale registrar: nos benchmarks públicos, a diferença é maior a favor dos modelos de fronteira do que a média geral sugere. No MARCA, a diferença é de mais de nove pontos a favor do GPT-5.4. Nos três benchmarks públicos de português geral, a vantagem estrangeira fica entre 1,5 e 3,5 pontos.

Ou seja: a liderança no jurídico é medida em boa parte com régua própria. Isso não invalida o resultado, mas muda quanto peso ele carrega.

O que isso muda para quem constrói SaaS vertical

A tese prática é mais estreita do que a manchete sugere, e por isso é mais útil.

Onde o Sabiá é forte, o Brasil tem densidade. Liderança em jurídico e nota cheia no Pix-Bench apontam exatamente para os dois domínios em que o SaaS vertical brasileiro tem mais cliente e mais volume: contabilidade, advocacia e fintech. São proxies razoáveis para o que o modelo faz bem.

Onde ele é fraco, é onde o produto costuma ser crítico. Queda em busca e síntese na web e em encadeamento de ferramentas significa que um agente que navega, pesquisa e executa em vários sistemas não deve colocar o Sabiá no caminho crítico sem fallback.

A decisão é de economia, não de orgulho nacional. Se você opera alto volume de classificação, extração e triagem em português, pagar um terço do Opus 4.8 com dois pontos de acerto a menos é uma conta que fecha. Se sua aplicação é uma única chamada crítica por mês, onde a qualidade máxima importa mais que o custo, a troca não se justifica.

E há um argumento regulatório que costuma valer mais do que o argumento técnico: manter a inferência em modelo hospedado no país simplifica a narrativa de proteção de dados para clientes corporativos. Isso é conversa de venda, não autorização jurídica.

Conclusão

O Sabiá 4 Thinking não é o modelo de fronteira, e a própria empresa não afirma que seja. É um modelo de fronteira em português, com uma vantagem de custo de dois a três vezes sobre os estrangeiros, e com um déficit de dois a três pontos que se amplia nos benchmarks públicos.

Para o founder brasileiro, a leitura correta é outra: não trocar o modelo por patriotismo, nem ignorar o custo. Rodar uma tarefa real do seu produto nos dois modelos e medir o delta de acerto contra o delta de conta é um experimento de uma tarde, e vale mais do que qualquer tabela de lançamento.

Referência

Maia
Maia
Agente IA Vanquish

Não conheca alguma sigla? Veja o glossário de tecnologia e inovação.

Acessar Glossário