Sabiá 4 Thinking: o que os benchmarks dizem quando você lê com lupa
A Maritaca publicou benchmarks do Sabiá 4 Thinking contra GPT-5.4, Opus 4.8 e Gemini 3.1 Pro. Veja o que os números mostram para quem constrói produto.
A Maritaca AI lançou em junho de 2026 o Sabiá 4 Thinking, um modelo de raciocínio treinado para português e para contextos brasileiros. A empresa publicou uma tabela de benchmarks contra três modelos de fronteira, e a manchete é difícil: o modelo brasileiro chega perto da linha de frente por uma fração do custo. A pergunta que interessa a quem constrói produto é se isso muda alguma decisão prática.
O que foi lançado
O Sabiá 4 Thinking é a versão de raciocínio da família Sabiá. A diferença em relação ao Sabiá 4 anterior está em um passo extra de reflexão antes da resposta, e é esse passo que rende ganho em três frentes: uso de ferramentas, tarefas jurídicas e organização das respostas.
O modelo está disponível via API desde o lançamento, com documentação em docs.maritaca.ai.
Vale registrar a data com cuidado, porque é onde a maioria dos posts erra: trata-se de um lançamento de junho de 2026, não de novidade recente. O que o torna interessante não é a data, e sim a tabela de custo.
A tabela, linha por linha
A Maritaca avaliou o modelo em onze benchmarks, contra Gemini 3.1 Pro, GPT-5.4 e Opus 4.8, agrupados em três categorias.
Média geral: 90,8% contra 92,4%, 92,8% e 92,5%. A distância para o topo fica em torno de dois pontos. Não é empate, mas também não é o fim da linha.
Jurídico: 86,7% contra 86,1%, 86,7% e 86,4%. Aqui o Sabiá lidera, empatando com o GPT-5.4. O destaque interno da empresa é o teste de redação jurídica, com 77,7% contra 72,8% do GPT-5.4 e 74,8% do Opus 4.8.
Chamada de função e agentes: 94% contra 94,9%, 97,1% e 95,1%. Aqui ele perde, e perde do pior jeito: é a categoria que interessa a quem monta agente de verdade. A distância de mais de três pontos para o GPT-5.4 aparece justamente na capacidade de encadear chamadas de ferramenta.
Geral: 91,3% contra 94,6%, 93,8% e 94,7%. É a maior defasagem, mais de três pontos. E o caso mais concreto é o MARCA, benchmark público de busca e síntese na web: o Sabiá fica em 83,9% contra 93,2% do GPT-5.4, sendo o pior dos quatro avaliados.
O argumento que realmente importa: custo
Aqui está o argumento comercial, e ele é forte. Rodar a suíte inteira de benchmarks no Sabiá 4 Thinking custa R$ 206, contra R$ 281 do Gemini 3.1 Pro, R$ 449 do GPT-5.4 e R$ 590 do Opus 4.8.
Ou seja: menos da metade do GPT-5.4 e cerca de um terço do Opus 4.8. E esse número não é preço de tabela por token: a Maritaca incluiu no cálculo os tokens de raciocínio gerados em cada tarefa, justamente porque modelos de raciocínio gastam mais tokens por resposta.
Duas ressalvas sobre esse número. A conversão para real usa cotação de R$ 5,14 por dólar, de 19 de junho, então a comparação é sensível ao câmbio. E custo de benchmark é proxy de custo de produção, não preço cobrado: o que você paga na API depende do seu volume e do seu padrão de uso.
A ressalva que quase ninguém faz
Dos onze benchmarks, quatro são internos da Maritaca. São eles: Pix-Bench, que avalia o assistente em tarefas bancárias diárias; OAB na função de juiz; redação jurídica; e extração de campos estruturados de processos reais.
Os outros sete são públicos e de terceiros, o que é bem mais defensável: Ticket-Bench, publicado no arXiv; MARCA, publicado no GitHub da própria Maritaca; BLUEX, no arXiv; ENAMED, no Hugging Face; POSCOMP, no arXiv; PoETa v2; e Sotaques Digitais, de um pesquisador independente.
O padrão é consistente e vale registrar: nos benchmarks públicos, a diferença é maior a favor dos modelos de fronteira do que a média geral sugere. No MARCA, a diferença é de mais de nove pontos a favor do GPT-5.4. Nos três benchmarks públicos de português geral, a vantagem estrangeira fica entre 1,5 e 3,5 pontos.
Ou seja: a liderança no jurídico é medida em boa parte com régua própria. Isso não invalida o resultado, mas muda quanto peso ele carrega.
O que isso muda para quem constrói SaaS vertical
A tese prática é mais estreita do que a manchete sugere, e por isso é mais útil.
Onde o Sabiá é forte, o Brasil tem densidade. Liderança em jurídico e nota cheia no Pix-Bench apontam exatamente para os dois domínios em que o SaaS vertical brasileiro tem mais cliente e mais volume: contabilidade, advocacia e fintech. São proxies razoáveis para o que o modelo faz bem.
Onde ele é fraco, é onde o produto costuma ser crítico. Queda em busca e síntese na web e em encadeamento de ferramentas significa que um agente que navega, pesquisa e executa em vários sistemas não deve colocar o Sabiá no caminho crítico sem fallback.
A decisão é de economia, não de orgulho nacional. Se você opera alto volume de classificação, extração e triagem em português, pagar um terço do Opus 4.8 com dois pontos de acerto a menos é uma conta que fecha. Se sua aplicação é uma única chamada crítica por mês, onde a qualidade máxima importa mais que o custo, a troca não se justifica.
E há um argumento regulatório que costuma valer mais do que o argumento técnico: manter a inferência em modelo hospedado no país simplifica a narrativa de proteção de dados para clientes corporativos. Isso é conversa de venda, não autorização jurídica.
Conclusão
O Sabiá 4 Thinking não é o modelo de fronteira, e a própria empresa não afirma que seja. É um modelo de fronteira em português, com uma vantagem de custo de dois a três vezes sobre os estrangeiros, e com um déficit de dois a três pontos que se amplia nos benchmarks públicos.
Para o founder brasileiro, a leitura correta é outra: não trocar o modelo por patriotismo, nem ignorar o custo. Rodar uma tarefa real do seu produto nos dois modelos e medir o delta de acerto contra o delta de conta é um experimento de uma tarde, e vale mais do que qualquer tabela de lançamento.
Referência
- Sabiá 4 Thinking — página oficial da Maritaca AI — tabela de benchmarks, metodologia e custos.
- Documentação da API — modelos da família Sabiá.

Não conheca alguma sigla? Veja o glossário de tecnologia e inovação.
Veja também
MCP: O 'USB-C' da IA que está eliminando integrações customizadas
Model Context Protocol se tornou o padrão de fato para conectar agentes de IA a sistemas empresariais. Entenda por que 150M+ downloads estão redefinindo integrações.
Brasil dobra data centers em 2026 e vira alvo da corrida global por IA
O país fechou o primeiro semestre com 706 MW instalados e projeta dobrar de tamanho até 2030. Entenda o que a corrida por capacidade significa para quem constrói SaaS com IA.
IA na medicina brasileira: o que muda com a Resolução CFM 2.454/2026
Resolução CFM 2.454/2026 entrou em vigor e define regras para IA na medicina brasileira. A tese e a janela de 12-18 meses para founders.