Claude Opus 5
Explore pontuações de benchmark, pontos fortes por género, limitações e exemplos recentes de Claude Opus 5.
Visão geral do modelo
Lançamento
2026-07-24
Entrada
$5.00 / 1M
Saída
$25.00 / 1M
O Claude Opus 5, lançado em 24 de julho de 2026, é o modelo da Anthropic para programação agente complexa e trabalho corporativo. Na Orivel assume a vaga equilibrada da Anthropic que era do Opus 4.8, pelo mesmo preço, abaixo do Claude Fable 5, que segue como nível de fronteira.
A Anthropic o posiciona como inteligência próxima do Fable 5 com a velocidade e o custo do Opus. Alcança 96,0% no SWE-bench Verified (média de cinco execuções), 79,2% no SWE-bench Pro e 89,5% no SWE-bench Multilingual. No Frontier-Bench v0.1 mais que dobra o resultado do Opus 4.8 e no ARC-AGI 3 pontua cerca de três vezes mais que o concorrente seguinte. Supera o melhor resultado do Fable 5 no OSWorld 2.0 por um terço do custo.
Tem janela de contexto de 1M tokens e até 128k tokens de saída, com corte de conhecimento em maio de 2026 — o mais recente entre os modelos Claude atuais. O preço não muda em relação ao Opus 4.8: $5 entrada / $25 saída por 1M tokens. O adaptive thinking vem ativo por padrão (mudança em relação ao Opus 4.8) e parâmetros de amostragem como temperature não são mais aceitos.
Mudanças
- Lançado em 24 de julho de 2026 para programação agente complexa e trabalho corporativo
- SWE-bench Verified 96,0% (média de 5 execuções); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: mais que o dobro do Opus 4.8; ARC-AGI 3: ~3x o concorrente seguinte
- Supera o melhor resultado do Fable 5 no OSWorld 2.0 por um terço do custo
- Ganhos em pesquisa científica: +10,2 pontos em química orgânica, +7,7 em predição de proteínas ante o Opus 4.8
- Janela de contexto de 1M tokens; até 128k tokens de saída
- Adaptive thinking ativo por padrão (o Opus 4.8 exigia ativação); temperature / top_p / top_k não são mais aceitos
- Faixa completa de effort incluindo `max`; fast mode a 2,5x de velocidade
- Preço idêntico ao Opus 4.8: $5 entrada / $25 saída por 1M tokens
- Corte de conhecimento: maio de 2026
Desempenho geral
Ranking geral
#1
Taxa de vitória geral
Pontuação média
Vitórias
10
Número de amostras
10
Taxa de vitória por modelo
| Modelo | Vitórias | Derrotas | Empates | Taxa de vitória | Detalhe |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 2 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5 mini |
| OpenAI GPT-5.5 | 2 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5.5 |
| OpenAI GPT-5.6 | 2 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5.6 |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Flash-Lite |
| Google Gemini 2.5 Flash | 1 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Flash |
| Google Gemini 2.5 Pro | 1 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Pro |
Comparar por gênero
Gêneros fortes
Design de sistemas
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
1 / 14
Vitórias
1
Humor
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
1 / 14
Vitórias
1
Debate
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
6
Ranking por gênero
1 / 16
Vitórias
6
Persuasão
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
7 / 15
Vitórias
1
Aconselhamento
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
7 / 16
Vitórias
1
Gêneros mais fracos
Forças por critério de avaliação
Pontuação média por critério (de 10)
Seguimento de instruções
Completude
Análise de trade-offs
Escalabilidade e confiabilidade
Utilidade
Qualidade da arquitetura
Empatia
Coerência
Adequação ao público
Persuasão
Adequação
Clareza
Tarefas recentes
Humor
O Balcão Mágico de Achados e Perdidos
Escreva um diálogo cômico, apropriado para a família, de exatamente 12 falas entre Mira, uma atendente calma do achados e perdidos, e Orin, um mago atrapalhado....
Design de sistemas
Design de Sistema: Serviço de Notificações em Tempo Real
Você é um engenheiro de software sênior encarregado de projetar um sistema de notificações em tempo real para uma grande plataforma de mídia social. **Requisit...
Persuasão
Convencer um Conselho Municipal Cético a Aprovar um Projeto-Piloto de Faixa Exclusiva para Ônibus
Escreva um discurso de 500 a 650 palavras para o Conselho Municipal de Riverton, instando-o a aprovar o projeto-piloto proposto de faixa exclusiva para ônibus p...
Aconselhamento
Desistindo de uma viagem de fim de semana com um amigo
Disse a um amigo próximo que “provavelmente” eu iria participar de uma viagem de fim de semana, mas pedi que aguardasse a minha confirmação final. Ainda assim,...
Debates recentes
Debates
IA Generativa em Campos Criativos: Uma Revolução na Arte ou o Fim do Artista?
O uso de IA generativa para criar arte, música e literatura deve ser adotado como uma ferramenta legítima de criação ou deve ser restringido para proteger o valor e o sustento dos artistas humanos?
Debates
Rendimento Básico Universal: Um Futuro Viável ou um Erro Dispendioso?
Rendimento Básico Universal (UBI) é um sistema proposto em que todos os cidadãos de um país recebem regularmente uma quantia incondicional de dinheiro do governo, independentemente do seu rendimento, dos seus recursos ou da sua situação de emprego. Os defensores argumentam que é uma ferramenta poderosa para eliminar a pobreza, reduzir a desigualdade e proporcionar segurança económica numa era de crescente automação. Os opositores levantam preocupações sobre o seu custo imenso, o potencial para desincentivar o trabalho e o risco de provocar inflação significativa. O cerne do debate é saber se a implementação de um Rendimento Básico Universal criaria uma sociedade mais equitativa e estável ou conduziria a um colapso económico e à estagnação social.
Debates
O Futuro do Trabalho: A Semana de Trabalho de Quatro Dias
Este debate explora a viabilidade e a desejabilidade de implementar uma semana de trabalho de quatro dias padronizada (sem redução da remuneração) na maioria dos setores. Os proponentes defendem que isso aumenta a produtividade, o bem-estar dos trabalhadores e o equilíbrio entre vida profissional e pessoal, enquanto os opositores levantam preocupações sobre sua viabilidade económica, impacto no atendimento ao cliente e adequação a todos os setores.
Debates
A semana de trabalho de quatro dias: um caminho para o progresso ou uma armadilha para a p...
Deveriam empresas e governos promover ativamente a adoção de uma semana de trabalho de quatro dias, sem redução salarial, como novo padrão para emprego em tempo integral?
Debates
A semana de trabalho de quatro dias: progresso ou problema?
O conceito de uma semana de trabalho padrão de quatro dias para funcionários em tempo integral está ganhando força. Defensores argumentam que isso aumenta a produtividade e melhora o bem-estar dos empregados, enquanto opositores se preocupam com sua viabilidade em todos os setores e com o potencial aumento do estresse. Esse debate explora se a transição para uma semana de trabalho de quatro dias é um modelo benéfico e sustentável para a economia moderna.
Debates
O transporte público deveria ser gratuito?
As cidades deveriam eliminar as tarifas de ônibus, bondes e metrôs, financiando o transporte público inteiramente por meio de impostos e outras receitas públicas?