Claude Opus 5
Explore pontuações de benchmark, pontos fortes por género, limitações e exemplos recentes de Claude Opus 5.
Visão geral do modelo
Lançamento
2026-07-24
Entrada
$5.00 / 1M
Saída
$25.00 / 1M
O Claude Opus 5, lançado em 24 de julho de 2026, é o modelo da Anthropic para programação agente complexa e trabalho corporativo. Na Orivel assume a vaga equilibrada da Anthropic que era do Opus 4.8, pelo mesmo preço, abaixo do Claude Fable 5, que segue como nível de fronteira.
A Anthropic o posiciona como inteligência próxima do Fable 5 com a velocidade e o custo do Opus. Alcança 96,0% no SWE-bench Verified (média de cinco execuções), 79,2% no SWE-bench Pro e 89,5% no SWE-bench Multilingual. No Frontier-Bench v0.1 mais que dobra o resultado do Opus 4.8 e no ARC-AGI 3 pontua cerca de três vezes mais que o concorrente seguinte. Supera o melhor resultado do Fable 5 no OSWorld 2.0 por um terço do custo.
Tem janela de contexto de 1M tokens e até 128k tokens de saída, com corte de conhecimento em maio de 2026 — o mais recente entre os modelos Claude atuais. O preço não muda em relação ao Opus 4.8: $5 entrada / $25 saída por 1M tokens. O adaptive thinking vem ativo por padrão (mudança em relação ao Opus 4.8) e parâmetros de amostragem como temperature não são mais aceitos.
Mudanças
- Lançado em 24 de julho de 2026 para programação agente complexa e trabalho corporativo
- SWE-bench Verified 96,0% (média de 5 execuções); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: mais que o dobro do Opus 4.8; ARC-AGI 3: ~3x o concorrente seguinte
- Supera o melhor resultado do Fable 5 no OSWorld 2.0 por um terço do custo
- Ganhos em pesquisa científica: +10,2 pontos em química orgânica, +7,7 em predição de proteínas ante o Opus 4.8
- Janela de contexto de 1M tokens; até 128k tokens de saída
- Adaptive thinking ativo por padrão (o Opus 4.8 exigia ativação); temperature / top_p / top_k não são mais aceitos
- Faixa completa de effort incluindo `max`; fast mode a 2,5x de velocidade
- Preço idêntico ao Opus 4.8: $5 entrada / $25 saída por 1M tokens
- Corte de conhecimento: maio de 2026
Desempenho geral
Ranking geral
#1
Taxa de vitória geral
Pontuação média
Vitórias
16
Número de amostras
17
Taxa de vitória por modelo
| Modelo | Vitórias | Derrotas | Empates | Taxa de vitória | Detalhe |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 3 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5 mini |
| OpenAI GPT-5.5 | 3 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5.5 |
| OpenAI GPT-5.6 | 3 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs GPT-5.6 |
| Google Gemini 2.5 Pro | 3 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Pro |
| Google Gemini 2.5 Flash | 2 | 1 | 0 |
67%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Flash |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Ver comparação e avaliação de Claude Opus 5 vs Gemini 2.5 Flash-Lite |
Comparar por gênero
Gêneros fortes
Design de sistemas
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
1 / 15
Vitórias
1
Geração de ideias
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
2 / 15
Vitórias
1
Humor
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
1 / 14
Vitórias
1
Debate
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
10
Ranking por gênero
1 / 16
Vitórias
10
Escrita criativa
Pontuação média
Média do gênero
Taxa de vitória
Número de amostras
1
Ranking por gênero
5 / 16
Vitórias
1
Forças por critério de avaliação
Pontuação média por critério (de 10)
Completude
Seguimento de instruções
Análise de trade-offs
Escalabilidade e confiabilidade
Utilidade
Especificidade
Qualidade da arquitetura
Empatia
Adequação ao público
Qualidade do estilo
Utilidade
Persuasão
Tarefas recentes
Geração de ideias
Reimaginar Espaços Comunitários Urbanos
Crie uma lista de 5 ideias distintas, inovadoras e práticas para um novo tipo de espaço comunitário. O espaço é uma unidade comercial térrea vaga de 200 metros...
Resumo
Resumir o Piloto de Reutilização de Água da Chuva de Rellan
Escreva um resumo independente da passagem-fonte fictícia abaixo com 220 a 280 palavras. Use prosa contínua em vez de lista. Seu resumo deve explicar por que o...
Escrita criativa
O Último Objeto no Achados e Perdidos
Escreva um conto completo de 700–1.000 palavras para um público adulto em geral. A história se passa durante a última hora antes do escritório de achados e perd...
Humor
O Balcão Mágico de Achados e Perdidos
Escreva um diálogo cômico, apropriado para a família, de exatamente 12 falas entre Mira, uma atendente calma do achados e perdidos, e Orin, um mago atrapalhado....
Design de sistemas
Design de Sistema: Serviço de Notificações em Tempo Real
Você é um engenheiro de software sênior encarregado de projetar um sistema de notificações em tempo real para uma grande plataforma de mídia social. **Requisit...
Persuasão
Convencer um Conselho Municipal Cético a Aprovar um Projeto-Piloto de Faixa Exclusiva para Ônibus
Escreva um discurso de 500 a 650 palavras para o Conselho Municipal de Riverton, instando-o a aprovar o projeto-piloto proposto de faixa exclusiva para ônibus p...
Aconselhamento
Desistindo de uma viagem de fim de semana com um amigo
Disse a um amigo próximo que “provavelmente” eu iria participar de uma viagem de fim de semana, mas pedi que aguardasse a minha confirmação final. Ainda assim,...
Debates recentes
Debates
As cidades devem tornar o transporte público gratuito?
Os governos municipais devem eliminar as tarifas de ônibus, bondes e metrôs, financiando todo o custo por meio de impostos e outras receitas públicas?
Debates
Testes padronizados: Uma medida justa de mérito ou um obstáculo para o verdadeiro aprendiz...
Testes padronizados, como o SAT, ACT ou exames exigidos pelo estado, são amplamente utilizados em sistemas educacionais para avaliar o desempenho dos alunos e a qualidade das escolas. Os defensores argumentam que oferecem uma forma objetiva e uniforme de medir conhecimentos e habilidades, responsabilizando as escolas e fornecendo uma base justa para admissões em universidades. Os críticos, no entanto, afirmam que esses testes são culturalmente tendenciosos, criam estresse indevido e incentivam o 'ensinar para o teste' em detrimento de um aprendizado mais profundo e criativo. Esse debate questiona o papel e o valor fundamentais dos testes padronizados na educação moderna.
Debates
As universidades públicas devem eliminar as propinas?
Os governos devem financiar integralmente as propinas nas universidades públicas para todos os estudantes admitidos, independentemente do rendimento, ou os estudantes devem continuar a partilhar o custo através de propinas?
Debates
Serviço Nacional Obrigatório: Um Dever Cívico ou uma Violação da Liberdade?
Este debate centra-se em saber se os governos devem exigir que todos os jovens adultos cumpram um período de serviço nacional obrigatório. Este serviço pode ser militar ou civil, como trabalhar na área da saúde, conservação ambiental ou projetos de infraestruturas. A questão central é se os benefícios potenciais para a sociedade e para o indivíduo superam a perda de liberdade pessoal.
Debates
IA Generativa em Campos Criativos: Uma Revolução na Arte ou o Fim do Artista?
O uso de IA generativa para criar arte, música e literatura deve ser adotado como uma ferramenta legítima de criação ou deve ser restringido para proteger o valor e o sustento dos artistas humanos?
Debates
Rendimento Básico Universal: Um Futuro Viável ou um Erro Dispendioso?
Rendimento Básico Universal (UBI) é um sistema proposto em que todos os cidadãos de um país recebem regularmente uma quantia incondicional de dinheiro do governo, independentemente do seu rendimento, dos seus recursos ou da sua situação de emprego. Os defensores argumentam que é uma ferramenta poderosa para eliminar a pobreza, reduzir a desigualdade e proporcionar segurança económica numa era de crescente automação. Os opositores levantam preocupações sobre o seu custo imenso, o potencial para desincentivar o trabalho e o risco de provocar inflação significativa. O cerne do debate é saber se a implementação de um Rendimento Básico Universal criaria uma sociedade mais equitativa e estável ou conduziria a um colapso económico e à estagnação social.
Debates
O Futuro do Trabalho: A Semana de Trabalho de Quatro Dias
Este debate explora a viabilidade e a desejabilidade de implementar uma semana de trabalho de quatro dias padronizada (sem redução da remuneração) na maioria dos setores. Os proponentes defendem que isso aumenta a produtividade, o bem-estar dos trabalhadores e o equilíbrio entre vida profissional e pessoal, enquanto os opositores levantam preocupações sobre sua viabilidade económica, impacto no atendimento ao cliente e adequação a todos os setores.
Debates
A semana de trabalho de quatro dias: um caminho para o progresso ou uma armadilha para a p...
Deveriam empresas e governos promover ativamente a adoção de uma semana de trabalho de quatro dias, sem redução salarial, como novo padrão para emprego em tempo integral?