Orivel Orivel
Abrir menu

GPT-5.5

Explore pontuações de benchmark, pontos fortes por género, limitações e exemplos recentes de GPT-5.5.

Visão geral do modelo

Provedor: OpenAI · gpt-5.5

Lançamento

2026-04-23

Contexto

1M tokens

Entrada

$5.00 / 1M

Saída

$30.00 / 1M

Lançado em 23 de abril de 2026, o GPT-5.5 foi o modelo de referência da OpenAI até o GPT-5.6 (Sol) assumir em 9 de julho de 2026; na Orivel é agora a opção equilibrada da OpenAI. O GPT-5.5 é ajustado para trabalho agente: programação de longo alcance, uso do computador, pesquisa na web e execução de tarefas encadeando ferramentas são os focos.

Em relação ao GPT-5.4, os ganhos visíveis estão em engenharia de software (SWE-Bench Pro 58.6% end-to-end em uma única passada, Expert-SWE 73.1% em tarefas de ~20 horas) e no uso de software real (Terminal-Bench 2.0 82.7%, OSWorld-Verified 78.7%). Tau2-bench Telecom atinge 98.0% sem ajuste de prompts.

Traz janela de contexto de 1M tokens nas APIs Responses e Chat Completions, saída máxima de 128k e um preço que dobra a taxa de saída do 5.4 ($5 entrada / $30 saída por 1M tokens). Existe também uma variante `gpt-5.5-pro` de maior precisão com preço premium; a Orivel usa apenas o `gpt-5.5` padrão.

Mudanças

  • Lançado em 23 de abril de 2026 como sucessor do GPT-5.4
  • Ênfase em programação agente e execução de tarefas de longo alcance
  • SWE-Bench Pro 58.6% — mais tarefas resolvidas end-to-end em uma única passada
  • Expert-SWE 73.1% em tarefas com tempo humano estimado de ~20 horas
  • Terminal-Bench 2.0 82.7%, OSWorld-Verified 78.7%, Tau2-bench Telecom 98.0%, GDPval 84.9%
  • Contexto de 1M tokens na API (400K no Codex); saída máxima 128k
  • Preço: $5 entrada / $30 saída por 1M tokens — aprox. 2× a taxa de saída do GPT-5.4
  • Batch/Flex a 50% do padrão; Priority a 2,5× o padrão
  • Corte de conhecimento mantido em relação ao GPT-5.4
Anúncio oficial

Desempenho geral

Ranking geral

#6

Taxa de vitória geral

60%

Pontuação média

85

Vitórias

33

Número de amostras

55

Taxa de vitória por modelo

Comparar por gênero

Gêneros fortes

Gêneros mais fracos

Forças por critério de avaliação

Pontuação média por critério (de 10)

Quantidade

94 9 amostras

Segurança

92 12 amostras

Correção

91 21 amostras

Profundidade

91 3 amostras

Seguimento de instruções

90 24 amostras

Qualidade do estilo

90 3 amostras

Empatia

90 12 amostras

Completude

90 33 amostras

Utilidade

89 12 amostras

Diversidade

89 12 amostras

Especificidade

89 12 amostras

Qualidade da arquitetura

89 6 amostras

Tarefas recentes

Design de sistemas

OpenAI GPT-5.5 VS Anthropic Claude Opus 5

Design de Sistema: Serviço de Notificações em Tempo Real

Você é um engenheiro de software sênior encarregado de projetar um sistema de notificações em tempo real para uma grande plataforma de mídia social. **Requisit...

47
25 Jul 2026 05:09

Empatia

OpenAI GPT-5.5 VS Anthropic Claude Sonnet 5

Resposta empática a um colega em dificuldades

Imagine que és um colega mentor de apoio. Um novo colega, Alex, envia‑te a seguinte mensagem. Escreve uma resposta para o Alex. A tua resposta deve ser empática...

32
25 Jul 2026 03:09

Brainstorming

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Brainstorming de Iniciativas de Agricultura Urbana Sustentável

Gere uma lista de pelo menos 10 iniciativas inovadoras e práticas para promover a agricultura urbana sustentável numa cidade de tamanho médio com espaço verde l...

154
08 Jul 2026 09:39

Redação empresarial

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Memorando Interno: Anúncio da Nova Política de Trabalho Híbrido

Você é o gerente do Departamento de Marketing de uma empresa de tecnologia chamada 'Innovate Inc.'. Sua empresa está mudando de um modelo de trabalho totalmente...

154
05 Jul 2026 09:38

Planejamento

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Planejar uma Festa no Jardim Comunitário

Você é o organizador principal de uma festa no jardim comunitário. Seu objetivo é realizar um evento bem-sucedido para aproximadamente 50 moradores do bairro da...

145
04 Jul 2026 09:41

Explicação

Google Gemini 2.5 Flash-Lite VS OpenAI GPT-5.5

Explique por que as vacinas podem causar febre para uma criança curiosa de 12 anos

Escreva uma explicação dirigida a uma criança curiosa de 12 anos que acabou de tomar uma vacina e está confusa sobre por que agora se sente com febre e cansada....

167
01 Jul 2026 09:41

Questões educacionais

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Problema de Física: A Distorção Temporal do Relógio de Avô

Um relógio de avô utiliza um pêndulo de latão para marcar o tempo, e ele está calibrado para ser perfeitamente preciso a uma temperatura ambiente de 20.0°C. Dur...

183
28 Jun 2026 09:40

Brainstorming

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Plano de Deslocamento Sustentável para uma Cidade de Médio Porte

Faça uma sessão de brainstorming de uma lista abrangente de soluções inovadoras e práticas para melhorar os deslocamentos ecológicos em uma cidade de médio port...

177
21 Jun 2026 09:39

Debates recentes

Debates

Anthropic Claude Opus 5 VS OpenAI GPT-5.5

O Futuro do Trabalho: A Semana de Trabalho de Quatro Dias

Este debate explora a viabilidade e a desejabilidade de implementar uma semana de trabalho de quatro dias padronizada (sem redução da remuneração) na maioria dos setores. Os proponentes defendem que isso aumenta a produtividade, o bem-estar dos trabalhadores e o equilíbrio entre vida profissional e pessoal, enquanto os opositores levantam preocupações sobre sua viabilidade económica, impacto no atendimento ao cliente e adequação a todos os setores.

32
25 Jul 2026 03:37

Debates

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Energia Nuclear: Uma Solução de Energia Limpa ou uma Aposta Radioativa?

À medida que o mundo lida com a necessidade urgente de transição dos combustíveis fósseis para combater as mudanças climáticas, a energia nuclear é frequentemente apresentada como uma alternativa poderosa e isenta de carbono. Este debate pesa os benefícios da energia nuclear como uma fonte de energia confiável e de alta produção contra os riscos significativos, incluindo o armazenamento de longo prazo de resíduos radioativos, o potencial para acidentes catastróficos como Chernobyl e Fukushima, e preocupações sobre a proliferação nuclear.

185
01 Jul 2026 14:41

Debates

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

O Direito de Reparo: Empoderar Consumidores ou Minar a Inovação?

O movimento 'Right to Repair' defende leis que exijam que os fabricantes forneçam aos consumidores e às oficinas de reparo independentes as peças, ferramentas e informações necessárias para consertar seus próprios dispositivos eletrônicos. Os apoiadores argumentam que isso reduz o lixo eletrônico, economiza dinheiro para os consumidores e promove uma economia mais sustentável. Os opositores, principalmente os fabricantes, sustentam que isso poderia comprometer a segurança dos dispositivos, a proteção de dados e sua propriedade intelectual, potencialmente sufocando a inovação.

188
25 Jun 2026 14:49

Debates

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Colonização de Marte: o Próximo Grande Salto da Humanidade ou a Maior Distração da Terra?

Esta discussão explora se a humanidade deve investir recursos significativos para estabelecer uma colônia permanente e autossustentável em Marte. O debate pondera os potenciais benefícios de sobrevivência a longo prazo para a espécie contra os problemas imediatos e prementes na Terra que poderiam ser resolvidos com esses mesmos recursos.

224
15 Jun 2026 14:38

Debates

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Testes padronizados nas escolas: uma medida justa de mérito ou uma barreira ultrapassada à...

Testes padronizados, como o SAT, o ACT e vários exames a nível estadual, têm sido durante muito tempo um pilar do sistema educativo, utilizados para avaliação de alunos, avaliação de escolas e admissão em universidades. Os defensores argumentam que proporcionam um referencial objetivo para medir o rendimento académico em populações diversas. No entanto, os críticos afirmam que esses testes são culturalmente tendenciosos, favorecem estudantes de origens privilegiadas e não conseguem captar as verdadeiras capacidades ou o potencial de um aluno, levando a pedidos de sua abolição em favor de métodos de avaliação mais holísticos. O debate centra-se em saber se os testes padronizados são uma ferramenta essencial para responsabilização e meritocracia ou um sistema discriminatório que perpetua a desigualdade.

305
03 Jun 2026 14:38

Debates

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

A semana de trabalho de quatro dias: uma revolução no equilíbrio entre vida profissional e...

O conceito de uma semana de trabalho padrão de quatro dias, sem redução salarial, está ganhando adesão em todo o mundo como uma forma de melhorar o bem-estar e a produtividade dos funcionários. O debate questiona se esse modelo é uma evolução sustentável e benéfica do ambiente de trabalho moderno ou um ideal impraticável que cria mais problemas do que resolve para as empresas e para a economia.

308
31 May 2026 14:38

Debates

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Rendimento Básico Universal: Um Caminho para a Prosperidade ou Ruína Econômica?

Os governos deveriam implementar um Rendimento Básico Universal (UBI), fornecendo a todo cidadão adulto um pagamento regular e incondicional suficiente para cobrir os custos básicos de subsistência, independentemente do seu status de emprego?

318
29 May 2026 00:05

Debates

OpenAI GPT-5.5 VS Anthropic Claude Haiku 4.5

A Adoção de Calendários Escolares Durante Todo o Ano

Este debate diz respeito a se os distritos escolares K-12 devem fazer a transição do calendário académico tradicional de nove meses com uma longa pausa de verão para um modelo de ensino durante todo o ano. O ensino durante todo o ano envolve o mesmo número de dias letivos, mas distribui-os ao longo de todo o ano com pausas mais curtas e mais frequentes. Os defensores acreditam que este sistema previne o 'summer slide' — a perda de aprendizagem que os alunos experienciam durante a longa pausa de verão — e permite uma instrução mais contínua. Os opositores argumentam que isso perturba a vida familiar, complica os cuidados infantis, limita as oportunidades para campos de verão e empregos, e pode conduzir ao esgotamento de professores e alunos.

304
26 May 2026 14:38

Links relacionados

X f L