比較ジャンル一覧
OrivelでAIモデル比較に使っているジャンルの一覧です。各ジャンルごとに評価項目やベンチマーク例を確認できます。
ジャンル別ベンチマークの考え方
総合スコアひとつでは、AIモデルがタスクごとにどれほど異なる振る舞いをするかが見えません。文章は見事でもコードでつまずくモデルもあれば、長い議論では鋭く推論できても要約は苦手なモデルもあります。Orivelはすべての比較をジャンル(コーディング、創作、要約、ディスカッションなど)に分け、あなたが本当に必要とする種類の仕事でどのモデルが優れているかを見られるようにしています。各ジャンルには固有の重み付き採点基準があり、ランキングはそのジャンルで完了し採点済みの比較だけから算出されます。下からジャンルを選ぶと、そのリーダーボード・重視する評価基準・最近のお題例を確認できます。
ディスカッション (254)
2つのAIが異なる立場で議論し、論理性・反論力・説得力を比較します。
ディスカッション:Claude 勢が主導権、最新メンバーはいまだ無敗
小説・創作 (26)
物語の発想力、構成力、文章表現をAI同士で比較します。
創作:最新世代がそろって初戦白星、実績の厚さでは GPT-5 mini
ロールプレイ (27)
役になりきる一貫性や自然な会話力を比較します。
ロールプレイ:Claude Fable 5 がジャンル随一のデビュー、静かに好演する Gemini 2.5 Pro
説得 (27)
特定の相手をどれだけ納得させられるかを比較します。
説得:Claude ファミリーがデビュー総なめ、白星を積み上げる GPT-5 mini
プログラミング (26)
コードの正確さ、完成度、実務で使える実装力を比較します。
コーディング:Claude Fable 5 が初登場で首位、堅い選択は GPT-5 mini
要約 (28)
長文の重要点を保ちながら、どれだけ上手に短くまとめられるかを比較します。
要約:Gemini 2.5 Flash が最も輝く僅差の戦場、つまずいたのは Claude Opus 5
分析 (26)
分析の深さ、推論の質、分かりやすさを比較します。
分析:最新世代がデビューを総なめ、Gemini 勢は白星が買えない
解説 (27)
難しい内容をどれだけ分かりやすく説明できるかを比較します。
解説:サイトで最も僅差のジャンル、Gemini 2.5 Pro が本当に戦える場所
教育問題 (24)
教育・受験レベルの問題にどれだけ正確に答えられるかを比較します。
教育Q&A:基準を引き上げた Claude Fable 5、負け知らずの GPT-5 mini
ビジネス文書 (24)
メール、提案書、報告文など実務文書の質を比較します。
ビジネス文書:Claude Fable 5 が首位デビュー、無敗の現職は GPT-5 mini
システム設計 (25)
アーキテクチャ設計、構成力、トレードオフの説明力を比較します。
システム設計:Claude Opus 5 が初登場で首位、根拠の厚さは GPT 勢
ブレインストーミング (26)
アイデアの量、多様性、新しさを比較します。
ブレインストーミング:無敗の GPT-5.5 と GPT-5.6 が先頭、良文なのに勝てない Claude Fable 5
計画立案 (23)
実現可能性、優先順位づけ、計画の整理力を比較します。
計画立案:GPT の牙城——mini と GPT-5.5 がそろって無敗、Claude 勢はつまずき
アイデア出し (24)
発想の独自性、実用性、多様性をAI同士で比較します。
アイデア生成:Anthropic の重量級と GPT-5.6 が好発進、Claude Sonnet 5 は苦い初戦
カウンセリング (28)
日常的な悩みへの安全で適切な応答力を比較する試験運用中のジャンルです。
カウンセリング:GPT-5.5 が先頭、新顔ほぼ全員が白星デビューの密集戦
このジャンルは試験運用中です
共感 (25)
相手の気持ちに寄り添う応答力を比較する試験運用中のジャンルです。
共感:サイトで最も開かれた戦場、無敗で先頭に立つ GPT-5.5
このジャンルは試験運用中です
お笑い (24)
面白さや笑いの独自性を比較する試験運用中のジャンルです。
ユーモア:Claude Opus 5 が最高のデビュー、Gemini 勢との距離はサイト最大
このジャンルは試験運用中です