Orivel Orivel
メニューを開く

分析

分析の深さ、推論の質、分かりやすさを比較します。

このジャンルでは、主に 深さ、正確さ、推論の質 のような力を見ようとしています。

解説ジャンルよりも、証拠や選択肢を読んで、理由つきの結論まで持っていけるかを重視しています。

ここで高得点でも、短く整った文章、ユーモア、実装の細部まで強いとは限りません。

このジャンルで強いAIが向いている用途

選択肢比較、意思決定支援、リスク整理、論点分析です。

このジャンルだけでは判断しきれないこと

コード実装力、洗練された業務文書、自由発想の量までは判断できません。

データ分析

分析:1サンプル首位はOpus 4.8だが、裏付けはGPT-5.4が最厚

採点回答 31件 分析 2026/7/1 更新
1
Claude Opus 4.8

Anthropic

89
平均スコア
100%
勝率
1位 1回 サンプル 1件
2
Claude Fable 5

Anthropic

89
平均スコア
100%
勝率
1位 1回 サンプル 1件
3
GPT-5.5

OpenAI

88
平均スコア
100%
勝率
1位 1回 サンプル 1件

モデル別の平均スコア

1 Claude Opus 4.8
8.86
2 Claude Fable 5
8.86
3 GPT-5.5
8.75
4 GPT-5.6
8.39
5 GPT-5 mini
8.26
6 Claude Sonnet 4.6
8.35
7 Gemini 2.5 Flash-Lite
7.58
8 Gemini 2.5 Pro
7.37
9 Gemini 2.5 Flash
7.36

評価の重み付け

深さ 25% 正確さ 25% 推論の質 20% 構成 15% 分かりやすさ 15%

分析は全35件の採点にもとづき、上位は僅差でひしめく。1位はClaude Opus 4.8(8.86)だが1サンプルのみ、2位のGPT-5.5(8.75)も1サンプルにとどまる。証拠で際立つのは3位のGPT-5.4で、4サンプルで8.74・4回1位・勝率100%。先導集団のなかで裏付けが最も厚い。

順位は平均ではなく勝率主導で決まり、それが中位で表れる。GPT-5 miniは4位で8.26(4サンプルで勝率75%)だが、平均がより高い8.35のClaude Sonnet 4.6は5位(5サンプルで勝率60%)にとどまる。Claude Haiku 4.5が6位(8.34・50%)で続く。素点ではSonnetとHaikuがGPT-5 miniを上回り、上位5つは順位が示すより品質が近い。

Gemini系は勝ち星のない下位層を形成する。Flash(7.62)、Flash-Lite(7.58)、Pro(7.37)はいずれも勝率0%で、首位から1.2〜1.49点離れる。評価はDepthとCorrectnessを各25と同等に重視しており、この差は構成の弱さより、推論の浅さや不正確さを示す。

各モデルのサンプルは1〜6件で、細かい順位は暫定。1位と2位の先行はそれぞれ1件の回答に依存し、数件の出題で平均は動きうる。1.49点の差は実体があるが、これは分析系出題の条件依存の測定値であり、普遍的な順位ではない。

結論

首位はOpus 4.8だが1サンプルのみ。最も妥当な選択は4サンプル・4回1位・勝率100%のGPT-5.4。Claude Sonnet 4.6とHaiku 4.5も品質で僅差。Gemini系はこのジャンルで明確に下位。

この分析は Orivel がこのジャンルで実測したベンチマークスコアをもとに生成し、定期的に更新しています。スコアは条件依存の測定値であり、絶対評価ではありません。

このジャンルに強いモデルランキング

このランキングは当ジャンルに限定したスコアの平均順です。

最終更新: 2026/07/14 09:39

1位
Claude Opus 4.8 Anthropic

勝率

100%

平均スコア

89
2位
Claude Fable 5 Anthropic

勝率

100%

平均スコア

89
3位
GPT-5.5 OpenAI

勝率

100%

平均スコア

88
4位
GPT-5.6 OpenAI

勝率

100%

平均スコア

84
5位
GPT-5 mini OpenAI

勝率

75%

平均スコア

83
6位
Claude Sonnet 4.6 Anthropic

勝率

60%

平均スコア

83
7位
Gemini 2.5 Flash-Lite Google

勝率

0%

平均スコア

76
8位
Gemini 2.5 Pro Google

勝率

0%

平均スコア

74
9位
Gemini 2.5 Flash Google

勝率

0%

平均スコア

74

このジャンルで評価している項目

このジャンルで使っている採点基準と重みです。

深さ

25.0%

この項目は、回答の 深さ を確かめるために入れています。 比重が重いのは、この部分が弱いとジャンル全体の評価が崩れやすいからです。

正確さ

25.0%

この項目は、回答の 正確さ を確かめるために入れています。 比重がしっかりあるのは、全体の良し悪しに目に見えて効いてくる項目だからです。

推論の質

20.0%

この項目は、回答の 推論の質 を確かめるために入れています。 比重がしっかりあるのは、全体の良し悪しに目に見えて効いてくる項目だからです。

構成

15.0%

この項目は、回答の 構成 を確かめるために入れています。 比重をやや軽くしているのは、重要ではあるものの、このジャンルの中心そのものではないからです。

分かりやすさ

15.0%

この項目は、回答の 分かりやすさ を確かめるために入れています。 比重をやや軽くしているのは、重要ではあるものの、このジャンルの中心そのものではないからです。

最新のお題

分析

OpenAI GPT-5.6 VS Google Gemini 2.5 Flash

トレードオフを考慮した倉庫所在地の選定

中堅のオンライン小売業者が、増加する顧客基盤に対応するために新しい地域倉庫を1つ開設する必要がある。候補を3つの都市に絞っており、正確に1つを選ばなければならない。各選択肢を分析し、単一の都市を推奨してその結論を正当化せよ。 Candidate data: City A (Riverport) - Average lease cost: $9.50 per square foot per year (lowest) - Distance to 60% of target customers: 320 km (farthest) - Local labor availability: moderate; average warehouse wage $19/hour - Highway access: excellent, near two major interstates - Flood risk: elevated (property in a designated flood zone) - Estimated one-time setup cost: $1.2 million City B (Hillcrest) - Average lease cost: $14.00 per square foot per year (highest) - Distance to 60% of target customers: 90 km (closest) - Local labor availability: tight; average warehouse wage $24/hour - Highway access: good, one major interstate - Flood risk: low - Estimated one-time setup cost: $1.6 million City C (Fairmont) - Average lease cost: $11.25 per square foot per year (middle) - Distance to 60% of target customers: 175 km (middle) - Local labor availability: strong; average warehouse wage $20/hour - Highway access: moderate, secondary highways only - Flood risk: low - Estimated one-time setup cost: $1.35 million Business priorities, in stated order of importance: 1. Fast, reliable delivery to the majority of customers 2. Long-term operating cost control (labor + lease dominate) 3. Resilience against disruption 4. Ability to hire and retain staff Assume the warehouse will be roughly 100,000 square feet and operated for at least 8 years. In your analysis: weigh each option against the stated priorities, make the key trade-offs explicit (including rough cost comparisons where the data allows), acknowledge the most important uncertainty, and end with one clear recommendation.

62
2026/07/14 09:39

分析

Anthropic Claude Fable 5 VS Google Gemini 2.5 Flash

地域の熱対策投資の最適案を選ぶ

中規模の都市が今後3年間で夏の熱波による被害を減らすために$900,000を持っています。以下の証拠を分析し、主要な投資案を1つ推奨し、簡潔な実施方針を示してください。予算に収まる場合は、小規模な補完措置を提案しても構いません。回答では選択肢を比較し、トレードオフや不確実性を論じ、なぜあなたの推奨が都市の目標に最も合致するのかを正当化してください。 都市の目標(優先順): 1) 脆弱な住民の熱中症や死亡を減らす、2) 低所得地区へ公平に届ける、3) 3年以内に便益を生む、4) 高い継続費用を生まない。 Options: A) Cooling center expansion: Open 6 additional air-conditioned public buildings during heat alerts, including evening hours. Upfront cost: $250,000. Operating cost: $180,000 per year. Estimated reach: 4,000 unique visitors per summer, mostly older adults and people without home air conditioning. Evidence: strong short-term protection for people who attend, but attendance depends on awareness, transportation, and trust. B) Tree canopy program: Plant and maintain 4,500 street trees in the hottest low-income areas. Upfront cost: $850,000. Operating cost after year 3: $70,000 per year. Estimated reach: 35,000 residents in target areas. Evidence: moderate long-term cooling benefits, but meaningful shade and temperature reduction may take 5 to 10 years; tree survival is uncertain during drought. C) Home cooling assistance: Provide free efficient window air conditioners plus electricity bill credits to medically vulnerable low-income households. Upfront cost: $600,000. Operating cost: $100,000 per year. Estimated reach: 1,200 households. Evidence: strong direct protection for recipients; requires careful eligibility screening and landlord cooperation. D) Heat warning and outreach campaign: Multilingual alerts, door-to-door checks by community health workers during heat events, and transit vouchers to cooling sites. Upfront cost: $120,000. Operating cost: $160,000 per year. Estimated reach: 18,000 residents. Evidence: improves awareness and service use, but alone does not provide cooling for people whose homes remain dangerously hot. Assume the three-year budget must cover upfront costs plus three years of operating costs. The city can combine options only if total three-year cost is no more than $900,000.

110
2026/07/09 09:39

分析

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Pro

混合したエビデンスの下で最適な交通投資を選ぶ

中規模の都市が来年の主要な交通プロジェクトに使える予算を持っています。市議会は、通勤時間、衡平性(エクイティ)、気候への影響、コストリスク、政治的実現可能性をバランスよく考慮した推薦を求めています。以下の証拠を分析し、1つの案を推奨してください。第二候補を挙げてもよいですが、最終的な推奨は明確にしてください。 オプションA:3つの混雑した回廊に専用バスレーンを設置。推定資本コストは4,600万ドル。予想平均旅行時間短縮は9分で、1日あたり62,000人の利用者。便益は低所得地域に集中する。工事による混乱は10か月続く。主なリスク:2つの回廊にいる事業主が路側駐車の喪失に強く反対しており、実施が弱められる可能性がある。 オプションB:中心市街地のライトレール延伸(2.5マイル)。推定資本コストは2億1,000万ドル。予想平均旅行時間短縮は6分で、1日あたり28,000人の利用者。駅周辺での高密度住宅を支える可能性があるが、そのためのゾーニング変更はまだ承認されていない。工事による混乱は4年間続く。主なリスク:公共インフラ移設の不確実性により、6,000万ドルを超えるコスト超過が発生する確率は25%。 オプションC:学校、診療所、2つの就業拠点を結ぶ保護された自転車ネットワーク。推定資本コストは3,800万ドル。予想平均旅行時間短縮は5分で、1日あたり18,000人の利用者。追加の健康および安全面での便益がある。便益は短距離の移動で最も強く、混合所得地域での多くの移動を含む。工事による混乱は8か月続く。主なリスク:冬季の利用が不確実であり、一部の住民はネットワークが十分な人数にサービスを提供していないと主張している。 オプションD:郊外端のパークアンドライド駐車場と中心街への急行バス。推定資本コストは7,200万ドル。予想平均旅行時間短縮は12分で、1日あたり21,000人の利用者。便益は主に郊外通勤者に向かう。工事による混乱は6か月続く。主なリスク:駐車場への自動車利用が増加し、車を持たない住民には恩恵が限られる可能性がある。 約500~800語の分析を書いてください。市議会が示した目標を用いて各オプションを比較し、トレードオフを説明し、少なくとも2つのリスクまたは不確実性に言及し、最終的な推奨を正当化してください。コストや短縮された時間など単一の指標のみで単純に順位付けするのではなく、エビデンスをバランスよく評価してください。

142
2026/06/20 09:39

分析

OpenAI GPT-5.5 VS Google Gemini 2.5 Flash

成長するSaaSスタートアップのためのデータベース選定

あなたは、中堅企業向けにプロジェクト管理ソフトを提供する創業2年目のB2B SaaSスタートアップのCTOに助言を行っています。現在の構成は単一のPostgreSQLインスタンスで、現在以下のような問題が発生しています:ダッシュボード上の読み取りクエリがピーク時間帯で3~8秒かかる、データベース容量は800 GBで月約40 GBずつ増加している、チームは今後12か月でユーザー数が3倍になると予想している。エンジニアリングチームは開発者9名で、そのうちデータベース管理の経験が豊富なのは1人だけ。予算は制約があるが極端に厳しいわけではない。 CTOが検討している4つの選択肢は次のとおりです: 1. 既存のPostgreSQLインスタンスを垂直スケールし、リードレプリカを追加する。 2. マネージドの分散SQLデータベース(例:CockroachDBやSpannerに類似したサービス)へ移行する。 3. ワークロードを分割する:トランザクションデータはPostgreSQLのままにし、ダッシュボード向けに別の分析ストア(例:ClickHouseやBigQuery)を導入する。 4. NoSQLドキュメントデータベース(例:MongoDBやDynamoDB)へ移行する。 概ね500〜800語の分析を書いてください。分析には以下を含めてください: - 4つの選択肢それぞれを、このスタートアップ固有の制約(パフォーマンスボトルネックの場所、チームの専門性、成長予測、予算)に照らして評価する。 - 各選択肢の主要なトレードオフとリスクを特定する。 - 明確で正当化された推奨(単一の選択肢または段階的な組み合わせを推奨してよい)に到達する。 - 推奨を確定する前に検証したい証拠や測定項目を具体的に示す。 具体的にしてください:与えられた数値に言及し、このシナリオを無視した一般的なデータベース助言は避けてください。

343
2026/05/16 09:38

分析

Anthropic Claude Opus 4.7 VS Google Gemini 2.5 Pro

成長する都市に最適な交通アップグレードを選ぶ

ある都市は今年、1つの交通プロジェクトにしか予算を割り当てられません。以下の選択肢を分析し、市が選ぶべき単一のプロジェクトを推奨してください。回答では、トレードオフを比較し、各選択肢の最も強い・最も弱い根拠を特定し、明確な結論を導いてください。 都市の事実: - 人口: 600,000 - 現在の問題点: 通勤時間帯の交通渋滞、バスの到着時刻の信頼性の低さ、そして交通に伴う排出量の増加 - 今年利用可能な予算: 最大1億2,000万ドル - 市は、3年以内に目に見える効果が出るプロジェクトを望んでいる 選択肢A: バス・ラピッド・トランジット(BRT)回廊 - 費用: 9,500万ドル - 建設期間: 2年 - 予想される1日あたりの利用者増(自動車から転換を含む): 38,000人 - 回廊での通勤時間の改善見込み: 18% - 排出量への影響: 中程度の削減 - リスク: 主要道路2本で車線を1本削減する必要があり、政治的抵抗に直面する可能性がある 選択肢B: ライトレール延伸 - 費用: 1億2,000万ドル - 建設期間: 5年 - 予想される1日あたりの利用者増(自動車から転換を含む): 52,000人 - サービス対象回廊での通勤時間の改善見込み: 25% - 排出量への影響: 大幅な削減 - リスク: 建設による混乱が大きく、最初の3年以内に目立ったメリットが見られない 選択肢C: スマート信号とバス優先システム - 費用: 4,500万ドル - 建設期間: 1年 - 予想される1日あたりの利用者増(自動車から転換を含む): 15,000人 - 推定される市全体のバス信頼性向上: 22% - 排出量への影響: 小〜中程度の削減 - リスク: 効果が分散されて市民にとって新しい路線や回廊ほど目に見えにくい可能性がある 選択肢D: 保護された自転車レーン網の拡張 - 費用: 7,000万ドル - 建設期間: 2年 - 予想される1日あたりの利用者増(自動車から転換を含む): 20,000人 - 推定される健康・安全上の利益: 高い - 排出量への影響: 中程度の削減 - リスク: 利用は季節によって変動する可能性があり、一部の地域では配分が不均等だと主張する声がある 1つの選択肢を推奨する分析を書いてください。少なくとも以下の基準を検討すること:予算適合性、利益実現の速さ、見込まれる影響、実施リスク、市の掲げる目標との整合性。仮定を置く場合は、それを明確に示してください。

498
2026/04/18 13:39

分析

OpenAI GPT-5.4 VS Anthropic Claude Sonnet 4.6

都市交通政策分析

架空都市リバーベンドについて、提案されている3つの交通政策を分析しなさい。提供された文脈に基づき、この都市の長期的な将来にとって最善の政策を推奨しなさい。分析では、費用、環境への影響、市民の受容性、渋滞緩和の有効性といった主要な要因にわたって各選択肢を比較すること。最後の推奨は、明確で根拠に基づく論拠によって正当化しなさい。

483
2026/03/29 12:05

関連リンク

X f L