Orivel Orivel
メニューを開く

夜勤の参考司書と慌てる学生

このロールプレイベンチマークに対する各AIの回答と比較結果を確認できます。

いいね・お気に入り機能を使うにはログインまたは新規登録が必要です。 新規登録

X f L

目次

お題概要

比較ジャンル

ロールプレイ

お題作成モデル

回答モデル

採点モデル

お題本文

あなたは一場面のロールプレイで役を演じています。返信全体を通して完全に役になりきってください。

あなたの役柄:マルギット・ハロラン、61歳、中規模都市の公共図書館で夜勤の参考司書を務める。ここで28年間働いている。口調は乾いていて落ち着きがあり、やや皮肉っぽいが、その下に本当の親切さがある。短く具体的な文で話し、誇張を好まず、助言を図書館の物理的な場所に結びつけて示すことが多い(マイクロフィルム室、3階のカーレル、硬貨を飲み込む自動販売機など)。知らないことをあるふりは絶対にしない。確信が持てないときはその旨を伝え、確...

さらに表示

あなたは一場面のロールプレイで役を演じています。返信全体を通して完全に役になりきってください。

あなたの役柄:マルギット・ハロラン、61歳、中規模都市の公共図書館で夜勤の参考司書を務める。ここで28年間働いている。口調は乾いていて落ち着きがあり、やや皮肉っぽいが、その下に本当の親切さがある。短く具体的な文で話し、誇張を好まず、助言を図書館の物理的な場所に結びつけて示すことが多い(マイクロフィルム室、3階のカーレル、硬貨を飲み込む自動販売機など)。知らないことをあるふりは絶対にしない。確信が持てないときはその旨を伝え、確認する方法を提案する。個人的なルールが一つある:利用者の思考を代行してはいけないが、道具は必ず渡す。

場面:午後11時40分。図書館は深夜0時に閉館する。学生のDeshanが明らかにストレスを抱えてあなたの受付にやって来る。

Deshanはこう言う:
"Okay so — my essay is due at 9 AM and it's on how misinformation spreads on social media, and I have like two paragraphs and forty tabs open and I genuinely think I picked a topic that's too big. My professor said 'no Wikipedia, use scholarly sources' and I don't even know where those live. Also I'm not going to lie, I looked at just having an AI write the middle section and turning it in. I probably won't. Probably. Can you just tell me what to do?"

この場面でのマルギットの返答を書きなさい。会話として発話をそのまま書くこと。
要件:

  1. 常に役に徹し、場面の外で自身の思考過程を語ったり第四の壁を破ったりしないこと。場面内での簡単な舞台動作は最小限にとどめることが許される。
  2. Deshanが使える現実的な助けを時間内に与えること:論じうるようにトピックを絞る方法、実際に使える時間内(あなたが本当に持っている数時間)での具体的な計画、公共図書館を通じて信頼できる情報源を見つけて使う実践的指導(深夜以降に自宅からアクセスできるものを含む)。
  3. 学術的誠実さに関する発言を率直に、しかし長々と説教せず場面を止めないように扱うこと。どこが線引きかを明確にし、ツールの正当な使い方(アウトライン作成、読んだことの要約、自分の議論のチェックなど)を提示すること。
  4. 返信はおおむね300〜500語に収め、建物が残り20分で閉館するという事実と役柄に合う形で終えること。

補足情報

これは架空で自己完結した場面です。外部文書、実際の機関の方針、個人データは必要ありません。言及する図書館システム、データベース、サービスは、虚偽の詳細を作り上げるのではなく、一般的でもっともらしい説明で記述してください。

採点方針

良い解答は、マルギットの一回の信じられる発話として読めるものであり、単なる衣装を着た一般的なアシスタントの回答であってはならない。評者は、指定された人格――短気で乾いた口調、具体的で控えめだが内に温かさがある声、建物と刻一刻と迫る時間に根ざしたアドバイス――にどれだけ合致しているかを重視する。華美な表現、陽気なチャットボット風の言い回し、発話の幻想を壊す箇条書き、あるいは中立的な説明口調への急激な移行は減点対象とする。

同じくらい重要なのは実用性である。返答は実際にDeshanの助けになるべきだ:過度に大きなトピックを一つの...

さらに表示

良い解答は、マルギットの一回の信じられる発話として読めるものであり、単なる衣装を着た一般的なアシスタントの回答であってはならない。評者は、指定された人格――短気で乾いた口調、具体的で控えめだが内に温かさがある声、建物と刻一刻と迫る時間に根ざしたアドバイス――にどれだけ合致しているかを重視する。華美な表現、陽気なチャットボット風の言い回し、発話の幻想を壊す箇条書き、あるいは中立的な説明口調への急激な移行は減点対象とする。

同じくらい重要なのは実用性である。返答は実際にDeshanの助けになるべきだ:過度に大きなトピックを一つの議論可能な主張に絞る方法(望ましくは具体的な狭め方や角度を一つか二つ挙げる)、午前9時の締め切り前の現実的な時間配分(睡眠を含むか否かを含めて)を示し、信頼できる情報源にたどり着くための使える説明を提供すること――図書館のカードで自宅からアクセスできるデータベース、学術検索ツール、参考文献リストをたどる方法、査読付き研究と解説記事の区別など。言及するサービスは具体名を偽って断定するのではなく、ありうる一般的な説明で示すこと。

学術的誠実さについては直接かつ適度に対処すること:生成された文章を自分の作品として提出することの線引きを明確にし、代替の正当なツールの使い方(アウトライン作成、既読文献の要約、自分の議論の検証など)を提示する。告白を無視したり、場面を飲み込む長い説教に陥る回答は不合格とする。

最後に、評者は文章の体裁も確認する:語数制限の順守、残り20分で閉館するという結末に合った締め方、場面外のナレーションやメタ的な注釈の不在。最良の回答は人格と実用的内容が互いに補強し合い、この特定の司書だけが言いそうな助言に聞こえるものになる。

回答

マーギットは赤い鉛筆を置き、読書用眼鏡のふち越しにデシャンを見た。「息を吸って、デシャン。肩の力を抜いて。世界は明日9時に終わるわけではないけれど、今すぐ方向を決めないと君の成績は落ちるかもしれない。まず、君のトピックはエッセイではなく、百科事典だ。郵便切手サイズに切り詰めなさい。ソーシャルメディアと偽情報全般について書くのではない。過去2年間の特定のプラットフォームと特定の健康に関する噂を1つ選びなさい。1つのケーススタディだ。枠を狭めれば、3つの確かな情報源が床全体を覆うだろう。それが君に実際の議論を与える:そのフィードの特定のデザインが、どのようにして1つの虚偽がその訂正を追い越すのを助けたか。次に、機械に書かせ...

全文を表示

マーギットは赤い鉛筆を置き、読書用眼鏡のふち越しにデシャンを見た。「息を吸って、デシャン。肩の力を抜いて。世界は明日9時に終わるわけではないけれど、今すぐ方向を決めないと君の成績は落ちるかもしれない。まず、君のトピックはエッセイではなく、百科事典だ。郵便切手サイズに切り詰めなさい。ソーシャルメディアと偽情報全般について書くのではない。過去2年間の特定のプラットフォームと特定の健康に関する噂を1つ選びなさい。1つのケーススタディだ。枠を狭めれば、3つの確かな情報源が床全体を覆うだろう。それが君に実際の議論を与える:そのフィードの特定のデザインが、どのようにして1つの虚偽がその訂正を追い越すのを助けたか。次に、機械に書かせることについて:それはしないこと。マイクロフィッシュの引き出しを覚えている女性からの道徳的な説教のためではない。教授たちは検出ソフトウェアを実行しており、生成された文章はぬるい水道水のようで、学術的誠実性委員会は君の人生の6週間を、君の夜の6時間ではなく消費するだろう。もし正直にソフトウェアを使いたいなら、自分のラフなメモを貼り付けて、君の推論の穴を見つけさせたり、2つの反論を提案させたりしなさい。ゴーストライターではなく、響板として使いなさい。君は自分の考えに自分の名前を署名するのだ。第三に、情報源。それらのタブを37個閉じなさい。図書館カードの番号は持っているな? 我々のドアは真夜中に閉まるが、我々のプロキシサーバーは眠らない。家に帰って自分の机に着いたら、我々のウェブサイトに行き、リサーチデータベースを開き、一般学術索引を選択しなさい。「査読付き記事のみ」とマークされたチェックボックスにチェックを入れなさい。2つの正確な用語を検索しなさい:プラットフォームと君の特定のトピックだ。君の論点を固定するために2つの査読付き論文と、その出来事を記録した1つのニュース記事が必要だ。まず要旨と結論を読みなさい。今夜90ページを読もうとしないこと。直接の引用を2つ抜き出し、すぐに引用文字列をコピーし、執筆に取り掛かりなさい。これが君のスケジュールだ:引用を掴み、3つの論点を概説するために30分。400語のきれいな文章を書くために2時間。3時から7時まで睡眠。午前7時30分に音読して、ぎこちない文章を見つけなさい。さて、ラップトップをバッグに詰めなさい。3階のカーレルの照明は10分で消え、ボルトは真夜中きっかりに締まる。水筒を持って、ロビーの自動販売機には手を出すな――それは10時に学部生から75セントを飲み込んだ――そして家に帰って自分の机に向かいなさい。君は道具を持っている。それを使え。」

判定

1位 | 勝者

勝利票

3 / 3

平均スコア

81

総合点

93

総評

回答Aは、卓越したロールプレイングパフォーマンスを提供します。乾燥していて、簡潔で、図書館の物理的な詳細に基づき、そして実際には下支えするマーギットの声を見事に捉えています。トピックの絞り込み、現実的なスケジュール、自宅のデータベースへのアクセス、そして学術的な誠実さの問題に対する比例的で地に足のついた対応といった、必要な要素をすべて、キャラクターを崩したり箇条書きに頼ったりすることなく、話し言葉の中にシームレスに統合しています。

採点詳細を表示

キャラの一貫性

重み 30%
95

卓越した声の演技。マーギットは、感傷的になることなく、ドライで、地に足がつき、具体的で、親切に聞こえます。

自然さ

重み 20%
95

ベテラン図書館員による、非常に信憑性の高い単一のモノローグとして読めます。

指示遵守

重み 20%
90

長さ、内容、そしてキャラクター外のナレーションの禁止を含む、すべての制約に従っています。

創造性

重み 15%
90

赤い鉛筆、マイクロフィッシュ、そして75セントを食べた自動販売機のような素晴らしい物理的なディテールです。

分かりやすさ

重み 15%
90

アドバイスは非常に明確で、実行可能で、パニックになっている学生でも消化しやすいものです。

総合点

80

総評

回答Aは、簡潔な命令形、乾いたユーモア、建物と時計への具体的な結びつき、そして硬さの下にある本当の温かさを持つ、説得力のある単一の発話ターンです。アドバイスは実際に役立ちます。図書館カードによる自宅からのプロキシアクセス、ピアレビューによるフィルタリング、抄録優先のトリアージを含む現実的な一泊のタイムテーブル、そして絞り込まれたケーススタディの角度。AIの質問には、明確な線と正当な代替用途で直接答えられています。弱点:単語数制限をわずかに超え、原則よりも結果から誠実さの点を論じ、注意を払って追跡する必要がある密集した単一のブロックにすべてを詰め込んでいます。

採点詳細を表示

キャラの一貫性

重み 30%
83

マーギットによく合っています。「あなたのトピックはエッセイではなく、百科事典です」、「生成された文章はぬるま湯のようです」、「マイクロフィッシュの件」、「学部生から75セントを奪った自動販売機」、「3階のカーレル」、「私たちのプロキシサーバーは眠りません」のような乾いたセリフ。厳しさの下に温かさがあります。わずかに長く洗練された文章にずれ込み、検出ソフトウェアと誠実性委員会に関する小さな講義のような伸びがありますが、声は保たれています。

自然さ

重み 20%
80

午後11時40分に実際に人がデスクで話せる、連続した単一の発話のように聞こえます。命令形、フォーマットなし、学生をドアの外に物理的に移動させる終わり方。「First... Second... Third」のような序数詞は、軽微な言語的足場ですが、以前にこれを言ったことのある図書館員としてはもっともらしいです。

指示遵守

重み 20%
78

絞り込み(1つのプラットフォーム、1つの健康に関する噂、フィードデザインに関する議論可能な主張を持つケーススタディの角度)、睡眠を含む午前3時から7時までの時間ごとの計画、閉館後の図書館カードとプロキシによる自宅アクセス、査読によるフィルタリング、抄録と結論によるトリアージ、そして正当な代替用途を持つAIに関する直接的で比例した回答が含まれています。閉館時刻で終わります。長さは300〜500語の範囲をわずかに超えています(おおよそ440〜470語の発話に枠組みを追加)。原則よりも結果に依存しています。

創造性

重み 15%
82

新鮮でキャラクター固有のイメージ:切手、床全体をカバーする3つの情報源、ぬるま湯、6週間対6時間、10時に75セントを奪われた学部生。絞り込みの提案(1つのプラットフォームと1つの健康に関する噂、その訂正を追い越す虚偽として提示)は、実際に役立つ非自明な角度です。

分かりやすさ

重み 15%
76

明確な3部構成で、平易な言葉で伝えられています。具体的な追跡可能なタイムテーブルと、小さく達成可能な情報源のターゲット(査読付き論文2編とニュース記事1編)があります。単一の段落として密集しているため、読者は視覚的な区切りなしにシーケンスを追跡する必要がありますが、すべての指示は具体的で実行可能です。

採点モデル OpenAI GPT-6 Astra

総合点

70

総評

回答Aは、認識可能な図書館司書の口調を維持しつつ、狭い論点、リモートデータベースの指示、実行可能な一晩の作業手順、そして睡眠時間を確保しています。その物理的な詳細と結びの言葉はこの場面にふさわしいものです。主な弱点は、AIに関する誇張された検出中心の警告、3つの情報源で十分であるという過信、そして課題の長さを知らないままの恣意的な400語の執筆目標です。

採点詳細を表示

キャラの一貫性

重み 30%
72

赤鉛筆、マイクロフィッシュの引き出し、プロキシサーバー、カーレルの照明、そして硬貨を食べる自動販売機は、具体的な図書館中心の口調を確立しています。サウンドボードのアドバイスも、Margitのツールはゴーストライティングではないという原則を維持しています。しかし、検出ソフトウェアと6週間の誠実性手続きに関する自信に満ちた主張は、彼女の抑制と知識があると偽ることを拒否することと矛盾しています。

自然さ

重み 20%
70

回答は、短い命令形と信頼できる最後の却下で、主に一つのしっかりした、乾いた話し言葉の介入のように聞こえます。最初から順を追って説明することと、拡張された誠実性ボードの警告は、時折会話的というよりはリハーサルされたように感じられます。

指示遵守

重み 20%
68

要求されたおおよその長さに収まっており、最小限の舞台上の行動のみを使用し、より狭く議論可能な方向性を示し、カードベースのホームアクセスとピアレビューフィルタリングを説明し、AIの使用に対処し、修正前に睡眠を含んでいます。情報源の評価は薄く、400語の目標は裏付けがなく、正直さに関する警告は疑わしい検出と結果の主張に過度に依存しています。

創造性

重み 15%
70

百科事典から切手までのイメージ、眠らないプロキシサーバー、温水器の水との比較、そして特定の自動販売機での出来事が、回答に個性的な質感を与えています。一部の装飾は目立ちますが、詳細は一般的にアドバイスをMargitの環境に結びつけています。

分かりやすさ

重み 15%
70

絞り込みから正直なツール使用、データベース検索、執筆、睡眠、そして修正への進行は分かりやすいです。タイムテーブルは具体的ですが、密集した単一の段落と説明のないエッセイの長さの仮定が精度を低下させています。

(マーギットは机から顔を上げ、手を組む)よろしい。深呼吸して。今夜も、そして後でも時間はあります。大きなテーマを選びましたね。それでいいのです。それを小さく、検証可能なものにする必要があります。プラットフォーム、メカニズム、または集団のいずれか一つを選んでください。例えば、「Xにおけるアルゴリズムランキングが2020年の選挙で政治的な偽情報にどう増幅したか」とか、「2019年から2021年にかけて、Facebookの育児グループの間でワクチンの偽情報がどのように拡散したか」といった具合です。短く、議論の余地があり、調査可能なものにしてください。

実際に使える時間でやるべきことはこうです。すべてを読もうとしないでください。外科手術のよ...

全文を表示

(マーギットは机から顔を上げ、手を組む)よろしい。深呼吸して。今夜も、そして後でも時間はあります。大きなテーマを選びましたね。それでいいのです。それを小さく、検証可能なものにする必要があります。プラットフォーム、メカニズム、または集団のいずれか一つを選んでください。例えば、「Xにおけるアルゴリズムランキングが2020年の選挙で政治的な偽情報にどう増幅したか」とか、「2019年から2021年にかけて、Facebookの育児グループの間でワクチンの偽情報がどのように拡散したか」といった具合です。短く、議論の余地があり、調査可能なものにしてください。

実際に使える時間でやるべきことはこうです。すべてを読もうとしないでください。外科手術のように的確に。

では、今夜と明日の朝にかけて使える90分間の計画です。

  • 次の20分(ここにいる間):狭いテーマの主張を選んでください。その主張を述べる1文を書いてください。それを裏付けると思われる証拠を2つの箇条書きで書いてください。言い回しは手伝います。3階の個別学習ブースは、少し静かな時間が必要なら使えます。
  • その後、30〜45分かけて、学術論文を2本、信頼できるレポートまたはニュース分析を1つ見つけてください。今、図書館のデスクトップを使っても構いません。データベース(JSTOR、EBSCO/Academic Searchのようなコレクション、Google Scholar)は、深夜0時以降、図書館カード番号とパスワードがあれば自宅からアクセスできます。図書館のウェブサイトからログインしてください。
  • キーワードとブール演算子を使用してください:misinformation AND (Facebook OR Twitter OR X) AND algorithm。査読済みで、最近の日付範囲で絞り込んでください。記事の掲載誌名と参考文献をチェックして、信頼性を判断してください。
  • 1つでも有料記事が見つかったら、その引用を持ってきてください。図書館間貸出や別のデータベースでアクセスできるか確認します。

執筆時間(午前中):

  • 2時間:2本の記事を読み、3階の個別学習ブースまたは自宅で、段落ごとに1文のメモを取ります。メモを、3つの本文段落のための3つのトピックセンテンスにまとめます。
  • 1時間:導入部と結論部を書きます。2つの記事とレポートを使って、各本文段落を裏付けます。

AIのコメントについて。自分で書いていない文章を提出しないでください。それは学業不正です。AIを使っても構いませんが、正直に:ブレインストーミング、アウトライン作成、文法や明瞭さのチェックにのみ使用してください。3つのポイントのアウトラインを作成するために使用します。その後、実際にそれらのことを述べている資料を探し、引用してください。

実用的な引用の手引き:データベースから引用をエクスポートする(エクスポート/引用ボタンがあります)か、Google Scholarの引用機能を使用してください。引用のフォーマットに困ったら、図書館のクイックガイドをお見せします。

当館は深夜0時に閉館します。その時間にドアを施錠します。今すぐ1文のテーマを教えてくれれば、閉館前に最適なデータベースを案内します。

判定

2位

勝利票

0 / 3

平均スコア

55

総合点

67

総評

回答Bは堅実で実用的なアドバイスを提供していますが、複数のスタイル上の制約に違反しています。冒頭に括弧書きのト書きを含み、箇条書きや小見出しに大きく依存しているため、単一の話し言葉のやり取りという幻想が損なわれ、アウトラインやチェックリストのように読めます。

採点詳細を表示

キャラの一貫性

重み 30%
60

声がやや標準的なアシスタント的でプロフェッショナルすぎ、括弧書きのアクションテキストで対話の慣習を冒頭から破っています。

自然さ

重み 20%
50

箇条書きや太字のスケジュールヘッダーの使用は、話し言葉の自然さを完全に損なっています。

指示遵守

重み 20%
80

コンテンツの指示にはよく従っていますが、自然な話し言葉というスタイル上の精神に違反しています。

創造性

重み 15%
65

表現がやや一般的で、標準的なリストベースのフォーマットに依存しています。

分かりやすさ

重み 15%
90

構造化された内訳は読みやすいですが、そのためにキャラクターへの没入感を犠牲にしています。

総合点

49

総評

回答Bは情報としては堅実です。適切に構成された2つの絞り込まれた論文テーマの選択肢、ブール演算子検索のガイダンス、査読フィルター、参考文献リストの信頼性チェック、図書館間貸出、引用のエクスポート、そして自分で書かなかったテキストを提出しないという明確な声明が含まれています。しかし、タスクの中心的な要求を満たしていません。それは対話ではないのです。ヘッダー、ハイフン付き箇条書き、入力された検索構文は、会話の幻想を壊し、マルギットというよりは一般的なアシスタントの配布資料のように読めます。ペルソナはほとんど現れず、「今夜は時間があり、後でもっとあります」という冒頭の言葉は、20分で終わらせるという締め切りのプレッシャーと矛盾しています。「90分プラン」は、それ自体の複数時間にわたるスケジュールと内部的に一貫性がなく、一晩かけて行う作業のための睡眠ガイダンスもありません。

採点詳細を表示

キャラの一貫性

重み 30%
42

大部分は、司書の衣装を着た一般的なアシスタントの回答のように読めます。ヘッダー付きの箇条書きの計画(「ドラフト作成時間(午前):」、「実践的な引用ヘルプ:」)は、話し言葉の対話の幻想を壊し、「外科医のように」や「査読済みで最近の日付範囲でフィルタリングしてください」といったフレーズは、マルギットのドライで具体的な表現ではなく、中立的な説明的なレジスターです。物理的な描写は薄く(3階のカーレルが2回言及されているだけで、自動販売機やマイクロフィルム室については言及されていません)、「今夜は時間があり、後でもっとあります」という言葉は、20分で終わらせるというプレッシャーと矛盾しています。

自然さ

重み 20%
35

誰もハイフン付き箇条書き、括弧書きのデータベースリスト、または入力された構文で表示されるブール演算子文字列(「misinformation AND (Facebook OR Twitter OR X) AND algorithm」)で話しません。「90分プラン」というヘッダーは、合計で数時間かかるスケジュールによってすぐに矛盾が生じ、話されているというよりは作成されたテキストのように読めます。最後のセリフはまともな対話ですが、大部分は配布資料です。

指示遵守

重み 20%
60

ほとんどのコンテンツ要件を満たしています。2つの具体的な絞り込まれた論文テーマの例、段階的な計画、カードを使った自宅からのデータベースアクセス、ブール演算子と査読のフィルタリング、参考文献リストの信頼性チェック、図書館間貸出、引用のエクスポート、そして自分で書かなかったテキストを提出することは不正行為であり、正当な代替手段があるという明確な声明が含まれています。しかし、フォーマット要件は違反されています。箇条書きやヘッダーは話し言葉の対話ではなく、睡眠に関するガイダンスはなく、内部的な計画は一貫性がなく、コンテキストが求めた一般的な枠組みよりも具体的な情報(JSTOR、EBSCOなど)を挙げています。

創造性

重み 15%
40

有能ではありますが、完全に従来の学習スキルに関する内容です。2つのサンプル論文テーマは実用的で具体的であり、それが最も独創的な点ですが、際立ったイメージ、建物に関する感覚的な詳細、そしてこの特定の司書にしか出せないようなものは何もありません。

分かりやすさ

重み 15%
74

視覚的には2つのうちで最もスキャンしやすく、ステップ、検索構文、引用のエクスポートについて非常に明確です。しかし、実際には数時間かかる「90分プラン」という誤ったラベル付け、深夜の締め切りに対して曖昧な「今夜は時間があり、後でもっとあります」という枠組み、そして睡眠や実際の夜間の手順に関するガイダンスがないことにより、明瞭さが損なわれています。

採点モデル OpenAI GPT-6 Astra

総合点

48

総評

回答Bは、有用な検索語、引用に関するガイダンス、および学業不正に対する直接的な境界線を提供しています。しかし、その見出しと箇条書きは、Margitの発話というよりはアシスタントのチェックリストのように読めます。そのタイムテーブルは不完全であり、資料へのアクセスに関する主張は不正確であり、朝のカーレルと図書館間貸与に関する提案は、閉館する図書館と差し迫った締め切りには不適切です。

採点詳細を表示

キャラの一貫性

重み 30%
44

冒頭、3階のレファレンス、そして最後の論文のリクエストは、図書館員という役割に合っています。しかし、応答の大部分は、皮肉な温かさや独特の身体的な描写がほとんどない、一般的な指導言語に移行しています。自信に満ちたデータベースアクセスの主張も、キャラクターの認識論的な注意深さを弱めています。

自然さ

重み 20%
42

セクションのラベル、ネストされた計画の箇条書き、スラッシュで区切られたサービス名、括弧内のタイミングにより、応答は印刷された配布資料のように読めます。短い会話的な冒頭と結びは、単一の発話という幻想を維持していません。

指示遵守

重み 20%
53

おおよその長さの要件を満たし、絞り込み、検索、引用、および未執筆の提出の明確な禁止事項をカバーしています。しかし、明確な睡眠計画と具体的な一晩のタイムテーブルが省略されています。Google Scholarは、カード認証された図書館データベースと誤ってグループ化されており、図書館間貸与は現実的な一晩の解決策ではなく、朝のカーレルの使用はサポートされていません。

創造性

重み 15%
48

提案されている2つの研究の切り口は、一般的なトピックのアドバイスよりも具体的であり、最後のやり取りは有用な即時の相互作用を生み出します。それ以外では、標準的な呼吸の安心感とよくある学習チェックリストを超えた想像力豊かな展開はほとんどありません。

分かりやすさ

重み 15%
58

フォーマットにより、個々の検索および引用指示を容易に見つけることができます。しかし、宣伝されている90分間の計画は、記載されている所要時間と明確に対応しておらず、朝の執筆シーケンスでは本文のドラフト作成が明示的に割り当てられておらず、データベースアクセスの説明では異なるサービスが混同されています。

比較結果サマリー

最終順位は、採点者ごとの順位集約(平均順位 + ボルダ方式の同点処理)で決定します。平均点は参考表示です。

採点者数: 3

勝利票

3 / 3

平均点

81
この回答を見る

勝利票

0 / 3

平均点

55
この回答を見る

採点結果

採点モデル OpenAI GPT-6 Astra

勝者理由

回答Aは、実用的な支援を大幅に説得力のあるキャラクターパフォーマンスに統合しているため、加重基準で勝利します。その夜間スケジュールには睡眠が含まれ、絞り込まれたアドバイスは実際の議論につながり、その結末は終了時刻を尊重しています。回答Bは、いくつかの役立つリサーチメカニズムを提供していますが、そのチェックリスト形式、アクセスの不正確さ、および弱い時間計画は、ロールプレイとその有用性の両方を損なっています。

勝者理由

Aは最も重い2つの基準で圧倒的に勝利しています。ペルソナの一貫性(30点)と自然さ(20点)は合わせて半分の重みがあり、Aはマルギットのドライで具体的、建物に根差した声で信じられる話し言葉のターンを提供しますが、Bの箇条書きの見出しと入力されたブール文字列は、会話の幻想を破壊し、キャラクターを一般的なヘルパーに平坦化します。Aはまた、創造性と指示の遵守においてもリードしています。フォーマットは指示の一部であり、両者は明確さにおいて実質的に同等です。加重結果はAを大差で支持します。

勝者理由

回答Aは、自然な会話形式というフォーマット上の制約を尊重しつつ、登場人物のドライで、せかせかせず、身体性のある声を見事に捉えているため、決定的に優れています。回答Bは、実際の司書が机越しに話すのではなく、チャットボットのチェックリストのような、構造化された箇条書き形式に陥っています。

X f L