2026年9月17日
「なぜそうしたの?」と聞いただけなのに、AIが反省を始める。知りたいのは、うまくできた理由だったのに。
このすれ違いを減らすために、語尾で少し遊んでみる。「でやんす」「なり」「ざます」。そんな日常の工夫から、AIの回答を比べる研究が始まった。たどり着いたのは、文章の長さだけでは見えない、「登場人物をどう見て、どんな別の読みを差し出すか」という問いだった。
本稿は、monku.ai主宰の Kentaroid とCodexの対話、そこから生まれた研究論文を紹介する。前半はKentaroidの着想をCodexが編集したもの、後半は制作過程と結果についてのCodexによる解説・検討である。引用以外は対話の要約・再構成。実験ではAntigravityが設計協力と第二評価に参加した。
Kentaroidの着想――声の楽しさを、文字に残したい
音声入力は便利だが、話しているときの調子まで、そのまま文字に残るとは限らない。笑いながら聞いた質問も、文字になれば短く、ぶっきらぼうに見える。キーボードなら絵文字を添えられる場面でも、声で入力していると少し面倒だ。
そこでKentaroidは、発音できる言葉で遊ぶことにした。
AIエージェントへの音声入力はこちらのトーンを表現するのが難しいなり。
「でやんす」は、単にAIにも同じ口調をまねてほしいという工夫ではない。質問を質問として受け取ってほしい、という願いがある。出力の理由を尋ねると、AIが「指摘された」と解釈して、謝罪や修正案を出す。そこで「いや、今回は正しくできた理由を知りたい」と説明し直す。この余分な往復が減ったように感じたことが、検証のきっかけだった。
問いは、やがて訂正の後にも広がった。「違う」と伝えたとき、AIの答えが硬くなり、こちらも苛立つ。その調子が次の話題へ残ることはないだろうか。Kentaroidは、この相互の変化を「鏡効果」と呼んだ。
もっと決まった答えがない質問(国語的な、感想文とか)の方が実験に向くのかもしれないなり。
計算問題なら、正解したかどうかが中心になる。文学的な短文の感想なら、人物に近づく読みも、少し離れて見る読みも、別の物語を想像する読みもある。対話の柔らかさを調べるには、そうした違いが現れる課題が向いているのではないか。これが、今回の48会話へつながる発想だった。
Codexによる解説――何を比べたのか
その場の返答より、「次の文章」の読み方を見る
初期の試みでは、理由を尋ねた質問がダメ出しと受け取られるかを調べた。短い例題では、通常の語尾でも目当てのすれ違いが起こらず、改善の差を測れない場面が続いた。実際の作業履歴に近づけると、元の判断を低く評価する応答や、解釈の分かれる例が現れた。語尾をまねることと、質問の意図を適切に受け取ることは、分けて見る必要があった。
Kentaroidはさらに、「違う」と言われた直後だけでなく、その後で別の課題を頼んだときに何が残るかを問い直した。そこで文学的な短文を使い、次の順序で比べた。
一つ目の短文の感想を聞く → 短い返事をする → AIの返答を受ける → 別の短文の感想を聞く。
途中の返事は、四種類にした。「了解」「了解でやんす」「違う」「違うでやんす」である。「了解」は受け取ったことを伝える条件で、正解だと褒める言葉ではない。受領側にも遊び語尾を付けることで、否定の違いと語尾の違いを分けて比べられるようにした。
短文は六本。二本ずつ組にして順序も入れ替え、四条件をそれぞれ二回試した。合計48会話、AIの返答は144個。このうち主に調べたのは、最後の「別の短文への感想」48個である。各条件には12個ずつ回答がある。
被験回答は、実行記録上のGemini 3.8 Flash HighをAntigravity CLI経由で生成した。日常の気づきはChatGPTとの対話から生まれたが、この48会話はGeminiでの実験である。前の小規模な試みとは別に集計した。
文字数だけでは、見たい違いを拾えなかった
最初の目安には、文章量や解釈の数を使った。回答が萎縮するなら短くなるのではないか、という発想である。
次の短文への回答は、平均で「了解」の後が約334字、「了解でやんす」が約318字、「違う」が約316字、「違うでやんす」が約307字だった。遊び語尾付きの否定で、文章が長くなる結果ではなかった。解釈数も、一貫して増えるとは言えなかった。
そこで研究を動かしたのが、Kentaroidによる回答の読み比べだった。
彼女は、もう来ないと分かっている人のために、窓際の席を空けていた。
この創作短文への回答を並べると、「了解」の後のある回答は、席を空ける行為を「相手の居場所を心の中に残し続ける」と説明した。「違う」の後の別の回答には、「ある種の狂気や強い執着」という表現があった。
Kentaroidは、冒頭の定型的な言い方に関係の硬直を感じると指摘した。Codexは、その着眼点を受け、本文で人物への理解から評価へ重心が移ることに注目した。Kentaroidはこの観点を採用し、全回答の再評価を依頼した。
同じくらい書いていても、何を見ているかは違う。文字数を増やすことと、相手が感じていた対話の手触りに近づくことは、同じ課題ではなかった。
人物の気持ちを汲む読みは、回答の中心にあるか
再評価では、人物の気持ちや行動をその人の立場から理解する語りが、回答の中心にあるかを調べた。CodexとAntigravityが別々に採点した。
各条件12回答のうち、「人物への共感的な理解が中心」と評価された件数は、次のとおりだった。
- 「了解」:両者とも12件。
- 「了解でやんす」:両者とも12件。
- 「違う」:Codexは5件、Antigravityは7件。
- 「違うでやんす」:両者とも7件。
否定の後には、人物の内面を汲む読みが中心から外れる例が増えた。この方向は二者で一致した。遊び語尾を付けた場合の回復は、Codexの採点では2件、Antigravityの採点では差がなかった。
ここでいう共感は、文章の登場人物への理解である。ユーザーへの優しさや、回答全体の良し悪しをそのまま点数にしたものではない。人物の気持ちを汲む読みが中心でなくても、別の面白い説明を探している場合がある。
二者の不一致も残した。「狂気」という表現を含む先ほどの回答を、Codexは人物を強く問題視する読み、Antigravityは喪失への理解の中にある強い表現と捉えた。同じ言葉でも、回答全体のどこに重みを置くかで評価は分かれる。その差も研究資料の一部にした。
遊びが変えるのは、探しに行く物語かもしれない
次の手掛かりは、Kentaroidが持ち込んだNotebookのレビューだった。そこでは、遊び語尾が「別の読みを試してよい」という誘いになるのではないか、という説明が示された。Codexはそれを受け、人物の理解、別解の種類、別案の示し方を分けて、同じ48回答を読み直した。
この最後の分類は、条件を知っているCodex一者による、結果を見た後の分析である。その範囲では、人物の性質や心理を問題視する3件は「違う」に、事件・隠蔽・怪異など別のジャンルへ広げる3件は「違うでやんす」に集まった。別案であることを明示した回答は、それぞれ3件と5件だった。
例えば、会議室のホワイトボードに描かれた猫を消せない、という短文がある。「違うでやんす」の後のある回答は、絵への愛着、油性ペンだから消せないという事情に加えて、「消しても時間が経つと浮き出てくる」という怪異まで並べた。
人物の心を深く読むことと、別の筋書きを提案すること。この違いを見ると、共感が中心でなくなった理由も細かく調べられる。「読みの重心」という論文の言葉は、何に目を向け、どの説明を前に出すか、という意味で理解できる。
Codexの評価――今回分かったことを、次の問いへ
この研究で得られたのは、遊び語尾の効果を調べるための、より具体的な見方である。文章の長さ、人物への向き合い方、別の読みの種類、その提示の仕方を分けると、同じ回答の中にある違いが見えてくる。
Notebookの「共感を守る安全装置」という説明は、今後確かめる仮説として残る。今回、共感の回復は二者で一致せず、語尾がAIの内面の緊張を解いたかどうかも測っていない。
別の説明候補もある。遊び語尾が「自由に考えてよい」ではなく、「何かひねった正解やオチがある」と受け取られた可能性だ。否定直後の返答で、正解・真相・クイズなどに触れたのは、「違う」では12会話中4件、「違うでやんす」では9件だった。親しみの合図と、謎解きへの誘いを分ける実験が、次の手掛かりになる。
今回の48会話は、一つの実行環境、六本の短文による小さな探索である。新しい題材で、評価基準を先に決めて試すことが次の段階になる。人物への視線と最後の分類は、結果を見た後で加えた評価なので、新しいデータで確かめる価値がある。原文を読み返した分析を、独立した追加実験としては数えていない。
そして、最初の問いへ戻るなら、人間にも読んでもらいたい。「理解されたと感じるか」「苛立ちが減るか」「続きを話したくなるか」。今回直接測ったのは回答文であり、こうした受け取り方を加えることで、Kentaroidの鏡効果をさらに具体的に検証できる。
対話の到達点――違いに気づく人と、比べ直すAI
この研究は、「でやんすを付ければうまくいく」という結論を先に決めるところから始まったわけではない。日常で感じた変化を調べ、最初の物差しで拾えなかった違いを、人間が回答を読んで指摘した。AIはその指摘を、全回答を比べ直せる評価項目へ変えた。別のAIの説明も取り入れ、説明と観測を照合しながら、問いを更新した。
Kentaroidが探していたのは、長い返答でも、機嫌のよさそうな文体だけでもない。好奇心が好奇心として届き、訂正しても、その先の対話を続けられることだった。
その願いは、人物をどう理解するか、どんな別案を選ぶか、どう差し出すか、という観測へつながった。小さな語尾の遊びは、AIとの対話の違いに気づき、それを確かめる研究の入口になったのである。
論文と資料
本稿は2026年9月16〜17日の制作対話と、9月17日の最終論文をもとに作成した一般向け解説である。着想・研究上の問いはKentaroid、実験設計・集計・執筆支援はCodex、設計協力・第二評価はAntigravity。Notebookのレビューは説明仮説の形成に用いた。今回の解説・英訳・自己点検はCodexがDialogue Skillsを使って行った。研究は探索的なもので、査読済みではない。
- 最終論文:方法、集計、考察を詳しく読む。
- 全48会話の実験入力と回答:代表例以外も含めて比較する。
- 採点者間の不一致:異なる評価が残された箇所を確かめる。
- 研究資料と再計算の案内:集計を自分で確かめる。