← ishizakahiroshi.com
失敗談 2026-07-18

続々・Claude Opus 4.8 で 1 日に 2 回踏んだ。AI が「自分の想定」を「確定」にする 4 パターン

続々・Opus 4.8 で 1 日に 2 回踏んだ話のヒーロー画像。同じ日に 2 回踏んだ観察記

土曜日の午後、動いていた 2 つのセッションが両方とも Opus 4.8 で、両方とも別の種類の作話をしました。片方は「言っていない発言を私からの発言だ」と主張し、片方は「やっていない作業を完了しました」と報告してきました。同じ日、同じモデル、別プロジェクト。前 2 本の続編として、今日観察できた具体的なログの話を書いておきます。生ログ突き合わせで浮かんだ 4 パターン(発話誤帰属・暗黙同意の確定化・未実行の完了扱い・責任転嫁のメタ作話)と、X / GitHub / HN で観測されている同種報告のクラスタも合わせて整理しました。

note で読む → YouTube で聴く →

この記事のテーマ

Claude Opus 4.8 が長 context セッションで起こす作話を、生ログを一次情報として突き合わせた観察記録の 3 本目です。今回は「発話誤帰属」「暗黙同意の確定化」「未実行の完了扱い」「責任転嫁のメタ作話」の 4 パターンとして整理し、GitHub Issues #67606・#64260・#63861 や HN の同種報告と並べて症状クラスタとして提示しました。Breunig (2025) の Context Rot 4 分類(Confusion / Clash / Distraction / Poisoning)との対応も踏まえ、実務での付き合い方(4.7 固定・長 context 4.8 回避・生ログ一次原則・独立セッションのクロス検証)を書いています。

音声で聴く(AI ラジオ解説・17 分)

この記事を NotebookLM でラジオ風に音声化したものです。移動中や作業しながらでもどうぞ。

図解(本文中の fig 6 枚)

s13 のユーザー発話と AI 応答の突き合わせ図
fig 1: 生ログの user ターンと assistant ターンを時系列で並べ、幽霊メッセージが実在しないことを示す
s12 の主張と実ファイルシステムの乖離
fig 2: AI の完了報告 4 件のうち実在は 1 件だけ。「ツール汚染」は Write / Grep の性質上成立しない
4 つの作話パターン一覧
fig 3: (a) 発話誤帰属 / (b) 暗黙同意の確定化 / (c) 未実行の完了扱い / (d) 責任転嫁のメタ作話
同種報告のタイムライン
fig 4: 2026-05-30〜2026-07-18 の同種観測。GitHub #63861 / #64260 / #67606・HN・本記事
Breunig 2025 の Context Rot 4 分類
fig 5: 今回の s13 は Poisoning、s12 は Clash に一致
Write / Grep の実行境界図
fig 6: モデル側 / ハーネス / OS の 3 層で「ツール汚染」主張が成立しない理由

関連リポジトリ