Claude Code の Opus 4.8 (1M context) が visible な text も tool_use も返さずに end_turn する response を 45 分で 10 個吐いて $4.9 溶かした。生 jsonl を message.id で group して正常/異常の line 分布差を割り出し、既存 GitHub Issue #68515 に投稿するまで。1 回誤診断して自分で自分に差し戻された過程を含みます。
AI に一次分析を任せる時代の「投稿・公開の直前だけ 1 回疑う」習慣について。Claude Code v2 の jsonl は 1 assistant response を content block ごとに複数 line として書き出すため、正常 response は同じ message.id で 3 line、異常 response は 1 line のみで stop=end_turn になります。10 個の異常 response と合計 ~64,000 output tokens の実測値付きで GitHub Issue #68515 (Opus 4.8 frequently enters long "thinking" without taking action) に comment 投稿しました。
meta の話として、AI にログを分析させたら最初は「thinking で 17k tokens 焼いた」と自信満々に間違い、別セッションから 2 回「本当に投稿すべき?」と自分で自分に差し戻して streaming の途中書きではないことを検証してから真因に到達しました。AI が便利になるほど、AI が出す一次分析を疑う工程の重要性が上がる、という手応えの記録です。