REPLAY · loop71

38 分の舞台裏
最速 PASS を分解する

taskboard を約 38 分で作りきった、今のところ最速の 1 回(loop71・v146)。仕様書を受け取ってから PASS するまでに、ローカル LLM たちが何をしていたのかを、実行記録からそのまま再現します。

37.7 分
開始から PASS まで
52 回
LLM への呼び出し
108 万
読んだトークン(入力)
約 $3.2
Claude Opus 5.5 なら(約 480 円)

時間の使い方

1
3
6

横幅が時間の長さ。色はモデル(青=Qwen3.8-Flash-Next、緑=Gemma-4-26B-A4B-it、黄=Qwen3.8-27B)。

何が起きていたか

「+○分」は開始からの経過時間。右の秒数は、その LLM の返事を待った時間です。

+0.0 分
1. 設計Qwen3.8-Flash-Next19.1 分
  • 仕様書から要件を整理113 秒
  • 設計(1 回目)212 秒
  • 設計が仕様を満たすか点検 → 穴が見つかる159 秒
  • 見つかった穴をピンポイントで再点検67 秒
  • 設計の部分修正を試す15 秒
  • 設計をやり直し(2 回目)188 秒
  • やり直した設計を点検 → 合格159 秒
  • テスト計画を作成170 秒
+19.1 分
2. テスト計画の点検Gemma-4-26B-A4B-it0.7 分
  • テスト計画が仕様どおりか点検6 秒
+19.8 分
3. テスト作成Qwen3.8-27B2.3 分
  • 合否判定用テスト(Acceptance)を書く87 秒
  • テストを 1 回だけ修理39 秒
+22.1 分
4. テストの点検Gemma-4-26B-A4B-it0.8 分
  • テストの意味を点検12 秒
+22.9 分
5. 結果の確認Qwen3.8-27B0.2 分
  • テストの点検結果を受けて最終確認 → 問題なし
+23.1 分
6. コーディングQwen3.8-Flash-Next14.6 分
  • OpenHands:自分用のテスト(Public)を書く(10 回の呼び出し、キャッシュ当たり 93%)209 秒
  • OpenHands:部品 1:task_model.py(8 回の呼び出し、キャッシュ当たり 85%)97 秒
  • OpenHands:部品 2:task_store.py(6 回の呼び出し、キャッシュ当たり 87%)89 秒
  • OpenHands:部品 3:task_service.py(7 回の呼び出し、キャッシュ当たり 89%)70 秒
  • OpenHands:部品 4:app.py(画面)(8 回の呼び出し、キャッシュ当たり 90%)92 秒
  • 完成品が仕様どおりか最終チェック246 秒
  • 38 件のテストを実行して 🎉 PASS

見どころ

数字はすべて loop71 の実行記録(escalation-chain-run.json・llm_calls.jsonl・token-summary.json)から。Claude API 換算は Opus 5.5 の定価・キャッシュ実測値込み・1 ドル 150 円。