AutoDev LG では、複数のローカル LLM が役割を分けて働いています。誰がどれだけ働いて、何が得意で、何が苦手なのか。全 run の記録から集計しました。
出番(区間):モデルが読み込まれて 1 つの仕事を担当した回数。テスト作成の合格率:テストを書く区間で「テストを正しく書けなかった」にならずに通過した割合(やり直しも 1 回と数える)。PASS を決めた:コーディング役として最後に PASS した回数。
働き者の主将。要件・設計からコーディングまで、ほぼ全工程に出てくる。PASS 18 回のうち 17 回はこの人が決めた。働いた時間は 141.7 時間で、ぶっちぎり。
レビューの鬼。231 回の点検をこなし、出た run の数は全モデルで一番。ただしテストを書かせると合格率 39% と苦手。
テスト作成の職人。合格率 81%。出番は短く、働いた時間は 3.3 時間だけ。
最後の砦。ほかのモデルが詰まったときに呼ばれる予備。テスト作成の合格率は 73%。
引退した先代のテスト職人。9/24 を最後に、Qwen3.8-27B に世代交代。合格率 68%。
初期にワーカーを 4 回だけ務めて引退。でも実は、9/14 の人生初の PASS を決めたのはこのモデル。
集計は全 run の区間ごとの記録(escalation-chain-run.json)から。働いた時間には、モデルの読み込み時間も含みます。