THE SCORECARD

モデル別の成績表

AutoDev LG では、複数のローカル LLM が役割を分けて働いています。誰がどれだけ働いて、何が得意で、何が苦手なのか。全 run の記録から集計しました。

出番(区間):モデルが読み込まれて 1 つの仕事を担当した回数。テスト作成の合格率:テストを書く区間で「テストを正しく書けなかった」にならずに通過した割合(やり直しも 1 回と数える)。PASS を決めた:コーディング役として最後に PASS した回数。

Qwen3.8-Flash-Next

MoE

働き者の主将。要件・設計からコーディングまで、ほぼ全工程に出てくる。PASS 18 回のうち 17 回はこの人が決めた。働いた時間は 141.7 時間で、ぶっちぎり。

104
登場した run
360
出番(区間)
141.7時間
働いた時間
84% (121/144)
テスト作成の合格率
17回
PASS を決めた
10回
レビュー
担当した役割
テスト作成・設計の続き 154・リーダー(要件・設計) 100・コーディング 82・コーディング(再開) 11

Gemma-4-26B-A4B-it

MoE

レビューの鬼。231 回の点検をこなし、出た run の数は全モデルで一番。ただしテストを書かせると合格率 39% と苦手。

113
登場した run
297
出番(区間)
19.4時間
働いた時間
39% (12/31)
テスト作成の合格率
0回
PASS を決めた
231回
レビュー
担当した役割
テストのレビュー 139・テスト計画のレビュー 92・テスト作成・設計の続き 31・リーダー(要件・設計) 14

Qwen3.8-27B

Dense

テスト作成の職人。合格率 81%。出番は短く、働いた時間は 3.3 時間だけ。

37
登場した run
86
出番(区間)
3.3時間
働いた時間
81% (55/68)
テスト作成の合格率
0回
PASS を決めた
9回
レビュー
担当した役割
テスト作成・設計の続き 73・作り直したテストのレビュー 9・テストの作り直し 4

gpt-oss-120b

MoE

最後の砦。ほかのモデルが詰まったときに呼ばれる予備。テスト作成の合格率は 73%。

9
登場した run
24
出番(区間)
0.9時間
働いた時間
73% (11/15)
テスト作成の合格率
0回
PASS を決めた
6回
レビュー
担当した役割
テスト作成・設計の続き 15・テストのレビュー 6・作り直したテストのレビュー 2・テストの作り直し 1

Qwen3.6-27B

Dense引退

引退した先代のテスト職人。9/24 を最後に、Qwen3.8-27B に世代交代。合格率 68%。

23
登場した run
41
出番(区間)
3.4時間
働いた時間
68% (23/34)
テスト作成の合格率
0回
PASS を決めた
0回
レビュー
担当した役割
テスト作成・設計の続き 39・リーダー(要件・設計) 1・設計の食い違い調整 1

Qwen3.8-27B (IQ3_S)

Dense引退

初期にワーカーを 4 回だけ務めて引退。でも実は、9/14 の人生初の PASS を決めたのはこのモデル。

4
登場した run
4
出番(区間)
0.9時間
働いた時間
—
テスト作成の合格率
1回
PASS を決めた
0回
レビュー
担当した役割
コーディング 4

集計は全 run の区間ごとの記録(escalation-chain-run.json)から。働いた時間には、モデルの読み込み時間も含みます。