English

AutoDev LG 開発ログ

ローカル LLM だけでアプリを自動開発するフレームワークの、日々の開発状況

最終更新: 2026-09-29 03:11 JST · AutoDev LG ができるまで → · 仕組み → · 作ったアプリ →

現在の目標

INVADERS で 3 回連続 PASS0 / 3
直近の runPASS loop68 — taskboard / LG1.10.142 / 54分
v142
最新版
135
リリース数
104
E2E run
17
PASS
1,261
テスト件数

E2E run の推移

taskboard — 17/89 PASS
INVADERS (インベーダー) — 0/15 PASS
古い順 →PASSNOT PASS実行中

テスト件数の推移

v70: 740 件 → v142: 1,261 件

日々の記録

09/29(火)

修正 1 回成功 1 回エラー 0 回
INVADERS 0 / 3

PASS 出ました! AI がちゃんとアプリを作りきった。思わずニヤける。

速度チューニングの日。Flash-Next に MTP を載せると、4 万トークンの長い文脈でも生成速度が 20.3 → 31.7 tok/s(+56%) に上がりました。

  • この最速構成を v142 として採用し、taskboard の loop68 を実行中。
  • 結果が良ければ、この構成のまま INVADERS の修正に戻ります。

09/28(月)

修正 4 回成功 1 回エラー 1 回中断 2 回
INVADERS 0 / 3

報われた……! この一回のために回してる。今日のコーヒーは格別。

WSL が消えるトラブルから立て直した一日。Windows ネイティブ版(v134/135)も作りましたが、長いコンテキストで llama-server が遅く、WSL に戻しました。

  • 再構築した WSL で taskboard の loop67 が PASS(1 時間 19 分)。環境の作り直しは成功。
  • INVADERS の inv18 は NOT PASS。テストコード生成で 3 モデルとも test_invalid になり、コーディングまで進めず。いまの弱点は Test 段階。
  • v141 で MTP(投機的デコード)を試験導入し、速度計測へ。

09/27(日)

修正 10 回成功 0 回エラー 9 回
INVADERS 0 / 3

09/26(土)

修正 10 回成功 5 回エラー 9 回
taskboard 3 / 3 達成!

taskboard で 3 回連続 PASS 達成!! 目標クリア、思わず声が出た。

09/25(金)

修正 13 回成功 4 回エラー 8 回
taskboard 0 / 3

今日は 4 回も PASS! 笑いが止まらない。

09/24(木)

修正 9 回成功 2 回エラー 9 回
taskboard 0 / 3

PASS が 2 回も! 昨日までの苦労はこの日のためにあった。

09/23(水)

修正 6 回成功 1 回エラー 7 回
taskboard 0 / 3

報われた……! この一回のために回してる。今日のコーヒーは格別。

09/22(火)

修正 7 回成功 0 回エラー 7 回
taskboard 0 / 3

開発の合間に、なぜか Mac mini をお買い上げ。「将来は iPhone アプリも作るから必要」と自分に言い聞かせて。……今のところ出番なし(笑)。

09/21(月)

修正 7 回成功 2 回エラー 7 回
taskboard 1 / 3

PASS が 2 回も! 昨日までの苦労はこの日のためにあった。

09/20(日)

修正 3 回成功 0 回エラー 10 回
taskboard 0 / 3

09/19(土)

修正 8 回成功 0 回エラー 11 回
taskboard 0 / 3

09/18(金)

修正 1 回成功 0 回エラー 1 回
taskboard 0 / 3

09/17(木)

修正 6 回成功 0 回エラー 6 回
taskboard 0 / 3

09/16(水)

修正 2 回成功 0 回エラー 1 回
taskboard 0 / 3

09/14(月)

修正 2 回成功 1 回エラー 1 回
taskboard 1 / 3

人生初の PASS!! AI が本当にアプリを最後まで作りきった……! 何度もログを見返してしまう。

はじまりの記録

2026-07-30(木)

すべての始まり。「ローカル LLM でバイブコーディングしてみたい!」——ただし、自分でコードを書く能力も時間もない。そこで閃いた作戦がこちら。

  • 安いと評判の DeepSeek に 2 ドルだけ課金し、「ローカル LLM にコマンドラインで簡単な処理をさせるプログラム」を作るアプリを作らせる。AI に、AI を働かせるアプリを作らせる。(ややこしい)
  • 相棒の GPU はまだ RTX 5070(12GB)1 枚。いまの 5 枚体制から見ると、ずいぶん身軽な旅立ちでした。
  • 結果、1 日で API リクエスト 1,831 回、トークン 376,365,019(約 3.8 億)。お昼前には 1 時間に 400 回ペースで DeepSeek を呼び出す猛ラッシュ。それでもお会計は 1.66 ドル。安い。怖いくらい安い。
  • ところが、いったん動いても、機能を足すたびに DeepSeek が既存の機能をきれいさっぱり消してくる(いわゆるデグレ)。直す→消える→直す→消える、の無限ループ。
  • 1 日で飽きました。 ……が、このとき味わった「機能を足すと前の機能が壊れる」問題こそ、のちの AutoDev LG が テストで守りながら作る仕組みにこだわる原点になったのでした。
DeepSeek の 7/30 の利用状況。1,831 リクエスト、376,365,019 トークン、1.66 ドル
DeepSeek の 7/30 の利用状況。1,831 リクエスト、376,365,019 トークン、1.66 ドル

2026-08-27(木)

GPU アップグレード。 表向きの理由は「ゲームを快適にしたい」。RTX 5070 から RTX 5070 Ti へ買い替え。フリマサイトで 169,800 円!(このあたりから、どうかしていると我ながら感じ始める)

  • しかも同日、「もっと大きい LLM をローカルで動かしてみたい」という欲に抗えず、RTX 5060 Ti 16GB もお買い上げ。
  • 1 日で GPU が 2 枚になりました。ここから先、GPU は雨後の筍のように増えていきます。

2026-09-03(木)

GPU 追加。 RTX 5060 Ti 16GB を さらに 2 枚。(どうかしてる)

  • これで GPU は 4 枚。VRAM が増えるほど、試したいモデルも大きくなっていく。完全に沼の入口です。

2026-09-04(金)

GPU 追加(翌日)。 前日の 2 枚では飽き足らず、RTX 5060 Ti 16GB を さらに 1 枚。(いかれてる)

  • 5070 Ti 1 枚 + 5060 Ti 4 枚、合計 5 枚。ただし、この時点ではまだ 5 枚を挿せる PC がありません。順番がおかしい。

2026-09-06(日)

転機。 「GPU をいくら増やしても、作らせる相手が DeepSeek じゃなぁ……」と悩んでいたところ、メールか何かで ChatGPT Plus が 1 か月無料で使えると知り、即契約。

  • 7/30 のデグレ地獄の雪辱を果たすべく、今度はもっと賢い相棒と組むことに。
  • ChatGPT とあれこれ相談するうちに、いまの AutoDev LG の構想がぼんやりと固まってくる。 賢い AI には「作る仕組み」を作ってもらい、実際にアプリを作るのは手元のローカル LLM たち——そんな役割分担のイメージが見えてきた日。

2026-09-08(火)

PC ケース交換、そして 80GB 要塞の完成。 GPU 5 枚を収めるため、ケースを大型の LIAN LI O11D EVO XL に交換。届いた箱を見て、でかすぎてびっくり。

  • マザーボードは、サーバー用には手が出ないし、ゲームにも使う PC なので、以前からの ASRock B760 Pro RS/D4 WiFi を続投。
  • 当然 PCIe スロットは足りません。そこで各種ライザーケーブルを駆使し、帯域が狭くなるのは承知の上で GPU 5 枚をぶっこむ。VRAM 80GB 環境、完成。
  • ここから ChatGPT に AutoDev LG を作らせ、ローカル LLM でテストする日々がスタート。
  • ……が、ChatGPT はすぐに利用上限に到達。同日、Claude Pro も契約。プログラムを実行して、失敗して、直して、また実行する——長い日々の幕開けです。