DeepSeek V4 Visionは3D水族館を自律制作できるか
DeepSeek V4 VisionにThree.js水族館の計画、実装、画面確認、修正を任せ、131ターンの実行と独立QA、人間試遊で完成度を検証しました。
- Tested question
- Visionを持つAIエージェントが、固定された初期workspaceから操作可能なThree.js水族館を計画、実装、画面確認、修正し、独立QAを通せるか。
- Exact tools
- custom Hermes coding/browser/Vision loop
- Three.js 0.179.1
- Vite 7.1.3
- 独立production build
- Chrome browser QA
- 通常入力による人間試遊
- Exact models
- deepseek-v4-flash-vision-exp
- Validation method
- 自律実行中のmodel turn、source write/edit、browser captureを記録し、停止後はソースを変更せず、production build、browser QA、通常のマウスによる122.308333秒の軽い人間試遊を実施しました。
- Result
- 131 model turns、76 source writes/edits、29 browser capturesで水族館を完成させ、production buildと独立browser QAは通過しました。人間試遊では重大な操作不能はありませんでしたが、岩のはみ出し、単純な魚形状と向き、逆向きに見えるfeeding movementが残りました。
- Limitations
- 1回の自律制作実行であり、モデルの平均性能を示す反復試験ではありません。
- Hermes runtime versionはpublic-safe canonical sourceで確認できないため記載していません。
- production buildとbrowser smokeが通っても視覚品質や自然な動作を保証しません。
- 131ターンの実行は連続したpublic-safe動画ではなく、保存logとscreenshotによる再構成です。
- 公開noteには一部の語を囲むbacktickが文字として残る軽微な書式問題があります。
Evidence (3)
Artifacts (1)
画面を29回見たあとにも残ったもの
モデルは最初の画面確認後にも67回のsource writeまたはeditを行い、単にコードを生成して終わるのではなく、表示を見ながら修正を続けました。最終成果物はbuildでき、Chrome上で動作しました。
それでも、人間が見ると岩が水槽外へ出ることがあり、魚の形状や向きは単純でした。feedingの動きも一部が後退しているように見えます。自律制作の完了、機械的な起動確認、視覚的な完成度を別々に評価する必要がある結果です。