Experiment公開済みFeatured

同じDeepSeek Visionを公式Harnessで動かすと良くなるか

同じVisionモデルをDeepSeek公式Harness 0.1.1-rc.2で動かし、42分の自律制作、24枚の画面確認、独立QAと208.7秒の人間試遊で先行実行と比較しました。

Tested question
同じDeepSeek Visionモデルを公式DeepSeek Harnessで動かすと、先行のHermes coding/browser/Vision loopより強い3D水族館を完成できるか。
Exact tools
  • DeepSeek Harness 0.1.1-rc.2
  • Standard/headless profile
  • deepseek-official provider
  • workspace-write permission mode
  • Three.js 0.179.1
  • Vite 7.1.3
  • stock read_image
  • 独立Chrome QA
  • source audit
Exact models
  • deepseek-v4-flash-vision-exp
Validation method
新しいsource workspaceで人のdesign判断とsource修正を禁止して実行し、停止後に独立build、隔離Chrome、通常DOM操作、source audit、208.726667秒の人間試遊を行いました。
Result
2,527.062秒で終了コード0となり、143 reasoning steps、149 tool calls、24回のread_imageで17 source filesを作成し、人間source編集は0回でした。独立buildと基本操作はPASSしましたがfeedingはFAILし、rear viewとlightingも弱く、先行Hermes版が総合的に選ばれました。
Limitations
  • prompt、browser route、tool schema、permission、停止条件、録画範囲が異なるため、Harnessだけの因果差を測るclean A/Bではありません。
  • 131 Hermes turnsと143 Harness reasoning stepsは同一単位ではありません。
  • precise move destinationの正しさは確立せず、stale ray、群れ計算、food/environment update未接続がsource auditで確認されました。
  • 最初の試行はNASのhard-link非対応でmodel call前に停止し、比較には正常完了した2回目だけを使いました。
  • 人間の比較は非blindのrun-level評価で、DeepSeek Harness一般の優劣を示しません。

build成功のあとに見つかった挙動不良

公式Harnessは自律実行を完了し、よりmodularな実装を作りました。独立production buildも成功し、通常操作で魚とobjectを追加・削除できました。

一方、連続した人間試遊でfoodを落とすと、一部の魚が激しく動く、または同じ点を回り続ける状態がresetまで続きました。静止画確認や短いsmoke testでは見逃しやすい不良です。この実行では「モデル自身の画面確認」「独立build/browser QA」「対象を絞ったsource auditと人間試遊」の三段階が必要でした。