Experiment公開済み

Blender成果物は構造検証だけで完成といえるか

3モデルの.blendファイルが機械検証50/50でも、実際にレンダーした動きには差が出ることを確認し、採点基準を改訂しました。

Tested question
必要なオブジェクト名やキーフレームが存在する.blendファイルを、本当に動く成果物と判定できるか。
Exact tools
  • Hermes Agent v0.19.0
  • Blender 5.2.0 LTS
  • Blender MCP
  • isometric-mini-factory-v1
Exact models
  • openai-codex / gpt-5.6-sol
  • anthropic / claude-opus-5
  • openrouter / moonshotai/kimi-k3
Validation method
同じ空のbaseline.blendと固定課題を各組み合わせ1回実行し、構造50点、静止画30点、実際にレンダーしたアニメーション10点、作業証拠10点で再評価しました。
Result
機械検証は3組とも50/50でしたが、実際のアニメーションはOpus 8/10、GPT 3/10、Kimi 1/10。改訂後の総合点は93、90、83です。
Limitations
  • 各組み合わせ1回で、モデル一般の順位ではありません。
  • API提供元、内部のシステム指示、通信経路は統一されていません。
  • 公開YouTube transcriptには旧rubricの96/93/88が残る可能性があります。最終scoreは改訂後の記事・動画説明の93/90/83を正とし、記事をcanonicalとします。
  • 編集可能な.blendファイル自体の公開リンクは確認できません。

構造から再生へ

オブジェクトとキーフレームの存在だけでは、接触のずれや部品の分離、ほとんど動かないアームを見落とします。実際にアニメーションをレンダーし、旧採点基準を監査履歴として残して採点を改訂しました。

Opusは最も自然に動く一方で箱との接触にずれがあり、GPTは精密な静止画でもアームがほぼ動かず、Kimiでは部品分離とすり抜けが見られました。

公開されている点数には不一致があります。 公開YouTube transcriptは旧rubricの96/93/88を保持している可能性がありますが、記事と動画説明は改訂後の93/90/83です。このページでは記事を最終点数のcanonical sourceとし、動画は補助証拠として扱います。