ブラウザゲーム完成度の多層評価ワークフロー
AI製ゲームを自己報告だけで終わらせず、生成側のテスト、別環境での確認、長時間動作、人間の試遊へ分けて判定する評価手順です。
- Tested question
- 異なるエージェント環境で作られたブラウザゲームの完成度を、証拠の由来と制約を残して評価できるか。
- Exact tools
- 独立ブラウザQA
- 長時間動作確認
- 人間による試遊
- ソース変更監査
- Exact models
- GPT-5.6 Sol
- poolside/Laguna-S-2.1
- unsloth/Laguna-S-2.1-GGUF UD-Q4_K_S
- claude-opus-5
- claude-fable-5
- Validation method
- 4モデル・5実行へ同じゲーム要件と採点基準を適用し、自己報告、生成側のテスト、別環境での確認、人間の試遊、録画の作り方を分けて記録しました。
- Result
- 起動直後の見た目だけでは分からない停止、古いテスト、狭幅表示、操作感、再現できない自己報告を区別できる評価手順を作成しました。
- Limitations
- 各条件1回で、普遍的な順位表ではありません。
- プロンプト、製品、ツール、権限、量子化、予算は統一していません。
- 公開プレイURLはなく、映像の作り方も実行ごとに異なります。
Evidence (1)
Artifacts (3)
成果物としての評価設計
完成度を単一のテスト結果へ縮めず、要件、実行、別環境での検証、人間の試遊、制約に分けました。この分離により「生成側のテストは通ったが別環境で再実行できない」「長時間で初めて停止する」といった差を残せます。
これはモデルを普遍的に順位付けするものではありません。条件の異なる5実行を、同じ成果物要件のもとで検証可能に比較するための手順です。