已发布的效率信号
谷歌报告在人工分析指数中,3.6 Flash 的输出 Token 减少 17%,且在多步流程中推理步骤和工具调用更少。请在你自己的智能体循环中测量完整任务成本。
模型对比 · 仅在受控 Unreal 测试后升级
谷歌报告 3.6 Flash 在编码、多模态质量、计算机使用和 Token 效率上更好,并且列出的 Token 价格更低。这使得迁移值得测试,但并不代表所有 Unreal 工作负载都改善。
在现有可用性和条款符合项目要求时,建议在新的 Unreal 评估中优先使用 3.6 Flash。对于现有 3.5 Flash 工作流,请在两个模型上复测同一批已保存的提示词、源码切片、截图、日志、工具与验收检查项。仅在测量到编辑准确性、回归、延迟、总 Token 消耗、成本、安全性和回滚能力后再迁移。
谷歌报告在人工分析指数中,3.6 Flash 的输出 Token 减少 17%,且在多步流程中推理步骤和工具调用更少。请在你自己的智能体循环中测量完整任务成本。
发布报告显示 3.6 Flash 的 DeepSWE 为 49%,而 3.5 Flash 为 37%。Unreal C++、Blueprint 规划、构建诊断和插件版本工作需要各自的任务集。
OSWorld-Verified 报告为 83.0%,高于 78.4%,并且计算机使用可作为客户端工具提供。编辑器控制会引入权限和危险操作风险,因此需要独立沙箱。
更好的通用基准并不构成在没有提示词回归、输出 Schema 校验、速率与配额复核、安全测试和回退机制的情况下替换稳定生产路线的理由。
Google 将 3.6 Flash 定位为在编码、知识工作、多模态任务、token 效率和代理式执行方面,相较 3.5 Flash 的直接下一步。7 月 21 日发布说明 3.6 Flash 的价格为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元,并表示该价格低于 3.5 Flash。定价、可用性、配额以及预览或稳定标签可能会变化,因此请记录测试当日的模型 ID 和定价页面。
该版本还报告了更少的非预期代码编辑和更低的执行循环次数,以及在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上的改进。这些结果可作为 Unreal 仓库任务、日志分析、截图复核与工具辅助规划的有用假设,但不能证明 Unreal API 正确性、Blueprint 编译、编辑器稳定性或打包性能。
| Criterion | 3.6 Flash 测试预期 | 迁移门槛 |
|---|---|---|
| 编码编辑 | 更少的不必要编辑和循环是厂商报告的方向 | 提高采纳差异率且无回归上升 |
| Multimodal review | 更强的视觉与文档分析是厂商报告的方向 | 更好的缺陷召回,无需做不支持的断言 |
| Token 效率 | 谷歌报告该指数中输出 Token 减少 17% | 降低完整任务的总 token 与成本 |
| 计算机使用 | 内置客户端工具已可用 | 沙箱权限、确认、日志和回滚通过 |
| 生产路由 | 使用准确的模型 ID 与当前可用性 | 回退、架构兼容性、配额、延迟和策略检查通过 |
Google 于 2026 年 7 月 21 日的发布是模型定位、公开基准、定价及可用性的信息来源。Google 在该页面中未声称具备原生 Unreal 集成。Epic 文档和目标项目仍是引擎行为的最终权威。
在Unreal Engine规划、C++、Blueprint、多模态审查、成本、测试和安全交接中评估Gemini 3.6 Flash,不宣称有原生UE集成。
阅读本指南在边界内使用 Gemini 3.6 Flash 进行 Unreal C++ 和 Blueprint 的规划、评审、测试、恢复与交接,同时保持编译和运行时验证在原生环境中进行。
阅读本指南为Unreal的截图、日志、追踪、Blueprint证据、渲染缺陷和可复现的原生验证构建安全的Gemini 3.6 Flash工作流。
阅读本指南不一定。谷歌报告更强的通用编码、多模态、知识工作、计算机使用和效率结果,但 Unreal 工作流受引擎版本、项目架构、提示词设计、工具权限、上下文选择、输出 Schema、延迟和复核流程影响。更换生产路由前应先复测固定的项目专项套件。
不一定。先确认模型当前可用性和条款,再用保存好的回归输入对两个模型 ID 进行测试。比较采纳编辑、Schema 差异、拒绝、幻觉、延迟、Token 消耗、成本、工具调用、取消率和回退能力。逐步上线并结合监控与快速回退到先前模型的通道。
不会。DeepSWE 与 OSWorld 提供有价值的一般性信号,但它们并未测试你的 Unreal 版本、C++ 约定、Blueprint 资产、插件、打包目标、网络权限模型、性能预算或项目特定 API。应将其视为测试触发依据,而非项目验收证据。
可以,但应作为独立原型交接。使用相同的游戏需求生成可在浏览器中运行的方向版本,再比较每个模型是否产生更清晰的原生 Unreal 实现与测试计划。不要将浏览器输出视为两款 Gemini 模型已在 Unreal 项目中编译或执行的证据。