xiayx 10 月 4 日消息,据 decoder 今天报道,腾讯研究人员近期以王者荣耀游戏为训练平台,探索如何让 AI 在游戏中实现“战略性思考”,并研发了名为 TiG(Think in Games)的全新框架。相关成果已在 Hugging Face 平台和 arXiv 期刊上发表。

研究团队指出,当前 AI 模型存在明显的功能鸿沟。以游戏为取向的 AI 能够正常进行游戏,但无法理解自身所做出的决策;而语言模型虽然能进行策略推理,却难以真正执行具体操作。为解决这一问题,他们开发了全新的 TiG 框架,使模型能够在游戏中同步进行思考与行动。

团队选择王者荣耀作为训练范本,首先使用匿名且标准化的赛事数据,定义了推上路、击杀暴君、守家等 40 种宏观行动。胜负回数保持均衡,AI 模型需在每个设定场景中选择最佳策略,并解释其战略依据。

具体来说,训练分为两个阶段。首先在监督学习阶段,模型需要掌握这些策略的基本机制;随后通过奖励机制进行强化学习,行动正确得 1 分,错误行动得 0 分。

随后,团队测试了多种语言模型,涵盖 Qwen2.5-7B、14B、32B 以及 Qwen3-14B,并使用 DeepSeek-R1 大模型作为对照组。首先从 DeepSeek-R1 中提炼高质量训练数据,然后采用群体相对策略优化(GRPO)技术,比较不同策略的优劣。

最终,经过 TiG 框架训练的模型不仅能制定行动计划,还能解释决策原因。例如,AI 能够指出某个防御塔防守薄弱,是理想的进攻目标,但同时需要注意埋伏的敌人。模型训练后仍保持原有的文本理解、数学推理与问答能力。

对照组 DeepSeek-R1:决策准确率达 86.67%
Qwen3-14B:决策准确率达 90.91%,超越 DeepSeek-R1
Qwen2.5-32B :准确率从 66.67% 提升至 86.84%
Qwen2.5-14B:准确率从 53.25% 提升至 83.12%
minecraft国际版v1.19.50.
模拟经营
查看
珠宝小匠1
益智休闲
查看
食物奔跑者0.7.4
益智休闲
查看
Bread Baking0.5
模拟经营
查看
碎布娃娃命中Ragdoll Hit游戏v0.2
益智休闲
查看
巨人怪兽毁灭安卓版v1.0
益智休闲
查看
印度3D巴士模拟器1.0
赛车游戏
查看
小咖啡馆的故事中文版v2.6.0
模拟经营
查看
cswgev13-
益智休闲
查看