很多玩家都有过这种体验:让AI在旁边看着,它对局面的描述几乎无可挑剔,“前方有两个敌人,你的血量不到一半,队友在左侧”。然后你问它该怎么办,它回答“建议你小心行动”。这不是模型偷懒,而是感知和决策本来就是两件事。看到敌人,不等于知道应该进攻、撤退、补血,还是等队友;后一类判断依赖目标、资源、队伍状态和玩家此刻想要什么,而这些信息往往不在画面里。

这篇文章顺着一条从“看到”到“说出下一步”的链条,看它在哪里断掉,以及爱游戏为什么在这条链条的末端,把控制权留给玩家。

感知只是起点:AI陪玩的五步链条

把一次陪玩提示拆开,大致是五步:

  1. 感知:从画面、声音、文字、操作中提取信息,比如敌人数量、血量、冷却时间。
  2. 状态抽象:把零散信息压缩成对决策有用的状态,比如“我方处于劣势,但治疗技能在十秒内可用”。
  3. 目标:判断玩家此刻在追求什么,是通关、拿装备、练技术,还是陪朋友闲聊。
  4. 计划:在目标与状态之间,找到一串可行的动作,并考虑它们的先后与风险。
  5. 提示:把计划变成玩家来得及看、看得懂的一句话或一个标记。

多模态模型的进步,主要集中在第一步。近期公开的游戏理解基准也显示,模型在时间对齐、角色归因和高决策密度场景里仍与人类有明显差距,这些都还属于“看懂发生了什么”的范畴。至于后四步,很多产品处理得相当粗糙,甚至直接把第一步的输出当成结论。这就是“知道发生了什么,却不知道下一步该做什么”的来源。

状态抽象:什么信息值得留下来

游戏局面的信息量极大,一帧画面里有几十个实体、上百个数值。决策者不可能逐个考虑,而是把它们压缩成少数几个关键量。高手玩家所谓“局势判断”,其实就是一种熟练的状态抽象:他脑子里存着的不是“三个敌人、血量百分之四十、冷却剩五秒”,而是“这一波我方吃亏,撑过下一个技能窗口就能反打”。

AI陪玩缺的往往正是这一层。原因有两个。一是抽象的好坏依赖具体游戏:同一个“血量偏低”,在追求生存的游戏里是危险信号,在有高额回复机制的游戏里可能不算什么。二是抽象需要知道任务目标。如果模型不知道当前任务是“守住据点”,就没法判断后撤是明智还是失误。因此,状态抽象不能是通用的,它要和游戏规则、当前任务绑在一起。

长时程规划:难点不在“想得远”,而在“前提一直在变”

规划里有一个常被忽略的矛盾:计划越长,前提越容易失效。游戏是实时变化的,队友随时可能倒下,敌人的行为并不按预期,玩家自己也会临时改主意。一个十步计划走到第三步就可能作废。

所以长时程规划在游戏陪玩里更接近“滚动决策”:保持一个粗粒度的长期方向,比如“先清理据点周围,再去推进主线”,在此基础上频繁根据新状态重新规划近期的几步。这与需要记住早前事件的时间推理直接相连,比如十秒前被打断的读条,决定了现在为什么不能立刻使用某个技能。关于如何在长时间的对局里保存这类记忆,可以参考连续看二十分钟游戏为什么突然变难那一篇。

此外还有代价问题。规划越深,需要的算力和延迟越高,而陪玩提示的价值高度依赖时效:必须在玩家下一次决策之前出现。所以实际设计里,往往是让轻量的规则或小模型处理近期动作,把较重的推理留给非紧急时刻,比如复活等待、加载界面或赛后复盘。

模拟场景:首领战第二阶段,同一个局面的三种“下一步”

下面是一个模拟场景,其中的时间与状态都是假设的示例。三名玩家在一个合作副本里打首领,进入第二阶段。玩家A是输出位,血量偏低,当前的治疗队友技能处于冷却。AI陪玩已经通过画面、文字和队伍状态读出:首领即将释放范围技能,A 站在范围边缘,治疗的冷却预计还需较长时间。

这个局面至少有三种合理的下一步:

  • 后撤到安全区,等技能结束再输出,这样最安全,但会拉长战斗时间;
  • 继续输出,用一个位移技能躲避范围,这样效率高,但要求 A 有足够的操作把握;
  • 使用一个消耗品补血,然后留在原位,代价是消耗资源。

哪一种更好,取决于 A 的目标与偏好:是追求稳定通关,还是想拼一个速度纪录?他是否有位移技能的熟练度?消耗品是否紧张?这些信息,AI 从画面里读不出来。如果它直接输出“立即后撤”,可能违背了 A 想要的打法;如果输出“继续输出”,则可能把一个不熟练的玩家推向失误。

比较稳妥的做法,是让提示保留选择:“首领即将释放范围技能,你在边缘,治疗还在冷却。可以后撤等待,或用位移躲避。”并给出一个默认倾向,但不替 A 决定。事先设置过“稳妥优先”的玩家,则可以直接看到偏向后撤的建议。玩家的偏好在这里是一个明确输入,而不是让 AI 从行为里偷偷猜出来的结论。

玩家意图:不确定的时候,问一句比猜一次更好

意图推断是这条链条上最脆弱的一环。玩家的行为存在大量歧义:一个玩家反复在同一个地方后退,可能是在练习某个躲避,也可能是被卡住了,还可能是在等队友。如果 AI 一律按最可能的解释行动,一旦猜错,就会造成“AI在帮倒忙”的感受。

爱游戏在这里的设计思路是把意图当作一个带不确定度的量,而不是事实。当意图明确(玩家主动设定了目标,或选择了“稳妥优先”),提示可以更直接;当意图模糊,与其猜测,不如用低打扰的方式确认,比如一个可以忽略的短问题:“想尽快通关,还是想练习这个机制?”玩家不回答也没关系,助手保持较保守的提示方式即可。这里的原则是,AI 宁可少说,也不要替玩家做出未经确认的判断。

陪玩要有权力分级:提醒、建议、经选择后的代操作

从控制权的角度,AI陪玩可以分成三档,权力依次增大:

档位 AI 做什么 玩家保留什么 典型风险
提醒 指出被忽略的信息,如背后有人、技能可用 全部决策与操作 提示过多打断注意力
建议 给出带理由的下一步选项是否采纳、如何执行 理由不准确,误导玩家
代操作 在玩家主动选择后,执行有限的一段动作随时中断、收回控制 与玩家意图冲突,影响他人体验

爱游戏的默认取向,是不自动玩完整游戏。代操作只应作为玩家主动开启、范围明确、可随时中断的辅助,例如在玩家离开座位的几十秒里维持角色的防守,而不是接管整局比赛。多人游戏里还有一个额外考虑:代操作会影响队友与对手的体验,是否允许以及如何标注,都需要遵守具体游戏与社区的规则。

怎么判断一个陪玩是不是真的有用:看操作,不看措辞

评估AI陪玩,最容易犯的错是看回答是否流畅、听起来是否有道理。一个说得头头是道的提示,并不能保证执行后局面变好。更可靠的方法是看可验证的操作:给定一个可复现的局面,AI 提示的动作被执行后,血量、资源、目标进度是否朝预期变化?提示是否来得及?是否被玩家采纳?采纳后是否比不采纳更好?

近期游戏 Agent 相关的评测,也越来越强调这类可验证的操作,而不是只看文字回答。这个方向与爱游戏的取向一致:陪玩的价值不在说得漂亮,而在于提示是否及时、依据是否可检查。关于这些依据具体来自哪几路信号,可以参考游戏大模型的输入清单

好陪玩的标准:知道什么时候只说“我看到了”

回到开头的问题。AI陪玩知道发生了什么,却不知道下一步该做什么,因为下一步取决于目标、约束和意图,而这些并不都能从画面得出。让它更强,并不只是把识别做得更准,而是把状态抽象、目标推断和计划生成这几层做扎实,同时接受一个事实:有些时候,最好的提示就是“我看到了这个情况,你怎么想”。

一个真正好的陪玩,不需要抢过手柄。它在该提醒的时候提醒,在该给建议的时候给出理由,在不确定的时候把选择还给玩家。