想象一段游戏录像:屏幕中央有三个敌人,一个在掩体后,两个在远处的平台上。一个只看画面的模型可以准确地报出这个数字,然后自信地建议“击杀最近的目标”。可玩家当时其实正在后退,因为耳机里传来了脚步声,方向在他背后,而屏幕右下角的弹药数字已经变成了红色。画面回答的是“有什么”,而玩家做决定依据的,是“正在发生什么、我能做什么、接下来会怎样”。这两个问题之间的距离,就是多模态游戏模型真正要跨过去的地方。
多模态模型能认出屏幕里有三个敌人,只能说明它看见了。真正困难的是判断玩家为什么正在后退。本文想讨论的,是爱游戏在设计游戏大模型时为什么坚持把“看、听、读、操作”放进同一个理解过程,而不是把一张截图交给一个通用的图像问答模型。
画面能确认“谁在场”,但确认不了“谁在威胁我”
视觉是游戏理解里最直观的一路输入。连续的视频帧可以提供角色位置、地形、技能特效、血条、小地图、准星指向等信息。现代视觉模型在识别物体、读取画面布局上已经相当可靠,这一层通常不是瓶颈。
问题出在画面本身的局限上。第一,画面只是摄像机视角,不是世界本身。背后的敌人、被墙体挡住的队友、屏幕之外的爆炸,都不在帧里。第二,游戏画面里充满了特效:烟雾、闪光、镜头抖动、半透明的技能范围,都会让“这里有一个敌人”变成一个概率判断。第三,游戏视觉风格千差万别,同一个红色轮廓在这款游戏里表示敌人,在另一款里可能表示可交互物品。
所以在爱游戏的设计思路里,视觉通道的任务被限定得很清楚:它负责回答“画面里有哪些实体、它们大致在哪、正在做什么动作”,并且必须同时输出一个不确定度。它不被允许直接给出“应该怎么办”的结论,因为这个结论所需的证据,有一半根本不在画面里。
声音是画面之外的第二个视角
在很多游戏里,声音承担的是画面无法承担的信息:脚步声的方向和远近、换弹的金属声、技能读条的提示音、远处的爆炸、队友的语音。玩家在高强度对局中,往往是先“听到”再“看到”。一个不处理音频的游戏模型,相当于让玩家戴着静音的耳机打比赛。
音频又可以分成两类,处理方式完全不同。一类是游戏内的环境与事件音效,它们更接近“信号”,重点是分类、方位和时间点,例如“这是一次近距离脚步声,来自左后方,出现在两秒之前”。另一类是人声,包括队友语音和玩家自己的语音,需要 ASR(自动语音识别)转成文字,再交给语言理解。人声还带着语气:喊“撤”和随口说“撤了吧”,含义并不相同。
声音通道有几个天然的麻烦。游戏音效经常被背景音乐和多个声源叠加,方向感在立体声下只是近似;语音识别在嘈杂环境、口音、游戏黑话面前会出错;而且人声涉及隐私。爱游戏对这部分的取向是:语音与聊天类输入需要玩家明确授权,能在本地处理的尽量在本地处理,用不到时可以整体关闭。声音让模型更懂游戏,但不能以牺牲玩家对麦克风的控制为代价。
屏幕上的字:UI、任务提示与聊天,是最容易被忽略的“结构化信息”
游戏画面里有大量文字:弹药数、血量、技能冷却、任务目标、物品名称、系统公告、队伍聊天。它们往往是最准确的信息,因为这些数字是游戏自己画上去的,不像“那个角色是不是敌人”需要推断。OCR(文字识别)把这些像素转成可读文本,就等于免费获得了一批接近“游戏状态”的数据。
但 OCR 在游戏里比在文档里难得多。字体千奇百怪,文字常常带描边、发光、动画;界面缩放和分辨率不同,文字位置会变化;有些关键信息用图标而不是文字表达,比如一个沙漏图标代表技能冷却中。更重要的是,文字必须和位置、时间绑定才有意义:“弹药 3/30”出现在屏幕右下角的弹药栏,意味着当前武器只剩三发;出现在聊天窗口里,则可能只是队友在报数。
因此爱游戏的多模态模型不会把 OCR 的输出当作一段“字符串”,而是把它归入不同的槽位:资源状态、任务状态、系统提示、聊天内容。任务文字尤其重要,它告诉模型“目标是什么”,同一个后退动作,在“拖延时间等待撤离”的任务里是正确的,在“夺取据点”的任务里可能就是失误。
手在做什么:控制输入才是玩家意图最直接的证据
前面三路都是“游戏在展示什么”,第四路则是“玩家在做什么”。手柄摇杆的方向与幅度、键盘按键的组合、鼠标的移动轨迹和点击、触屏的滑动与长按,这些控制输入是玩家意图最直接的证据。画面里角色在后退,可以是玩家主动后撤,也可以是被击退、被推走、被传送。只看画面,这三种情况几乎无法区分;一旦有了控制输入,就能马上知道:摇杆是否向后、是否按下了技能键、是否在瞄准一个目标的同时后退。
当然,控制输入并非总能获得。云游戏、主机、第三方平台对输入的开放程度不同,读取输入本身也涉及权限。在爱游戏的设计里,控制输入属于“按需启用”的一类:有条件、且玩家同意时才接入,没有它时,模型必须能退回到只用画面、声音与文字的降级模式,并且在输出里说明“意图判断依据不足”,而不是硬猜。
模拟场景:走廊里的一次撤退,四路信号怎样拼在一起
下面是一个模拟场景,用来说明融合的过程,其中的物品与数字都是假设的示例,不来自任何真实对局。
玩家在一款合作射击游戏里,与两名队友进入一条仓库走廊。屏幕上,前方十几米外出现三个敌人。此时四路信号分别是:
- 画面:前方有三个敌人,其中一个在掩体后面,只露出半个身体;玩家角色的准星停在最近目标的边缘。
- 声音:耳机里出现一次由弱到强的脚步声,方位偏向左后方;紧接着队友语音说了一句“后面有人”,ASR 给出的文字置信度中等。
- 文字:右下角的弹药栏显示“3/30”,字体被换弹动画部分遮挡;任务栏写着“坚守到撤离点开启”。
- 控制输入:左摇杆持续向后推,射击键在最近两秒没有被按下,换弹键被按了一次。
只用画面的模型会得出“前方有三个敌人,应当进攻”。融合之后,判断变成:弹药几乎耗尽,任务要求坚守而不是推进,队友和脚步声都指向后方有新威胁,而玩家的操作恰好是后撤加换弹。合理的解读是:玩家在拉开距离、补充弹药,并注意到了身后的风险。此时更合适的提示是“左后方可能有人,你的弹药不多,两个队友的位置在你右侧”,而不是让他去打前面的敌人。
这个场景里同样有出错的地方。如果 ASR 把“后面有人”识别成了“后面没人”,方向就会被推翻;如果 OCR 被换弹动画遮挡而把“3/30”读成“30/30”,弹药判断就完全错了。多模态融合并不是把每路信号加起来变得更准,而是要在各路信号互相矛盾时知道谁更可信。控制输入和 UI 文字通常比画面推断更可靠,脚步声方向通常比语音转写更可靠,这类优先级需要被明确写进模型的处理流程,而不是让模型自己去猜。
时间对齐:同一秒里,四路信号其实并不同时到达
把多路信号放在一起,最容易被低估的是时间问题。画面帧有固定的刷新间隔,但视频编码、传输和采样都会带来延迟;音频以另一套采样节奏进入;ASR 需要等一句话说完才能输出文字,天然就滞后;OCR 常常只在检测到界面变化时才运行;而控制输入几乎是实时的。如果不做对齐,模型看到的可能是“画面里敌人刚刚出现,而玩家的后撤操作发生在三秒之前”,结论就会变成“玩家在敌人出现之前就撤退了”,因果被完全颠倒。
爱游戏的做法是给每一路信号打上统一的时间戳,再把它们汇总成一条事件时间线,而不是各自生成一段描述。事件时间线里的每一条记录,至少包含:发生时刻、来源通道、涉及的实体、内容、置信度。这样一来,“3.2 秒时脚步声出现在左后方”和“3.5 秒时玩家开始后撤”可以直接被排列比较,后续推理也可以基于时间顺序而不是一堆文字描述。这里的秒数只是举例,并不代表任何实测延迟。
研究界已经注意到这一点。ACL 2026 收录的 GameplayQA 基准论文,用多人 3D 游戏视频做了密集且时间同步的标注,并围绕 Self(自己)、Other Agents(其他角色)、World(世界)三元结构来设计问题。它的公开结论是:前沿多模态模型与人类之间仍有明显差距,常见的失败集中在时间与跨视频对齐、角色归因,以及游戏决策密度高——事件多、变化快。这与前面场景里的问题正好对应:对不齐时间线,模型就会把因果说反;分不清是谁做了什么,就会把队友的动作算到玩家头上。
Self、Other、World:把理解拆成三个可检查的问题
三元结构不只是评测的分类方式,对产品设计同样有用。当模型输出一段游戏理解时,可以要求它把内容分别归到三个桶里:
| 类别 | 要回答的问题 | 主要依据 | 常见误判 |
|---|---|---|---|
| Self(玩家自己) | 玩家在做什么、想做什么、状态如何 | 控制输入、UI 资源栏、第一人称画面 | 把被击退当成主动后撤 |
| Other Agents(其他角色) | 队友、敌人、NPC 各自在做什么 | 画面、脚步与技能音效、队伍语音 | 把队友的动作归给玩家,或反过来 |
| World(世界与任务) | 地形、资源、目标、时间限制 | 任务文字、小地图、环境事件 | 忽略任务目标,孤立地评价一个动作 |
这样做的好处,是让错误变得可以定位。如果一个提示是错的,可以追问:是把 Self 与 Other 混淆了,还是漏掉了 World 里的任务约束?在没有这层分解的情况下,模型只输出一段流畅的自然语言,出错时既无法归因,也无法针对性修正。爱游戏在设计游戏大模型的输出格式时,倾向于让它同时给出结构化状态和自然语言解释,前者用来检查,后者用来展示。
关于这类输入究竟包含哪些、怎样采样、来源可靠度如何排序,可以参考游戏大模型的输入清单那一篇,那里把视频、音频、OCR、ASR、控制输入和游戏状态逐项做了对比。
三元结构之外,还要提防信息变多以后出错方式的增加。结合前面的分析,多模态游戏理解的常见错误可以分成四类。
- 单通道过度自信。只有画面证据时,就给出确定的战术判断。对策是让模型在缺少某路信号时,把结论降级为“可能”,并说明缺了什么。
- 模态冲突处理不当。语音说安全,画面显示有敌人,脚步声说背后有人。对策是预先定义信号优先级和冲突时的表达方式,而不是随机选一个。
- 时间错位。把已经过去的事件当成正在发生的事,或者把响应误当成原因。对策是统一时间戳与事件时间线。
- 角色归因错误。多人场景里“谁做了什么”是公认的难点,尤其是视角切换、角色外观相近的时候。对策是把 Self、Other、World 分开建模,并允许在无法归因时明确说“不确定”。
还有一个不属于模型本身、但同样重要的风险:评测里的表现不等于产品里的可靠性。一个在测试题上答得不错的模型,放进真实对局,要面对的是不同的分辨率、不同的语言、被遮挡的界面和吵闹的语音频道。爱游戏在这方面的态度是:多模态模型的每一路能力都需要单独验证,并且要在输出中如实带出不确定度,不把“看起来很聪明”当成“可以依赖”。
“看见”只是第一步,理解才是模型该负责的部分
回到开头那段录像。让模型认出三个敌人,用不到多大的本事;让它知道玩家为什么后退,需要声音、文字、操作和时间线一起工作。这也是爱游戏把“听、看、读、理解操作”放在同一个模型里的原因:游戏不是一系列静止的图片,而是玩家、其他角色和世界同时在变化的过程。
这种设计也带来了它自己的克制。多路输入意味着更多的隐私边界、更多的失败模式,以及更高的成本,所以爱游戏不追求“什么都接”,而是让每一路输入按需启用、可被玩家关闭,并在证据不足时承认不知道。更长时间尺度上的理解,比如二十分钟的对局如何被记住,可以进一步看长视频游戏推理的那篇分析。
评价一个游戏多模态模型,与其问它能不能看懂一张图,不如问它能不能在下一次决策来临之前,把玩家、其他角色和世界当前发生的事说对,并且在说不准的时候,老老实实地告诉玩家。