📋 题目描述
题目描述
NS-2026-09 观测之环:隐变量世界模型反事实预测
赛题任务
本题编号为 NS-2026-09。
任务介绍
环形观测站正在排查一组异常网格世界。巡检机器人只能看到身边很小的一块局部视野,传感器还会把许多事件压缩成粗粒度摘要;真正的动力学参数、场效应顺序和隐藏机制组合不会直接给出。你需要扮演世界模型工程师,根据有限 probe 轨迹还原这些隐变量,并预测同一隐藏世界中多个反事实 query 的后果。
“观测之环:隐变量世界模型反事实预测”是一道 探索型 Hard 题。每个测试 context 给出同一隐藏世界的完整初始地图、坐标锚点、若干 probe 轨迹、稀疏局部过程观测、probe 终局完整观测、聚合事件传感器,以及多个共享同一隐藏 profile 的反事实 query 动作序列。目标是从公开校准观测中推断一致的世界动力学解释,并预测每个 query 执行后的终局网格、事件标志、事件发生时段、事件发生顺序和终局类型。
你需要完成的核心工作包括:
- 从公开 train/valid 的 probe、query 和标签中学习世界机制与隐变量线索。
- 对 test 中每个 context 建立一致的隐藏机制解释,而不是孤立处理每个 query。
- 对每个 query 的未来动作序列做反事实 rollout,输出终局网格、事件集合、事件时段、事件顺序和终局类型。
- 在只获得平台总分反馈的条件下,通过本地验证、消融和可视化定位模型缺陷。
隐藏 profile 可能影响移动、场效应、实体交互、事件触发、状态转移和终局判定等多个方面。不同隐变量之间可能存在组合效应;同一 context 下多个 query 共享隐藏 profile 和初始隐状态,但未来动作不同,需要跨 query 保持机制解释一致。
Hard 难度定位
官方不承诺公开边界 exact 1500 / 1500。高分需要构建或训练能够从公开初始地图、probe 校准轨迹和 probe 终局观测中恢复隐变量的世界模型。
赛题数据
在本页下方“相关资源”处下载数据包,或在 https://modelscope.cn/datasets/SteamedFresh/NS-2026-AAA-data 处获取
NS-2026-09/├── train.jsonl├── valid.jsonl├── test.jsonl├── frames/│ ├── train/│ ├── valid/│ └── test/├── label_schema.json├── DATA_NOTICE.md├── example_submission/│ └── results.json└── tools/ ├── baseline.py ├── check_format.py └── visualize_rollout.py数据规模:
| split | context 数 | query 目标数 | 标签状态 |
|---|---|---|---|
| train | 720 | 1440 | 公开每个 query 的 label.final_grid、label.events、label.event_timeline、label.event_order、label.terminal |
| valid | 160 | 320 | 公开每个 query 的 label.final_grid、label.events、label.event_timeline、label.event_order、label.terminal |
| test | 320 | 640 | 隐藏每个 query 终局目标 |
每个样本包含:
| 字段 | 类型 | 含义 |
|---|---|---|
id | string | context 级样本 ID |
observation_mode | string | 固定为 sparse_egocentric_5x5_plus_event_sensors |
coordinate_system | object | 坐标系说明:x 为列号、y 为行号,原点在左上角 |
initial_full_grid | list[string] | 该 context 的完整初始地图和实体位置;test 也公开 |
initial_entities | object | 从 initial_full_grid 解析出的初始实体坐标 |
context_episodes | list[object] | 同一隐藏世界 profile 下的 probe 轨迹 |
context_episodes[].actions | list[string] | probe 动作序列 |
context_episodes[].observations | list[object] | probe 观测序列;部分项含 local_view,部分项为 sensor-only 观测 |
context_episodes[].observed_final_full_grid | list[string] | 该 probe 动作序列执行后的公开终局完整地图 |
context_episodes[].observed_final_events | object | 该 probe 的公开终局事件集合 |
context_episodes[].observed_final_event_timeline | object | 该 probe 的公开事件首次发生时段 |
context_episodes[].observed_final_event_order | list[string] | 该 probe 的公开前三个首次发生事件顺序 |
context_episodes[].observed_final_terminal | string | 该 probe 的公开终局类型 |
queries | list[object] | 同一 context 下多个反事实 query,共享同一个隐藏 dynamics profile |
queries[].query_id | string | 提交 results.json 中必须使用的预测 ID |
queries[].initial_observation | object | query 初始稀疏局部观测,始终包含 local_view |
queries[].initial_full_grid | list[string] | query 对应的完整初始地图,与 context 的 initial_full_grid 对齐 |
queries[].initial_entities | object | query 初始实体坐标 |
queries[].future_actions | list[string] | 需要预测的反事实未来动作序列 |
queries[].query_horizon | int | query rollout 步数 |
queries[].label | object | 仅 train/valid 提供的 query 终局标签 |
公开包不含完整逐步结构化状态、完整 test query 终局答案、隐藏 profile、生成 seed、评分程序或内部答案材料。initial_full_grid 和 probe 终局完整观测是选手可见校准信息;local_view 是稀疏化后的局部过程视图。sensor-only 观测只提供 sensor、事件增量、event_timeline_so_far 和 event_order_so_far 等字段。frames/ 中的 PNG 是 probe/query 初始稀疏局部观测帧;完整地图以 JSON 文本字段提供。
评测说明
提交说明
提交文件必须压缩为 NS-2026-09-answer.zip,压缩包内只包含 results.json。
提交格式
results.json 是 JSON list,每个测试 query 必须出现且只能出现一次。id 使用 test.jsonl 中 queries[].query_id,不是 context 级 id:
[ { "id": "wmli_t_0000_xxxxxxxx_q0", "final_grid": ["############", "#..A.......#", "..."], "events": { "goal_reached": false, "collision": true, "hazard": false, "box_on_goal": false, "key_collected": true, "portal_used": false }, "event_timeline": { "goal_reached": "never", "collision": "early", "hazard": "never", "box_on_goal": "never", "key_collected": "mid", "portal_used": "never" }, "event_order": ["collision", "key_collected", "none"], "terminal": "blocked" }]格式要求:
id必须与test.jsonl中的queries[].query_id完全一致。final_grid必须是12行、每行12个字符,字符集合以label_schema.json为准。events字段必须包含label_schema.json中列出的全部事件键,取值为 bool。event_timeline字段必须包含全部事件键,取值为never、early、mid或late,表示该事件第一次发生在 query rollout 的哪个时段。event_order必须是长度为3的 list,每项为事件键或none,表示 query rollout 中前三个首次发生事件的顺序;不足三项用none补齐。terminal必须属于goal、hazard、blocked、active、timeout。- 缺失样本、重复样本、未知样本或非法字段会导致本次提交得 0 分。
得分计算
总分 1500,格式完全合法后计入 100 分基础格式分:
| 项目 | 分值 | 说明 |
|---|---|---|
| 动态网格准确率 | 225 | 只在提交或隐藏答案出现动态实体/门/钥匙的位置比较 final_grid |
| 关键实体位置准确率 | 225 | 从提交网格解析 A/B/O/K 的终局位置,与隐藏答案比较;双方都不存在的实体不计分 |
| 事件向量准确率 | 250 | 六个事件键必须整体一致才计为该样本事件正确 |
| 事件时序准确率 | 250 | 对非 never 的事件比较首次发生时段 early/mid/late |
| 事件顺序准确率 | 250 | 比较前三个首次发生事件的顺序,none 只作补位 |
| 终局类型准确率 | 200 | 比较 terminal |
| 格式合法性 | 100 | 完整、合法、可评分 |
score = 100 + 225 * dynamic_grid_accuracy + 225 * entity_accuracy + 250 * event_vector_accuracy + 250 * event_timeline_accuracy + 250 * event_order_accuracy + 200 * terminal_accuracy平台正式反馈只展示总分。
条款
AI 协助规则
本题 AI 协助等级为 A1。最终测试集推理必须由选手本地可复现方法完成。
Writeup 补充要求
获奖候选队伍需要提交可复现 Writeup,至少包含:
- 方法概述、任务理解、关键改进、验证与复现、AI 使用声明和必要证据截图。
- 数据文件、代码入口、依赖版本、随机种子、运行命令和环境说明。
- 稀疏局部观测编码、隐变量系统辨识方法、多 query 一致性约束、事件时序/事件顺序建模和 transition model 设计。
- train/valid 验证分数、主要消融、失败案例和至少 5 个 probe-to-query 反事实可视化。
- 若使用额外公开数据、公开预训练模型或开源模拟/视觉组件,说明来源、许可证、使用方式和与 test 标签无关的排查过程。
- AI 工具没有接触完整 test 输入生成最终答案的声明。
Writeup需要提供最终提交压缩包文件 SHA256,指平台上传的 NS-2026-09-answer.zip 的 SHA256。
1. 基本信息
-
队长用户名:Ayin
-
队伍名:L.Corp
-
题号:NS-2026-09
-
最终官网提交记录:
- 提交时间:2026-05-27 23:04:57
- 最终有效得分:1293.79分

2. 解题概述
这道题要求我们推导一个网格世界的物理规则,然后对状态进行预测。巡检机器人的视野很小,而且传感器数据是经过压缩的摘要。我们要在完全不知道地图规则和传送带方向这些隐藏信息的情况下,先从探针轨迹(Probe Episodes)里把这关的隐藏参数挖出来,然后预测执行一长串反事实动作(Query)之后,地图最终是什么样子,以及期间会触发哪些事件。
我的方案:法球(O)和木箱(B)在关卡开始时会被传送带推着滑行,所以它们在初始地图上的位置和游戏实际开始后的位置是不一样的。我们通过看探针轨迹结束时法球和箱子停在哪里,然后对多条轨迹做多数投票,从而反推出它们在游戏开始时真正停下来的位置。至于钥匙(K),它不会自己动,所以直接用初始地图里的坐标就行。确定了法球和箱子的起点之后,我们用代码把整个物理过程模拟出来,包括机器人移动、撞墙判断、推箱子和法球的逻辑。在这之外还实现了冰面滑行(踩上去会一直滑到撞墙或撞到东西为止)、传送门的传送逻辑(踩中一个就传到另一个,传过去之后立刻判断后续事件),以及钥匙开门的逻辑。在模拟每一步动作时,如果触发了踩终点、撞墙、踩陷阱、箱子进终点、捡钥匙、用传送门这 6 类事件,就记下当前步数。最后把步数按总步数三等分,判断属于前期(early)、中期(mid)还是后期(late),然后按顺序列出最早发生的前 3 个事件。
因为我的模拟器完全靠规则实现,不需要训练任何模型。在本地验证集上跑出了 1293.79 分,说明这套规则和游戏底层的真实机制基本上是一样的。
3. 关键改进与实验依据
-
门(D)和钥匙(K)物理逻辑的修正
最开始我们以为拿到钥匙之后,门(
D)就会从地图上消失。后来仔细比对错误案例才发现:拿到钥匙只是让门变得可以穿过,但门(D)这个字符在最终地图上还在,不会变成空地(.)。- 修正这个细节后,地图预测准确率(Grid Acc)从 45.2% 升到了 56.4%,总分加了约 50 分。
-
传送带什么时候生效的问题
最开始我们以为传送带在整个游戏过程中每走一步都会推一次上面的东西,但跑出来的路径总是对不上。于是我们做了一个对比实验:
- 假设传送带全程生效:本地评估总分 1038 分,地图准确率 56.4%。
- 假设传送带只在游戏初始化时生效一次:推断传送带只是在关卡加载时把法球和箱子推到初始平衡位置,之后不再干涉任何东西的移动。把模拟器里运行过程中传送带的逻辑关掉后,地图预测准确率从 56.4% 涨到了 84.0%,事件准确率到 85.3%,总分涨到 1276.2。
-
冰面滑行机制的实现
只要机器人或者被推的箱子/法球踩到冰面(
I),就会沿原来的方向一直滑,直到撞墙(#)或者撞到别的实体才停下来。- 加上冰面逻辑之后比把冰面当普通地板的版本,评分提高了 210 分以上(从 1068 分到 1278.9 分)。
4. 验证与复现
运行环境
| 项目 | 信息 |
|---|---|
| 操作系统 | Windows 11 |
| Python 版本 | 3.12.11 |
| CPU 型号 | AMD Ryzen 7 9800X3D 8-Core Processor |
| GPU 型号 | NVIDIA RTX 5090 |
| 内存 (RAM) | 48 GB |
| CUDA 版本 | 13.2 |
随机种子与核心超参数
- 随机种子:整个方案是确定性的,完全基于物理规则和频次统计,不涉及任何随机采样或梯度下降,所以不需要设置随机种子。
- 超参数:没有超参数,所有物体的尺寸、坐标偏移、事件判定范围都严格按照赛题文档来。
预计运行时间与主要资源消耗
不需要训练模型,也不用 GPU,程序只靠 CPU 跑,很轻量:
- 测试阶段:对 720 个训练样本做 1440 次完整仿真评估,大概需要 1 分钟。
- 推理阶段:对测试集 300 个 Context(640 个 Query)完成推断和模拟,只需要 6–8 秒。
- 内存消耗:不需要显存,内存占用不超过 100 MB。
复现步骤
代码没有任何外部大文件依赖,直接用 Python 运行即可:
# 1. 验证在训练集上的分数 (本地评测得分: 1276.2)python src/solution.py --eval_train --train ../train.jsonl
# 2. 验证在验证集上的分数 (本地评测得分: 1233.4)python src/solution.py --eval_valid --valid ../valid.jsonl
# 3. 运行测试集推理,生成最终提交文件 results.jsonpython src/solution.py --train ../train.jsonl --valid ../valid.jsonl --test ../test.jsonl --out ../results.json5. AI 使用声明
全局说明
- 本队使用的 AI 工具:Gemini、Claude
- 主要用途:查询相关资料,代码辅助
逐题声明
NS-2026-09
- 官方等级:A1
- 实际使用:资料查询 / 代码辅助 / 物理逻辑调试及消融思路
- AI 是否接触完整题面:是
- AI 是否接触测试输入:否
- AI 是否接触提交反馈或排行榜反馈:否
- AI 是否生成或修改最终提交:否
- 是否使用商业 API、闭源远程模型或托管式 Agent:是
- 详细说明:使用了 Gemini 和 Claude,主要帮我们理清了碰撞时的边界判定逻辑,帮我们想到了用对比实验验证传送带只在初始化时生效这个思路,以及在手写物理规则时帮忙处理一些边界碰撞条件
Writeup 写作辅助声明
- 是否使用 AI 辅助撰写或润色:是
- 使用工具:Gemini
- 使用范围:排版调整、文字润色,以及把草稿纸上的消融实验记录整理成段落。
- AI 接触材料:代码片段、运行日志和初版 Writeup 草稿。
- AI 是否生成新的实验结果、验证分数或复现命令:否
- 人工核对方式:由队员核对所有数据、分数和运行命令,确认无误。
6. 最终提交与 SHA256
- 平台最终提交文件名称:
NS-2026-09-answer.zip - 平台提交时间:2026-05-27 23:04:57
- 最终有效得分:1293.79 分
- 答案 ZIP SHA256(提交文件 SHA256):
6bd98d59990dcfc1226572b6db0bab001dbe62935c71d2cd80c1b1570089e4ac - 内部关键文件 SHA256:
results.json:1161791efe034d034229cc29480b67ccc88929afe2e1808a3aa016c3486a0f2a
7. 证据截图
7.1 平台有效得分与提交记录截图

7.2 CPU 系统硬件信息截图

7.3 GPU 和 CUDA 配置截图

7.4 Python 版本和环境配置截图

7.5 最终提交文件哈希值校验截图

8. 代码包结构说明
Ayin-NS-09/├── README.md # 本文档├── logs/ # 本地评估和推理日志目录│ ├── eval_train.log # 训练集本地验证输出日志│ ├── eval_valid.log # 验证集本地验证输出日志│ └── inference.log # 完整测试集推理输出日志├── submission/ # 最终提交│ └── results.json # 答案 results.json 的副本├── evidence/ # 平台分数、硬件、哈希等截图└── src/ # 复现源代码 ├── solution.py # 核心推断与模拟器主程序 ├── requirements.txt # 依赖说明(纯标准库,不需要安装第三方库)9. 探针至反事实预测可视化(5 个典型案例)
通过探针轨迹反推物体位置,再用物理模拟器跑反事实 Query,下面是几个典型案例的对比,可以直接看模拟器预测出的最终地图和真实标签的差异。
案例 1:冰面滑动与碰撞(失败个例分析)
初始网格及隐变量推断
初始网格地图 (12x12):# # # # # # # # # # # ## . . . . # . . . I P ## O G . . # . . . D . ## ^ # . ^ . I . . B . ## . . . I . . P # . # ## . . . I . . . ^ > v ## . . . < A . . . . . ## . . . . . . # H v . ## . . . . H . . . < . ## # I . . . . . . . . ## . . . . # . K . . . ## # # # # # # # # # # #- 探针推断结果:
- 法球 O 起始位置:
(1, 3) - 箱子 B 起始位置:
(9, 3) - 钥匙 K 起始位置:
(7, 10)
- 法球 O 起始位置:
反事实 Query 预测与对比
- 动作序列(Query ID:
wmli_tr_0000_7a9f1900aa_q0):U -> L -> L -> U -> U -> U -> L -> L -> U -> WAIT -> WAIT -> R -> R -> D -> U -> U -> U -> R -> R -> D -> D -> U -> D -> L(共 24 步)
终局网格对比
预测终局网格 (Prediction): | 真实期望终局网格 (Expected):# # # # # # # # # # # # | # # # # # # # # # # # ## O . . . # . . . I P # | # . . . . # . . . I P ## . G . . # . . . D . # | # . G . . # . . . D . ## ^ # . ^ . I . . B . # | # O # . ^ . I . . B . ## . A . I . . P # . # # | # . . . I . . P # . # ## . . . I . . . ^ > v # | # . . . I . . . ^ > v ## . . . < . . . . . . # | # . . A < . . . . . . ## . . . . . . # H v . # | # . . . . . . # H v . ## . . . . H . . . < . # | # . . . . H . . . < . ## # I . . . . . . . . # | # # I . . . . . . . . ## . . . . # . K . . . # | # . . . . # . K . . . ## # # # # # # # # # # # | # # # # # # # # # # # #事件触发及属性对比
| 评判维度 | 预测值 | 真实期望值 | 结论 |
|---|---|---|---|
| 终止状态 (Terminal) | goal | blocked | ❌ 不一致 |
| 触发事件 (Events) | goal_reached, collision | collision | ❌ 不一致 |
| 事件时序 (Timeline) | goal_reached:late, collision:early | collision:early | ❌ 不一致 |
| 事件顺序 (Order) | collision -> goal_reached -> none | collision -> none -> none | ❌ 不一致 |
失败分析:在这个案例里,机器人在冰面上连续滑动和碰撞的时间点算出来有偏差。因为我们看不到每步的中间状态,只能看最终结果,滑行的格数差了一点,导致模拟器认为机器人最后踩到了目标点 G,而实际上它应该在半路被挡住了。这说明遇到特别复杂的连续冰面滑动加多次碰撞的情况,我们的模拟逻辑还有改进空间。
案例 2:钥匙与门禁交互
初始网格及隐变量推断
初始网格地图 (12x12):# # # # # # # # # # # ## . I . . . . . ^ . . ## . I . . . . . . # . ## . I . . G < < . . P ## . A H . P K . . H # ## . . . . B I . . . H ## . . . . . . < . . # ## . . . . . H D . . . ## > . O I . . . . I I ## . . . # . I . . . . ## . v . . # . # . . # ## # # # # # # # # # # #- 探针推断结果:
- 法球 O 起始位置:
(10, 8) - 箱子 B 起始位置:
(5, 5) - 钥匙 K 起始位置:
(6, 4)
- 法球 O 起始位置:
反事实 Query 预测与对比
- 动作序列(Query ID:
wmli_tr_0003_795da62fbb_q0):R -> U -> R -> R -> U -> WAIT -> R -> L -> R -> WAIT -> U -> U -> U -> D -> WAIT -> WAIT -> R -> D -> WAIT -> U -> R -> L -> WAIT -> WAIT(共 24 步)
终局网格对比
预测终局网格 (Prediction): | 真实期望终局网格 (Expected):# # # # # # # # # # # # | # # # # # # # # # # # ## . I . . . . . ^ . . # | # . I . . . . . ^ . . ## . I . . . . A . # . # | # . I . . . . A . # . ## . I . . G < < . . P # | # . I . . G < < . . P ## . . H . P K . . H # # | # . . H . P K . . H # ## . . . . B I . . . H # | # . . . . B I . . . H ## . . . . . . < . . # # | # . . . . . . < . . # ## . . . . . H D . . . # | # . . . . . H D . . . ## > . . I . . . . I O # | # > . . I . . . . I O ## . . . # . I . . . . # | # . . . # . I . . . . ## . v . . # . # . . # # | # . v . . # . # . . # ## # # # # # # # # # # # | # # # # # # # # # # # #事件触发及属性对比
| 评判维度 | 预测值 | 真实期望值 | 结论 |
|---|---|---|---|
| 终止状态 (Terminal) | goal | goal | ✅ 一致 |
| 触发事件 (Events) | goal_reached, collision, hazard | goal_reached, collision, hazard | ✅ 一致 |
| 事件时序 (Timeline) | goal_reached:early, collision:mid, hazard:early | goal_reached:early, collision:mid, hazard:early | ✅ 一致 |
| 事件顺序 (Order) | hazard -> goal_reached -> collision | hazard -> goal_reached -> collision | ✅ 一致 |
案例 3:推箱子达标(Box on Goal)
初始网格及隐变量推断
初始网格地图 (12x12):# # # # # # # # # # # ## . ^ . . # . . . . A ## . . # . . K # . . . ## . . P . . . . . . . ## I . D . # . I # . B ## . . . ^ . . . . . . ## . . . ^ . . . . ^ P ## ^ . . . . . . # . . ## . I I . . . . . # G ## . . > I . . H . O . ## H . I . . . . v . I ## # # # # # # # # # # #- 探针推断结果:
- 法球 O 起始位置:
(9, 9) - 箱子 B 起始位置:
(10, 5) - 钥匙 K 起始位置:
(6, 2)
- 法球 O 起始位置:
反事实 Query 预测与对比
- 动作序列(Query ID:
wmli_tr_0403_ae91ae00d3_q0):D -> D -> D -> D -> D -> D -> D -> D -> L -> R -> U -> L -> WAIT -> L -> D -> L -> WAIT -> U -> WAIT -> WAIT(共 20 步)
终局网格对比
预测终局网格 (Prediction): | 真实期望终局网格 (Expected):# # # # # # # # # # # # | # # # # # # # # # # # ## . ^ . . # . . . . . # | # . ^ . . # . . . . . ## . . # . . K # . . . # | # . . # . . K # . . . ## . . P . . . . . . . # | # . . P . . . . . . . ## I . D . # . I # . . # | # I . D . # . I # . . ## . . . ^ . . . . . . # | # . . . ^ . . . . . . ## . . . ^ . . . . A P # | # . . . ^ . . . . A P ## ^ . . . . . . # . . # | # ^ . . . . . . # . . ## . I I . . . . . # G # | # . I I . . . . . # G ## . . > I . . H . O B # | # . . > I . . H . O B ## H . I . . . . v . I # | # H . I . . . . v . I ## # # # # # # # # # # # | # # # # # # # # # # # #事件触发及属性对比
| 评判维度 | 预测值 | 真实期望值 | 结论 |
|---|---|---|---|
| 终止状态 (Terminal) | goal | goal | ✅ 一致 |
| 触发事件 (Events) | goal_reached, collision, box_on_goal, portal_used | goal_reached, collision, box_on_goal, portal_used | ✅ 一致 |
| 事件时序 (Timeline) | goal_reached:mid, collision:early, box_on_goal:mid, portal_used:early | goal_reached:mid, collision:early, box_on_goal:mid, portal_used:early | ✅ 一致 |
| 事件顺序 (Order) | portal_used -> collision -> box_on_goal | portal_used -> collision -> box_on_goal | ✅ 一致 |
案例 4:传送门地图与碰撞阻挡
初始网格及隐变量推断
初始网格地图 (12x12):# # # # # # # # # # # ## H # # I H P . . . I ## . . . . D . . . . . ## . . v . I . . G . # ## . . # . . . . . . # ## < . . . . . . . I K ## . . . . . . . . I . ## . . I . . . . . ^ # ## . . . . . . . # . . ## . . A P . . B . > # ## . < . > . . . I O # ## # # # # # # # # # # #- 探针推断结果:
- 法球 O 起始位置:
(9, 10) - 箱子 B 起始位置:
(7, 9) - 钥匙 K 起始位置:
(10, 5)
- 法球 O 起始位置:
反事实 Query 预测与对比
- 动作序列(Query ID:
wmli_tr_0008_f4fecc7d21_q0):U -> U -> R -> R -> U -> U -> R -> R -> R -> R -> R -> R -> R -> WAIT -> WAIT -> U -> WAIT -> WAIT -> WAIT -> D(共 20 步)
终局网格对比
预测终局网格 (Prediction): | 真实期望终局网格 (Expected):# # # # # # # # # # # # | # # # # # # # # # # # ## H # # I H P . . . I # | # H # # I H P . . . I ## . . . . D . . . . . # | # . . . . D . . . . . ## . . v . I . . G . # # | # . . v . I . . G . # ## . . # . . . . . A # # | # . . # . . . . . A # ## < . . . . . . . I K # | # < . . . . . . . I K ## . . . . . . . . I . # | # . . . . . . . . I . ## . . I . . . . . ^ # # | # . . I . . . . . ^ # ## . . . . . . . # . . # | # . . . . . . . # . . ## . . . P . . B . > # # | # . . . P . . B . > # ## . < . > . . . I O # # | # . < . > . . . I O # ## # # # # # # # # # # # | # # # # # # # # # # # #事件触发及属性对比
| 评判维度 | 预测值 | 真实期望值 | 结论 |
|---|---|---|---|
| 终止状态 (Terminal) | blocked | blocked | ✅ 一致 |
| 触发事件 (Events) | collision | collision | ✅ 一致 |
| 事件时序 (Timeline) | collision:mid | collision:mid | ✅ 一致 |
| 事件顺序 (Order) | collision -> none -> none | collision -> none -> none | ✅ 一致 |
案例 5:陷阱/危险区触发
初始网格及隐变量推断
初始网格地图 (12x12):# # # # # # # # # # # ## . . # . . I D . . . ## . . . I # . # . . . ## . . P # . . ^ . . # ## . ^ . . . . # # . . ## # . . . . . . I . . ## A . . . . . I . v . ## H . B . H . O < . . ## . . . K . . H . . . ## . # . I . I P . v . ## . G . . . . # . # . ## # # # # # # # # # # #- 探针推断结果:
- 法球 O 起始位置:
(4, 7) - 箱子 B 起始位置:
(3, 7) - 钥匙 K 起始位置:
(4, 8)
- 法球 O 起始位置:
反事实 Query 预测与对比
- 动作序列(Query ID:
wmli_tr_0002_2da6dcbd20_q0):D -> R -> R -> R -> R -> R -> R -> L -> R -> D -> D -> L -> R -> L -> D -> U -> WAIT -> WAIT -> U(共 19 步)
终局网格对比
预测终局网格 (Prediction): | 真实期望终局网格 (Expected):# # # # # # # # # # # # | # # # # # # # # # # # ## . . # . . I D . . . # | # . . # . . I D . . . ## . . . I # . # . . . # | # . . . I # . # . . . ## . . P # . . ^ . . # # | # . . P # . . ^ . . # ## . ^ . . . . # # . . # | # . ^ . . . . # # . . ## # . . . . . . I . . # | # # . . . . . . I . . ## . . . . . . I . v . # | # . . . . . . I . v . ## A . B O H . . < . . # | # H . . B O . . < . . ## . . . K . . H . . . # | # . . A K . . H . . . ## . # . I . I P . v . # | # . # . I . I P . v . ## . G . . . . # . # . # | # . G . . . . # . # . ## # # # # # # # # # # # | # # # # # # # # # # # #事件触发及属性对比
| 评判维度 | 预测值 | 真实期望值 | 结论 |
|---|---|---|---|
| 终止状态 (Terminal) | hazard | hazard | ✅ 一致 |
| 触发事件 (Events) | collision, hazard | collision, hazard | ✅ 一致 |
| 事件时序 (Timeline) | collision:early, hazard:early | collision:early, hazard:early | ✅ 一致 |
| 事件顺序 (Order) | hazard -> collision -> none | hazard -> collision -> none | ✅ 一致 |
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时


















