Files
worldmodel/research/human_spatial_memory.md
T

20 KiB
Raw Blame History

人类空间记忆:大脑如何构建、存储与更新空间信息

研究目标:系统梳理人类大脑构建空间认知地图的神经机制,提取可工程化的设计原则,指导 PRISM 从 v1.5 升级至 v2.0。

版本:v1.0 | 日期:2026-05-17


0. 一句话

大脑用「稀疏编码的位置信号 + 周期性网格度量 + 分层巩固」三件套,在几瓦功耗下实现了终身空间记忆。PRISM 2.0 要做的就是把这三件套翻译成工程架构。


1. 核心神经系统:海马-内嗅皮层回路

人类空间记忆的核心硬件是海马体 (Hippocampus)内嗅皮层 (Entorhinal Cortex) 组成的回路。这个回路在哺乳动物中高度保守——老鼠、猴子、人类的导航系统原理相同。

                     ┌──────────────────────┐
                     │   内嗅皮层 (MEC)      │
                     │  ┌──────┬──────┬───┐ │
                     │  │Grid  │Head  │   │ │
                     │  │Cells │Dir.  │…  │ │
                     │  └──────┴──────┴───┘ │
                     └──────────┬───────────┘
                                │ 输入
                     ┌──────────▼───────────┐
                     │   海马体              │
                     │  DG → CA3 → CA1      │
                     │  ┌──────┬──────┬───┐ │
                     │  │Place │Time  │…  │ │
                     │  │Cells │Cells │   │ │
                     │  └──────┴──────┴───┘ │
                     └──────────┬───────────┘
                                │ 输出
                     ┌──────────▼───────────┐
                     │   新皮层 (PFC等)      │
                     │   长期存储            │
                     └──────────────────────┘

2. 五种基础空间细胞类型

2.1 位置细胞 (Place Cells) — 你在哪里

属性 说明
位置 海马体 CA1 / CA3
行为 当动物进入特定位置时放电,每个细胞只对应一个或几个位置域 (place field)
编码 稀疏编码——海马体中只有 ~2-5% 的神经元对当前位置活跃
关键特性 位置域在进入新环境几分钟内形成,且一旦形成就相对稳定
重映射 (Remapping) 环境改变后,同一群神经元会重新分配到新位置——这是"新地图"的神经信号

工程启发PRISM 应该为每个"位置"维护稀疏的视觉指纹(已有 clip_embedding),但需要支持快速形成新位置表征 + 环境变化时触发重映射

2.2 网格细胞 (Grid Cells) — 走了多远、什么方向

属性 说明
位置 内侧内嗅皮层 (medial Entorhinal Cortex, MEC)
行为 多个空间周期性地放电,形成正六边形网格
编码 每个细胞有特定的间距 (spacing)、方向 (orientation) 和相位 (phase)
层级性 不同网格细胞的间距从 ~30 cm 到数米不等,间距越大越靠 MEC 背侧
通用性 网格表征跨环境通用——同一个网格细胞在不同房间里保持相同的间距和方向

工程启发:这是 PRISM 当前最缺的一层。L2 的 OctoMap / TSDF 是纯笛卡尔坐标,没有网格细胞那种"泛化度量"。应该增加一个 GridMetric 层——由多个不同间距的周期编码叠加,实现跨房间的度量泛化。

2.3 头方向细胞 (Head Direction Cells) — 面向哪边

属性 说明
位置 多个脑区(前背侧丘脑、后下托、MEC 等)
行为 只对特定头部方向放电,与位置和速度无关
编码 360° 环形吸引子网络,每个细胞调谐到特定角度

工程启发:ZED VIO 已提供朝向,但缺少与空间记忆的直接耦合。PRISM 2.0 应该让朝向信号与位置表征联合编码(而非仅作为 Pose 的一个分量)。

2.4 边界细胞 (Boundary Cells) — 离墙多远

属性 说明
位置 下托 (Subiculum)、MEC
行为 在距环境边界特定距离处放电;部分编码距最近墙的距离,部分编码特定方位的墙
功能 定义环境的几何框架——没有它,位置细胞就无法稳定地重新映射

工程启发iPhone RoomPlan 输出的墙/隔断 = 天然边界。PRISM 2.0 应在 L2 初始化时显式计算每个位置的边界距离特征,作为位置细胞形成的基础脚手架。

2.5 速度细胞 (Speed Cells) — 移动快慢

属性 说明
位置 MEC
行为 放电率线性正比于运行速度
功能 驱动网格细胞的相位更新——没有速度信号,网格就会"静止"

工程启发:ZED VIO 的速度估计可直接作为网格更新的驱动力。与路径积分 (path integration) 直接对应。


3. 海马体的两个核心操作:模式分离与模式完成

3.1 模式分离 (Pattern Separation) — "这两个房间不一样"

输入 ──→ 齿状回 (DG) ──→ CA3
         │
         大数量神经元 + 极稀疏活动
         → 相似的输入被"正交化"为不重叠的表征
场景 例子
两个布局相似的酒店房间 人不会搞混——DG 把相似的感知输入映射为不同的海马表征
同一个房间,家具挪了 CA3 仍然能认出(模式完成),但 DG 会标记"有变化"

工程启发PRISM 需要 DG 层——当 ZED 进入一个与已有 L3 节点视觉相似但实际不同的房间时,DG 层应该强制新建节点而非错误地"认出"旧节点。当前只有 clip_embedding 做相似度匹配,缺少正交化步骤。

3.2 模式完成 (Pattern Completion) — "我只看到床角,但知道这是卧室"

部分线索 ──→ CA3 (自联想网络) ──→ 完整记忆
              │
              CA3 有丰富的递归连接
              → 部分输入即可激活整个记忆模式
场景 例子
重定位 只看到房间一角,就能识别是哪个房间(PRISM Pipeline B 的核心需求)
弱光/遮挡 部分视野被遮挡,仍然能导航

工程启发:PRISM 的重定位模块已经在做类似的事(CLIP embedding 匹配),但缺少 CA3 风格的递归完成——即用部分匹配激活的节点反过来"期望"看到哪些物品,再去 L4 验证,形成一个双向确认循环。


4. 记忆的三种时态:工作 → 短期 → 长期

人类的空间记忆不是"存进去就完事",而是沿着时间轴经历了三种状态:

感知输入
  │
  ▼
┌────────────────┐
│ 工作记忆 (WM)  │  ← 前额叶皮层 + 海马体
│ 秒 ~ 分钟      │     容量有限 (4±1 chunks)
│ 当前任务上下文  │     表征当前导航目标、最近经过的路标
└────────┬───────┘
         │ 注意筛选 (只有"重要的"往下走)
         ▼
┌────────────────┐
│ 短期记忆 (STM) │  ← 海马体依赖
│ 小时 ~ 天      │     突触可塑性 (LTP/LTD)
│ 今天的经历      │     快速编码,但不稳定
└────────┬───────┘
         │ 睡眠巩固 (海马→皮层转移)
         │ 去重 + 与旧知识整合
         ▼
┌────────────────┐
│ 长期记忆 (LTM) │  ← 新皮层(前额叶、颞叶等)
│ 周 ~ 年 ~ 终身 │     结构可塑性(树突棘稳定化)
│ 稳定的知识      │     半永久存储
└────────────────┘

三层的关键区别(PRISM 映射)

维度 WM STM LTM PRISM 当前对应
时间 秒~分钟 小时~天 周~终身 L1/WM ✓ / L2-L4(部分) / 缺STM显式层
容量 极小 有限 几乎无限
可塑性 随时覆盖 可修改 难修改
依赖 注意力 海马体 皮层
遗忘 瞬时 干扰/衰减 极少

工程启发PRISM 目前只有 L1 (WM-like) 和"其他全算持久化"。缺失了中间的 STM 层——即"今天见到但还没巩固"的状态。这导致差异检测 (delta/) 直接写死而非可恢复的临时标记。


5. 系统巩固:睡眠中把记忆从海马搬到皮层

5.1 标准巩固模型 (Standard Consolidation Model)

睡眠 / 安静清醒时:

海马体 ──Sharp-Wave Ripples (SWR)──→ 新皮层
 │                                      │
 以 10-20× 加速重播                          缓慢调整突触权重
 白天的轨迹                                   把"昨天发生的事"
                                              变成"已知的事实"

关键发现:

  • 海马重播 (Replay):清醒时经历的轨迹在 NREM 睡眠期间被压缩到 ~100 ms 的 SWR 事件中快速重放
  • 皮层巩固:每次重播驱动皮层突触的微小变化,经多次睡眠周期后形成稳定表征
  • 去重与抽象:大脑不是逐字记录——重播过程会抽取共性、丢弃细节、与已有知识整合

5.2 补充学习系统理论 (Complementary Learning Systems, CLS)

海马体系统 皮层系统
学习速度 快速(一次经历即可) 慢速(需要多次重复)
表征 稀疏、分离(防止干扰) 重叠、压缩(提取统计规律)
作用 记忆特定事件 学习通用知识
类比 内存(快但容小) 硬盘(慢但容大)

工程启发:Pipeline D(充电巩固)已经捕获了"睡眠"的直觉,但缺少两个核心操作:

  1. 显式重播——不是简单地 "delta 变永久",而是重新走过白天的路径,用重播后的表征更新各层
  2. 双系统学习——新增物体先以"快速、稀疏、可能有噪声"的形式写入,Consolidator 再以"慢速、去噪、整合"的模式转入长期

6. 预测编码:大脑是预测机器

6.1 核心思想

         ┌────── 自上而下的预测 ──────┐
         │                             │
    高层表征                          感知输入
         │                             │
         └────── 自下而上的误差 ←──────┘

大脑不断生成对下一刻的预测 → 对比实际输入 → 只把"意外"(预测误差)向上传。

6.2 空间导航中的预测

预测类型 例子 脑区
感官预测 "转过去应该看到沙发" 感觉皮层 ↔ 海马体
运动预测 "走 10 步应该到门口" 小脑 + MEC
物体预测 "卧室里应该有一张床" 前额叶 + 海马体

当预测失败(打开门发现房间被重新布置了)→ 预测误差信号 → 触发注意 + 学习 + 记忆更新

工程启发PRISM 当前是被动接受数据——ZED 来了就写,差异检测只是"发现了"就记录。缺少主动预测层。PRISM 2.0 应该在每帧都生成"期望看到什么",只有当偏差超过阈值才触发写入和更新。


7. 记忆更新:再巩固而非覆写

7.1 重新巩固 (Reconsolidation)

经典模型认为记忆"巩固后就稳定了"。2000 年后的研究发现:已被巩固的记忆在被再次激活(回忆)时,会短暂回到不稳定状态,允许修改后再重新巩固。

稳定记忆 ──回忆触发──→ 不稳定状态 ──整合新信息──→ 再巩固(更新版)
                        │
                        └── 如果不重新巩固 → 记忆消退

对 PRISM 的启示:

  • 当 ZED 重新观察到 L4 中的一个已知物品时 → 不应直接覆写,而是先"解锁"该记忆,融合新观测,再"重新封印"
  • 连续观测不一致 → 降低 confidence 而非直接删除
  • 已标记 moved 的物品 → 短暂进入"可修改窗口",允许位置更新

7.2 去稳定化的条件

什么导致一个记忆变得可修改?

条件 神经机制 PRISM 对应
预测误差 打开门,床不在原位 → LC 释放去甲肾上腺素 delta/ 差异检测
新奇性 出现不认识的物品 → 海马体 CA1 强响应 未匹配到 L4 节点的新检测
上下文变化 同样的房间但灯光/时间不同 时间戳跨度大 + 场景视觉差异大

工程启发PRISM 需要显式的 Reconsolidation Flag——不是所有差异都立即写,而是先标记"待重新协商",在 Consolidator 阶段才决定采纳/部分采纳/拒绝。


8. 双流视觉加工:Where 通路 vs What 通路

8.1 两条通路

背侧通路 (Dorsal) 腹侧通路 (Ventral)
俗称 Where / How What
路径 初级视皮层 → 后顶叶 初级视皮层 → 颞下回
表征 以自我为中心 (egocentric) 以物体为中心 (allocentric)
功能 引导动作、伸手抓取、避障 物体识别、语义理解
速度 快、实时 慢、需要"辨认"
记忆 不持久 可持久

8.2 两条通路在海马体汇合

海马体是 where + what 的汇合点——它同时接收来自两条通路的信息,把它们绑定成一个"在某个地方有某个东西"的完整记忆(episodic memory 的核心)。

工程启发PRISM 的 L2 (度量/where) 和 L4 (语义/what) 已经体现了两条通路,但缺少海马体式的汇合层——即把一个物品和它的精确位置绑定为一个不可分割的 episode。当前物品的位置只是 L4Node 的一个 pose 字段,而非与 L2 几何深度耦合的绑定。


9. 空间注意力与显著性

9.1 大脑不记录所有东西

每秒钟视网膜输入 ~10^8 bit,但只有 ~10^1-10^2 bit 进入意识/记忆。大脑通过显著性过滤器决定什么值得记住:

过滤器 机制 例子
空间新奇 新房间、新走廊 → 海马体强编码 第一次进酒店大堂
物体新奇 没见过的东西 → 多巴胺释放 新放的装饰品
变化检测 预期被违反 → 预测误差 椅子不在原来位置
目标相关 当前任务相关的物品 → 前额叶偏置 找遥控器时注意茶几
情感标记 情感事件 → 杏仁核调节记忆强度 (机器人场景不适用)

9.2 显著性 → 编码强度

不是所有的经历都以相同精度存储。高显著性事件 → 更强的突触可塑性 → 更持久、更精确的记忆。低显著性 → 只保留模糊的统计信息。

工程启发PRISM 需要一个 Salience Gate——不是 2 Hz 的 VLM 检测全部写入,而是根据"这个检测有多意外/多重要"动态决定写入精度和持久性


10. 最新研究进展 (2020-2025)

10.1 继任表征 (Successor Representations)

内嗅皮层不只编码"当前位置",还编码从当前位置出发,未来可能访问的状态——即对环境的"预测地图"。

  • 一个位置的 SR 不只看那个位置本身,而是编码"从这里最容易到达哪里"
  • 这解释了为什么人能瞬间判断"从卧室到厨房要经过走廊"而不需要显式跑 A*

工程启发PRISM 的 L3 边目前只存 cost (距离/难度)。PRISM 2.0 应存储 SR 向量——从每个房间到所有其他房间的期望到达频率,让路径规划从 A* 降级为一次矩阵乘法。

10.2 物体向量细胞 (Object-Vector Cells)

MEC 中发现了一类新细胞:当动物处于某个物体(如障碍物)的特定方向和距离时放电。

  • 与位置细胞不同——它不关心绝对位置,而是相对于地标的位置
  • 解释了为什么人能"走离沙发两米然后右转"而不需要看地图

工程启发PRISM 2.0 的 L2 应增加 Landmark-Relative Coordinates——不仅存全局位姿,还存相对于最近锚点物体 (L4 家具) 的位置。这在 GPS 不可用场景下比纯 VIO 更鲁棒。

10.3 社交位置细胞 (Social Place Cells)

海马体有专门编码"另一个人(或物体)所在位置"的神经元——空间记忆天然是社会性的

工程启发:多机器人场景下,PRISM 应为每个机器人/人维护一个独立的位置轨迹——"小明在厨房" 成为一个可查询的 L4 属性。

10.4 认知地图的泛化

2024-2025 年的研究表明,海马-内嗅系统的"认知地图"不仅编码物理空间,还编码抽象空间——概念距离、社交关系、甚至图表结构。同一套神经机制在不同领域重复使用。

工程启发:PRISM 的架构可能不仅适用于物理空间——如果抽象得好,同一个 Schema 可以扩展为机器人对"任务流"、"时间线"、甚至"技能树"的记忆。


11. 总结:从大脑到 PRISM 2.0 的设计原则

# 神经机制 当前 PRISM 1.5 → PRISM 2.0 优先级
A 网格细胞:跨环境的度量泛化 缺失 新增 GridMetric 层 P0
B 模式分离 (DG):区分相似场景 只有 CLIP 相似度 新增正交化模块 P0
C 模式完成 (CA3):部分线索→完整回忆 ⚠️ 单向匹配 改为双向递归确认 P1
D 预测编码:预期→误差驱动更新 被动写入 新增预测层 P0
E 系统巩固:海马重播 + CLS 双系统 ⚠️ Pipeline D 太粗糙 显式重播 + 快慢双系统 P1
F 再巩固:解锁→更新→重新封印 直接覆写 引入 Reconsolidation 流程 P1
G 显著性门控:不是所有东西都该记 全量写入 新增 Salience Gate P1
H 继任表征:预测未来状态 只有 A* L3 边存储 SR 向量 P2
I 物体向量细胞:地标相对定位 只有全局位姿 L2 增加地标相对坐标 P2
J 边界细胞:以墙为骨架 ⚠️ 房间 polygon 显式计算边界距离特征 P1
K Where/What 汇合:位置-物品绑定 ⚠️ 松散关联 紧耦合 episodic binding P2

P0 = 必须在 2.0 实现,P1 = 2.0 应包含,P2 = 2.1 或后续


12. 关键参考

发现 年份 核心贡献 诺贝尔奖
位置细胞 (O'Keefe & Dostrovsky) 1971 海马体编码空间位置 2014
认知地图 (Tolman) 1948 动物形成内部空间表征,不仅靠刺激-反应
网格细胞 (Hafting, Fyhn, Molden, Moser & Moser) 2005 内嗅皮层六边形网格编码 2014
头方向细胞 (Taube, Muller, Ranck) 1990 独立于位置的方向编码
边界细胞 (Solstad et al. / Lever et al.) 2008 距边界特定距离放电
系统巩固 (McClelland, McNaughton, O'Reilly) 1995 互补学习系统 (CLS) 理论
海马重播 (Wilson & McNaughton / Skaggs & McNaughton) 1994-1996 睡眠 SWR 中重播清醒轨迹
再巩固 (Nader, Schafe, LeDoux) 2000 已巩固记忆可被重新不稳定化
预测编码 (Rao & Ballard / Friston) 1999-2005 大脑通过预测误差驱动学习
继任表征 (Stachenfeld, Botvinick, Gershman / Momennejad et al.) 2017-2022 内嗅皮层编码预测性地图
物体向量细胞 (Høydal, Skytøen, Andersson, Moser & Moser) 2019 相对地标的方向和距离编码
Lyra 2.0 (Shen et al., NVIDIA) 2026 几何只做路由不做合成

文档版本v1.0 撰写日期2026-05-17 下一步:将此文档中的 P0/P1 原则转化为 plans/PRISM/20_v2_upgrade.md 的具体架构改动