Files
worldmodel/research/human_spatial_memory.md
T

395 lines
20 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 人类空间记忆:大脑如何构建、存储与更新空间信息
> 研究目标:系统梳理人类大脑构建空间认知地图的神经机制,提取可工程化的设计原则,指导 PRISM 从 v1.5 升级至 v2.0。
>
> 版本:v1.0 | 日期:2026-05-17
---
## 0. 一句话
> **大脑用「稀疏编码的位置信号 + 周期性网格度量 + 分层巩固」三件套,在几瓦功耗下实现了终身空间记忆。PRISM 2.0 要做的就是把这三件套翻译成工程架构。**
---
## 1. 核心神经系统:海马-内嗅皮层回路
人类空间记忆的核心硬件是**海马体 (Hippocampus)** 和**内嗅皮层 (Entorhinal Cortex)** 组成的回路。这个回路在哺乳动物中高度保守——老鼠、猴子、人类的导航系统原理相同。
```
┌──────────────────────┐
│ 内嗅皮层 (MEC) │
│ ┌──────┬──────┬───┐ │
│ │Grid │Head │ │ │
│ │Cells │Dir. │… │ │
│ └──────┴──────┴───┘ │
└──────────┬───────────┘
│ 输入
┌──────────▼───────────┐
│ 海马体 │
│ DG → CA3 → CA1 │
│ ┌──────┬──────┬───┐ │
│ │Place │Time │… │ │
│ │Cells │Cells │ │ │
│ └──────┴──────┴───┘ │
└──────────┬───────────┘
│ 输出
┌──────────▼───────────┐
│ 新皮层 (PFC等) │
│ 长期存储 │
└──────────────────────┘
```
---
## 2. 五种基础空间细胞类型
### 2.1 位置细胞 (Place Cells) — 你在哪里
| 属性 | 说明 |
|------|------|
| **位置** | 海马体 CA1 / CA3 |
| **行为** | 当动物进入特定位置时放电,每个细胞只对应一个或几个位置域 (place field) |
| **编码** | **稀疏编码**——海马体中只有 ~2-5% 的神经元对当前位置活跃 |
| **关键特性** | 位置域在进入新环境**几分钟内**形成,且一旦形成就相对稳定 |
| **重映射 (Remapping)** | 环境改变后,同一群神经元会重新分配到新位置——这是"新地图"的神经信号 |
> **工程启发**PRISM 应该为每个"位置"维护稀疏的视觉指纹(已有 clip_embedding),但需要支持**快速形成新位置表征 + 环境变化时触发重映射**。
### 2.2 网格细胞 (Grid Cells) — 走了多远、什么方向
| 属性 | 说明 |
|------|------|
| **位置** | 内侧内嗅皮层 (medial Entorhinal Cortex, MEC) |
| **行为** | 多个空间周期性地放电,形成**正六边形网格** |
| **编码** | 每个细胞有特定的间距 (spacing)、方向 (orientation) 和相位 (phase) |
| **层级性** | 不同网格细胞的间距从 ~30 cm 到数米不等,**间距越大越靠 MEC 背侧** |
| **通用性** | 网格表征**跨环境通用**——同一个网格细胞在不同房间里保持相同的间距和方向 |
> **工程启发**:这是 PRISM 当前**最缺的一层**。L2 的 OctoMap / TSDF 是纯笛卡尔坐标,没有网格细胞那种"泛化度量"。应该增加一个 **GridMetric 层**——由多个不同间距的周期编码叠加,实现跨房间的度量泛化。
### 2.3 头方向细胞 (Head Direction Cells) — 面向哪边
| 属性 | 说明 |
|------|------|
| **位置** | 多个脑区(前背侧丘脑、后下托、MEC 等) |
| **行为** | 只对特定头部方向放电,与位置和速度无关 |
| **编码** | 360° 环形吸引子网络,每个细胞调谐到特定角度 |
> **工程启发**:ZED VIO 已提供朝向,但缺少与空间记忆的直接耦合。PRISM 2.0 应该让朝向信号与位置表征**联合编码**(而非仅作为 Pose 的一个分量)。
### 2.4 边界细胞 (Boundary Cells) — 离墙多远
| 属性 | 说明 |
|------|------|
| **位置** | 下托 (Subiculum)、MEC |
| **行为** | 在距环境边界特定距离处放电;部分编码**距最近墙的距离**,部分编码**特定方位的墙** |
| **功能** | 定义环境的几何框架——没有它,位置细胞就无法稳定地重新映射 |
> **工程启发**iPhone RoomPlan 输出的墙/隔断 = 天然边界。PRISM 2.0 应在 L2 初始化时显式计算每个位置的**边界距离特征**,作为位置细胞形成的基础脚手架。
### 2.5 速度细胞 (Speed Cells) — 移动快慢
| 属性 | 说明 |
|------|------|
| **位置** | MEC |
| **行为** | 放电率线性正比于运行速度 |
| **功能** | 驱动网格细胞的相位更新——没有速度信号,网格就会"静止" |
> **工程启发**:ZED VIO 的速度估计可直接作为网格更新的驱动力。与路径积分 (path integration) 直接对应。
---
## 3. 海马体的两个核心操作:模式分离与模式完成
### 3.1 模式分离 (Pattern Separation) — "这两个房间不一样"
```
输入 ──→ 齿状回 (DG) ──→ CA3
大数量神经元 + 极稀疏活动
→ 相似的输入被"正交化"为不重叠的表征
```
| 场景 | 例子 |
|------|------|
| 两个布局相似的酒店房间 | 人不会搞混——DG 把相似的感知输入映射为不同的海马表征 |
| 同一个房间,家具挪了 | CA3 仍然能认出(模式完成),但 DG 会标记"有变化" |
> **工程启发**PRISM 需要 **DG 层**——当 ZED 进入一个与已有 L3 节点视觉相似但实际不同的房间时,DG 层应该强制新建节点而非错误地"认出"旧节点。当前只有 `clip_embedding` 做相似度匹配,缺少正交化步骤。
### 3.2 模式完成 (Pattern Completion) — "我只看到床角,但知道这是卧室"
```
部分线索 ──→ CA3 (自联想网络) ──→ 完整记忆
CA3 有丰富的递归连接
→ 部分输入即可激活整个记忆模式
```
| 场景 | 例子 |
|------|------|
| 重定位 | 只看到房间一角,就能识别是哪个房间(PRISM Pipeline B 的核心需求) |
| 弱光/遮挡 | 部分视野被遮挡,仍然能导航 |
> **工程启发**:PRISM 的重定位模块已经在做类似的事(CLIP embedding 匹配),但缺少 CA3 风格的**递归完成**——即用部分匹配激活的节点反过来"期望"看到哪些物品,再去 L4 验证,形成一个**双向确认**循环。
---
## 4. 记忆的三种时态:工作 → 短期 → 长期
人类的空间记忆不是"存进去就完事",而是沿着**时间轴**经历了三种状态:
```
感知输入
┌────────────────┐
│ 工作记忆 (WM) │ ← 前额叶皮层 + 海马体
│ 秒 ~ 分钟 │ 容量有限 (4±1 chunks)
│ 当前任务上下文 │ 表征当前导航目标、最近经过的路标
└────────┬───────┘
│ 注意筛选 (只有"重要的"往下走)
┌────────────────┐
│ 短期记忆 (STM) │ ← 海马体依赖
│ 小时 ~ 天 │ 突触可塑性 (LTP/LTD)
│ 今天的经历 │ 快速编码,但不稳定
└────────┬───────┘
│ 睡眠巩固 (海马→皮层转移)
│ 去重 + 与旧知识整合
┌────────────────┐
│ 长期记忆 (LTM) │ ← 新皮层(前额叶、颞叶等)
│ 周 ~ 年 ~ 终身 │ 结构可塑性(树突棘稳定化)
│ 稳定的知识 │ 半永久存储
└────────────────┘
```
### 三层的关键区别(PRISM 映射)
| 维度 | WM | STM | LTM | PRISM 当前对应 |
|------|----|-----|-----|---------------|
| **时间** | 秒~分钟 | 小时~天 | 周~终身 | L1/WM ✓ / L2-L4(部分) / 缺STM显式层 |
| **容量** | 极小 | 有限 | 几乎无限 | — |
| **可塑性** | 随时覆盖 | 可修改 | 难修改 | — |
| **依赖** | 注意力 | 海马体 | 皮层 | — |
| **遗忘** | 瞬时 | 干扰/衰减 | 极少 | — |
> **工程启发**PRISM 目前只有 L1 (WM-like) 和"其他全算持久化"。缺失了中间的 **STM 层**——即"今天见到但还没巩固"的状态。这导致差异检测 (`delta/`) 直接写死而非可恢复的临时标记。
---
## 5. 系统巩固:睡眠中把记忆从海马搬到皮层
### 5.1 标准巩固模型 (Standard Consolidation Model)
```
睡眠 / 安静清醒时:
海马体 ──Sharp-Wave Ripples (SWR)──→ 新皮层
│ │
以 10-20× 加速重播 缓慢调整突触权重
白天的轨迹 把"昨天发生的事"
变成"已知的事实"
```
关键发现:
- **海马重播 (Replay)**:清醒时经历的轨迹在 NREM 睡眠期间被压缩到 ~100 ms 的 SWR 事件中快速重放
- **皮层巩固**:每次重播驱动皮层突触的微小变化,经多次睡眠周期后形成稳定表征
- **去重与抽象**:大脑不是逐字记录——重播过程会**抽取共性、丢弃细节、与已有知识整合**
### 5.2 补充学习系统理论 (Complementary Learning Systems, CLS)
| | 海马体系统 | 皮层系统 |
|---|-----------|---------|
| **学习速度** | 快速(一次经历即可) | 慢速(需要多次重复) |
| **表征** | 稀疏、分离(防止干扰) | 重叠、压缩(提取统计规律) |
| **作用** | 记忆特定事件 | 学习通用知识 |
| **类比** | 内存(快但容小) | 硬盘(慢但容大) |
> **工程启发**:Pipeline D(充电巩固)已经捕获了"睡眠"的直觉,但缺少两个核心操作:
> 1. **显式重播**——不是简单地 "delta 变永久",而是**重新走过白天的路径**,用重播后的表征更新各层
> 2. **双系统学习**——新增物体先以"快速、稀疏、可能有噪声"的形式写入,Consolidator 再以"慢速、去噪、整合"的模式转入长期
---
## 6. 预测编码:大脑是预测机器
### 6.1 核心思想
```
┌────── 自上而下的预测 ──────┐
│ │
高层表征 感知输入
│ │
└────── 自下而上的误差 ←──────┘
大脑不断生成对下一刻的预测 → 对比实际输入 → 只把"意外"(预测误差)向上传。
```
### 6.2 空间导航中的预测
| 预测类型 | 例子 | 脑区 |
|---------|------|------|
| **感官预测** | "转过去应该看到沙发" | 感觉皮层 ↔ 海马体 |
| **运动预测** | "走 10 步应该到门口" | 小脑 + MEC |
| **物体预测** | "卧室里应该有一张床" | 前额叶 + 海马体 |
当预测失败(打开门发现房间被重新布置了)→ 预测误差信号 → 触发**注意 + 学习 + 记忆更新**。
> **工程启发**:PRISM 当前是**被动接受数据**——ZED 来了就写,差异检测只是"发现了"就记录。缺少**主动预测**层。PRISM 2.0 应该在每帧都生成"期望看到什么",只有当偏差超过阈值才触发写入和更新。
---
## 7. 记忆更新:再巩固而非覆写
### 7.1 重新巩固 (Reconsolidation)
经典模型认为记忆"巩固后就稳定了"。2000 年后的研究发现:**已被巩固的记忆在被再次激活(回忆)时,会短暂回到不稳定状态,允许修改后再重新巩固。**
```
稳定记忆 ──回忆触发──→ 不稳定状态 ──整合新信息──→ 再巩固(更新版)
└── 如果不重新巩固 → 记忆消退
```
对 PRISM 的启示:
- 当 ZED 重新观察到 L4 中的一个已知物品时 → 不应直接覆写,而是**先"解锁"该记忆,融合新观测,再"重新封印"**
- 连续观测不一致 → 降低 confidence 而非直接删除
- 已标记 `moved` 的物品 → 短暂进入"可修改窗口",允许位置更新
### 7.2 去稳定化的条件
什么导致一个记忆变得可修改?
| 条件 | 神经机制 | PRISM 对应 |
|------|---------|-----------|
| **预测误差** | 打开门,床不在原位 → LC 释放去甲肾上腺素 | `delta/` 差异检测 |
| **新奇性** | 出现不认识的物品 → 海马体 CA1 强响应 | 未匹配到 L4 节点的新检测 |
| **上下文变化** | 同样的房间但灯光/时间不同 | 时间戳跨度大 + 场景视觉差异大 |
> **工程启发**PRISM 需要显式的 **Reconsolidation Flag**——不是所有差异都立即写,而是先标记"待重新协商",在 Consolidator 阶段才决定采纳/部分采纳/拒绝。
---
## 8. 双流视觉加工:Where 通路 vs What 通路
### 8.1 两条通路
| | 背侧通路 (Dorsal) | 腹侧通路 (Ventral) |
|---|------------------|-------------------|
| **俗称** | Where / How | What |
| **路径** | 初级视皮层 → 后顶叶 | 初级视皮层 → 颞下回 |
| **表征** | 以自我为中心 (egocentric) | 以物体为中心 (allocentric) |
| **功能** | 引导动作、伸手抓取、避障 | 物体识别、语义理解 |
| **速度** | 快、实时 | 慢、需要"辨认" |
| **记忆** | 不持久 | 可持久 |
### 8.2 两条通路在海马体汇合
海马体是 where + what 的**汇合点**——它同时接收来自两条通路的信息,把它们绑定成一个"在某个地方有某个东西"的完整记忆(episodic memory 的核心)。
> **工程启发**PRISM 的 L2 (度量/where) 和 L4 (语义/what) 已经体现了两条通路,但**缺少海马体式的汇合层**——即把一个物品和它的精确位置绑定为一个不可分割的 episode。当前物品的位置只是 L4Node 的一个 `pose` 字段,而非与 L2 几何深度耦合的绑定。
---
## 9. 空间注意力与显著性
### 9.1 大脑不记录所有东西
每秒钟视网膜输入 ~10^8 bit,但只有 ~10^1-10^2 bit 进入意识/记忆。大脑通过**显著性过滤器**决定什么值得记住:
| 过滤器 | 机制 | 例子 |
|--------|------|------|
| **空间新奇** | 新房间、新走廊 → 海马体强编码 | 第一次进酒店大堂 |
| **物体新奇** | 没见过的东西 → 多巴胺释放 | 新放的装饰品 |
| **变化检测** | 预期被违反 → 预测误差 | 椅子不在原来位置 |
| **目标相关** | 当前任务相关的物品 → 前额叶偏置 | 找遥控器时注意茶几 |
| **情感标记** | 情感事件 → 杏仁核调节记忆强度 | (机器人场景不适用) |
### 9.2 显著性 → 编码强度
不是所有的经历都以相同精度存储。高显著性事件 → 更强的突触可塑性 → 更持久、更精确的记忆。低显著性 → 只保留模糊的统计信息。
> **工程启发**PRISM 需要一个 **Salience Gate**——不是 2 Hz 的 VLM 检测全部写入,而是根据"这个检测有多意外/多重要"动态决定**写入精度和持久性**。
---
## 10. 最新研究进展 (2020-2025)
### 10.1 继任表征 (Successor Representations)
内嗅皮层不只编码"当前位置",还编码**从当前位置出发,未来可能访问的状态**——即对环境的"预测地图"。
- 一个位置的 SR 不只看那个位置本身,而是编码"从这里最容易到达哪里"
- 这解释了为什么人能瞬间判断"从卧室到厨房要经过走廊"而不需要显式跑 A*
> **工程启发**PRISM 的 L3 边目前只存 `cost` (距离/难度)。PRISM 2.0 应存储 **SR 向量**——从每个房间到所有其他房间的**期望到达频率**,让路径规划从 A* 降级为一次矩阵乘法。
### 10.2 物体向量细胞 (Object-Vector Cells)
MEC 中发现了一类新细胞:当动物处于某个物体(如障碍物)的特定方向和距离时放电。
- 与位置细胞不同——它不关心绝对位置,而是**相对于地标的位置**
- 解释了为什么人能"走离沙发两米然后右转"而不需要看地图
> **工程启发**PRISM 2.0 的 L2 应增加 **Landmark-Relative Coordinates**——不仅存全局位姿,还存相对于最近锚点物体 (L4 家具) 的位置。这在 GPS 不可用场景下比纯 VIO 更鲁棒。
### 10.3 社交位置细胞 (Social Place Cells)
海马体有专门编码"另一个人(或物体)所在位置"的神经元——**空间记忆天然是社会性的**。
> **工程启发**:多机器人场景下,PRISM 应为每个机器人/人维护一个独立的位置轨迹——"小明在厨房" 成为一个可查询的 L4 属性。
### 10.4 认知地图的泛化
2024-2025 年的研究表明,海马-内嗅系统的"认知地图"不仅编码物理空间,还编码**抽象空间**——概念距离、社交关系、甚至图表结构。同一套神经机制在不同领域重复使用。
> **工程启发**:PRISM 的架构可能不仅适用于物理空间——如果抽象得好,同一个 Schema 可以扩展为机器人对"任务流"、"时间线"、甚至"技能树"的记忆。
---
## 11. 总结:从大脑到 PRISM 2.0 的设计原则
| # | 神经机制 | 当前 PRISM 1.5 | → PRISM 2.0 | 优先级 |
|---|---------|---------------|-------------|--------|
| A | 网格细胞:跨环境的度量泛化 | ❌ 缺失 | 新增 GridMetric 层 | **P0** |
| B | 模式分离 (DG):区分相似场景 | ❌ 只有 CLIP 相似度 | 新增正交化模块 | **P0** |
| C | 模式完成 (CA3):部分线索→完整回忆 | ⚠️ 单向匹配 | 改为双向递归确认 | P1 |
| D | 预测编码:预期→误差驱动更新 | ❌ 被动写入 | 新增预测层 | **P0** |
| E | 系统巩固:海马重播 + CLS 双系统 | ⚠️ Pipeline D 太粗糙 | 显式重播 + 快慢双系统 | P1 |
| F | 再巩固:解锁→更新→重新封印 | ❌ 直接覆写 | 引入 Reconsolidation 流程 | P1 |
| G | 显著性门控:不是所有东西都该记 | ❌ 全量写入 | 新增 Salience Gate | P1 |
| H | 继任表征:预测未来状态 | ❌ 只有 A* | L3 边存储 SR 向量 | P2 |
| I | 物体向量细胞:地标相对定位 | ❌ 只有全局位姿 | L2 增加地标相对坐标 | P2 |
| J | 边界细胞:以墙为骨架 | ⚠️ 房间 polygon | 显式计算边界距离特征 | P1 |
| K | Where/What 汇合:位置-物品绑定 | ⚠️ 松散关联 | 紧耦合 episodic binding | P2 |
**P0 = 必须在 2.0 实现,P1 = 2.0 应包含,P2 = 2.1 或后续**
---
## 12. 关键参考
| 发现 | 年份 | 核心贡献 | 诺贝尔奖 |
|------|------|---------|---------|
| 位置细胞 (O'Keefe & Dostrovsky) | 1971 | 海马体编码空间位置 | 2014 |
| 认知地图 (Tolman) | 1948 | 动物形成内部空间表征,不仅靠刺激-反应 | — |
| 网格细胞 (Hafting, Fyhn, Molden, Moser & Moser) | 2005 | 内嗅皮层六边形网格编码 | 2014 |
| 头方向细胞 (Taube, Muller, Ranck) | 1990 | 独立于位置的方向编码 | — |
| 边界细胞 (Solstad et al. / Lever et al.) | 2008 | 距边界特定距离放电 | — |
| 系统巩固 (McClelland, McNaughton, O'Reilly) | 1995 | 互补学习系统 (CLS) 理论 | — |
| 海马重播 (Wilson & McNaughton / Skaggs & McNaughton) | 1994-1996 | 睡眠 SWR 中重播清醒轨迹 | — |
| 再巩固 (Nader, Schafe, LeDoux) | 2000 | 已巩固记忆可被重新不稳定化 | — |
| 预测编码 (Rao & Ballard / Friston) | 1999-2005 | 大脑通过预测误差驱动学习 | — |
| 继任表征 (Stachenfeld, Botvinick, Gershman / Momennejad et al.) | 2017-2022 | 内嗅皮层编码预测性地图 | — |
| 物体向量细胞 (Høydal, Skytøen, Andersson, Moser & Moser) | 2019 | 相对地标的方向和距离编码 | — |
| Lyra 2.0 (Shen et al., NVIDIA) | 2026 | 几何只做路由不做合成 | — |
---
**文档版本**v1.0
**撰写日期**2026-05-17
**下一步**:将此文档中的 P0/P1 原则转化为 [`plans/PRISM/20_v2_upgrade.md`](../plans/PRISM/20_v2_upgrade.md) 的具体架构改动