- 处理: 74 个 .md 文件 - 跳过: 0 个(无已存在的 front matter) - 异常: 3 个(H1 缺失,用文件名兜底) - plans/PRISM/.research/readmes/3d-llm.md - plans/PRISM/.research/readmes/openmask3d.md - plans/PRISM/.research/readmes/openscene.md
20 KiB
title, date, draft, tags, categories
| title | date | draft | tags | categories | ||||
|---|---|---|---|---|---|---|---|---|
| 人类空间记忆:大脑如何构建、存储与更新空间信息 | 2026-05-20 | false |
|
|
人类空间记忆:大脑如何构建、存储与更新空间信息
研究目标:系统梳理人类大脑构建空间认知地图的神经机制,提取可工程化的设计原则,指导 PRISM 从 v1.5 升级至 v2.0。
版本:v1.0 | 日期:2026-05-17
0. 一句话
大脑用「稀疏编码的位置信号 + 周期性网格度量 + 分层巩固」三件套,在几瓦功耗下实现了终身空间记忆。PRISM 2.0 要做的就是把这三件套翻译成工程架构。
1. 核心神经系统:海马-内嗅皮层回路
人类空间记忆的核心硬件是海马体 (Hippocampus) 和内嗅皮层 (Entorhinal Cortex) 组成的回路。这个回路在哺乳动物中高度保守——老鼠、猴子、人类的导航系统原理相同。
┌──────────────────────┐
│ 内嗅皮层 (MEC) │
│ ┌──────┬──────┬───┐ │
│ │Grid │Head │ │ │
│ │Cells │Dir. │… │ │
│ └──────┴──────┴───┘ │
└──────────┬───────────┘
│ 输入
┌──────────▼───────────┐
│ 海马体 │
│ DG → CA3 → CA1 │
│ ┌──────┬──────┬───┐ │
│ │Place │Time │… │ │
│ │Cells │Cells │ │ │
│ └──────┴──────┴───┘ │
└──────────┬───────────┘
│ 输出
┌──────────▼───────────┐
│ 新皮层 (PFC等) │
│ 长期存储 │
└──────────────────────┘
2. 五种基础空间细胞类型
2.1 位置细胞 (Place Cells) — 你在哪里
| 属性 | 说明 |
|---|---|
| 位置 | 海马体 CA1 / CA3 |
| 行为 | 当动物进入特定位置时放电,每个细胞只对应一个或几个位置域 (place field) |
| 编码 | 稀疏编码——海马体中只有 ~2-5% 的神经元对当前位置活跃 |
| 关键特性 | 位置域在进入新环境几分钟内形成,且一旦形成就相对稳定 |
| 重映射 (Remapping) | 环境改变后,同一群神经元会重新分配到新位置——这是"新地图"的神经信号 |
工程启发:PRISM 应该为每个"位置"维护稀疏的视觉指纹(已有 clip_embedding),但需要支持快速形成新位置表征 + 环境变化时触发重映射。
2.2 网格细胞 (Grid Cells) — 走了多远、什么方向
| 属性 | 说明 |
|---|---|
| 位置 | 内侧内嗅皮层 (medial Entorhinal Cortex, MEC) |
| 行为 | 多个空间周期性地放电,形成正六边形网格 |
| 编码 | 每个细胞有特定的间距 (spacing)、方向 (orientation) 和相位 (phase) |
| 层级性 | 不同网格细胞的间距从 ~30 cm 到数米不等,间距越大越靠 MEC 背侧 |
| 通用性 | 网格表征跨环境通用——同一个网格细胞在不同房间里保持相同的间距和方向 |
工程启发:这是 PRISM 当前最缺的一层。L2 的 OctoMap / TSDF 是纯笛卡尔坐标,没有网格细胞那种"泛化度量"。应该增加一个 GridMetric 层——由多个不同间距的周期编码叠加,实现跨房间的度量泛化。
2.3 头方向细胞 (Head Direction Cells) — 面向哪边
| 属性 | 说明 |
|---|---|
| 位置 | 多个脑区(前背侧丘脑、后下托、MEC 等) |
| 行为 | 只对特定头部方向放电,与位置和速度无关 |
| 编码 | 360° 环形吸引子网络,每个细胞调谐到特定角度 |
工程启发:ZED VIO 已提供朝向,但缺少与空间记忆的直接耦合。PRISM 2.0 应该让朝向信号与位置表征联合编码(而非仅作为 Pose 的一个分量)。
2.4 边界细胞 (Boundary Cells) — 离墙多远
| 属性 | 说明 |
|---|---|
| 位置 | 下托 (Subiculum)、MEC |
| 行为 | 在距环境边界特定距离处放电;部分编码距最近墙的距离,部分编码特定方位的墙 |
| 功能 | 定义环境的几何框架——没有它,位置细胞就无法稳定地重新映射 |
工程启发:iPhone RoomPlan 输出的墙/隔断 = 天然边界。PRISM 2.0 应在 L2 初始化时显式计算每个位置的边界距离特征,作为位置细胞形成的基础脚手架。
2.5 速度细胞 (Speed Cells) — 移动快慢
| 属性 | 说明 |
|---|---|
| 位置 | MEC |
| 行为 | 放电率线性正比于运行速度 |
| 功能 | 驱动网格细胞的相位更新——没有速度信号,网格就会"静止" |
工程启发:ZED VIO 的速度估计可直接作为网格更新的驱动力。与路径积分 (path integration) 直接对应。
3. 海马体的两个核心操作:模式分离与模式完成
3.1 模式分离 (Pattern Separation) — "这两个房间不一样"
输入 ──→ 齿状回 (DG) ──→ CA3
│
大数量神经元 + 极稀疏活动
→ 相似的输入被"正交化"为不重叠的表征
| 场景 | 例子 |
|---|---|
| 两个布局相似的酒店房间 | 人不会搞混——DG 把相似的感知输入映射为不同的海马表征 |
| 同一个房间,家具挪了 | CA3 仍然能认出(模式完成),但 DG 会标记"有变化" |
工程启发:PRISM 需要 DG 层——当 ZED 进入一个与已有 L3 节点视觉相似但实际不同的房间时,DG 层应该强制新建节点而非错误地"认出"旧节点。当前只有
clip_embedding做相似度匹配,缺少正交化步骤。
3.2 模式完成 (Pattern Completion) — "我只看到床角,但知道这是卧室"
部分线索 ──→ CA3 (自联想网络) ──→ 完整记忆
│
CA3 有丰富的递归连接
→ 部分输入即可激活整个记忆模式
| 场景 | 例子 |
|---|---|
| 重定位 | 只看到房间一角,就能识别是哪个房间(PRISM Pipeline B 的核心需求) |
| 弱光/遮挡 | 部分视野被遮挡,仍然能导航 |
工程启发:PRISM 的重定位模块已经在做类似的事(CLIP embedding 匹配),但缺少 CA3 风格的递归完成——即用部分匹配激活的节点反过来"期望"看到哪些物品,再去 L4 验证,形成一个双向确认循环。
4. 记忆的三种时态:工作 → 短期 → 长期
人类的空间记忆不是"存进去就完事",而是沿着时间轴经历了三种状态:
感知输入
│
▼
┌────────────────┐
│ 工作记忆 (WM) │ ← 前额叶皮层 + 海马体
│ 秒 ~ 分钟 │ 容量有限 (4±1 chunks)
│ 当前任务上下文 │ 表征当前导航目标、最近经过的路标
└────────┬───────┘
│ 注意筛选 (只有"重要的"往下走)
▼
┌────────────────┐
│ 短期记忆 (STM) │ ← 海马体依赖
│ 小时 ~ 天 │ 突触可塑性 (LTP/LTD)
│ 今天的经历 │ 快速编码,但不稳定
└────────┬───────┘
│ 睡眠巩固 (海马→皮层转移)
│ 去重 + 与旧知识整合
▼
┌────────────────┐
│ 长期记忆 (LTM) │ ← 新皮层(前额叶、颞叶等)
│ 周 ~ 年 ~ 终身 │ 结构可塑性(树突棘稳定化)
│ 稳定的知识 │ 半永久存储
└────────────────┘
三层的关键区别(PRISM 映射)
| 维度 | WM | STM | LTM | PRISM 当前对应 |
|---|---|---|---|---|
| 时间 | 秒~分钟 | 小时~天 | 周~终身 | L1/WM ✓ / L2-L4(部分) / 缺STM显式层 |
| 容量 | 极小 | 有限 | 几乎无限 | — |
| 可塑性 | 随时覆盖 | 可修改 | 难修改 | — |
| 依赖 | 注意力 | 海马体 | 皮层 | — |
| 遗忘 | 瞬时 | 干扰/衰减 | 极少 | — |
工程启发:PRISM 目前只有 L1 (WM-like) 和"其他全算持久化"。缺失了中间的 STM 层——即"今天见到但还没巩固"的状态。这导致差异检测 (
delta/) 直接写死而非可恢复的临时标记。
5. 系统巩固:睡眠中把记忆从海马搬到皮层
5.1 标准巩固模型 (Standard Consolidation Model)
睡眠 / 安静清醒时:
海马体 ──Sharp-Wave Ripples (SWR)──→ 新皮层
│ │
以 10-20× 加速重播 缓慢调整突触权重
白天的轨迹 把"昨天发生的事"
变成"已知的事实"
关键发现:
- 海马重播 (Replay):清醒时经历的轨迹在 NREM 睡眠期间被压缩到 ~100 ms 的 SWR 事件中快速重放
- 皮层巩固:每次重播驱动皮层突触的微小变化,经多次睡眠周期后形成稳定表征
- 去重与抽象:大脑不是逐字记录——重播过程会抽取共性、丢弃细节、与已有知识整合
5.2 补充学习系统理论 (Complementary Learning Systems, CLS)
| 海马体系统 | 皮层系统 | |
|---|---|---|
| 学习速度 | 快速(一次经历即可) | 慢速(需要多次重复) |
| 表征 | 稀疏、分离(防止干扰) | 重叠、压缩(提取统计规律) |
| 作用 | 记忆特定事件 | 学习通用知识 |
| 类比 | 内存(快但容小) | 硬盘(慢但容大) |
工程启发:Pipeline D(充电巩固)已经捕获了"睡眠"的直觉,但缺少两个核心操作:
- 显式重播——不是简单地 "delta 变永久",而是重新走过白天的路径,用重播后的表征更新各层
- 双系统学习——新增物体先以"快速、稀疏、可能有噪声"的形式写入,Consolidator 再以"慢速、去噪、整合"的模式转入长期
6. 预测编码:大脑是预测机器
6.1 核心思想
┌────── 自上而下的预测 ──────┐
│ │
高层表征 感知输入
│ │
└────── 自下而上的误差 ←──────┘
大脑不断生成对下一刻的预测 → 对比实际输入 → 只把"意外"(预测误差)向上传。
6.2 空间导航中的预测
| 预测类型 | 例子 | 脑区 |
|---|---|---|
| 感官预测 | "转过去应该看到沙发" | 感觉皮层 ↔ 海马体 |
| 运动预测 | "走 10 步应该到门口" | 小脑 + MEC |
| 物体预测 | "卧室里应该有一张床" | 前额叶 + 海马体 |
当预测失败(打开门发现房间被重新布置了)→ 预测误差信号 → 触发注意 + 学习 + 记忆更新。
工程启发:PRISM 当前是被动接受数据——ZED 来了就写,差异检测只是"发现了"就记录。缺少主动预测层。PRISM 2.0 应该在每帧都生成"期望看到什么",只有当偏差超过阈值才触发写入和更新。
7. 记忆更新:再巩固而非覆写
7.1 重新巩固 (Reconsolidation)
经典模型认为记忆"巩固后就稳定了"。2000 年后的研究发现:已被巩固的记忆在被再次激活(回忆)时,会短暂回到不稳定状态,允许修改后再重新巩固。
稳定记忆 ──回忆触发──→ 不稳定状态 ──整合新信息──→ 再巩固(更新版)
│
└── 如果不重新巩固 → 记忆消退
对 PRISM 的启示:
- 当 ZED 重新观察到 L4 中的一个已知物品时 → 不应直接覆写,而是先"解锁"该记忆,融合新观测,再"重新封印"
- 连续观测不一致 → 降低 confidence 而非直接删除
- 已标记
moved的物品 → 短暂进入"可修改窗口",允许位置更新
7.2 去稳定化的条件
什么导致一个记忆变得可修改?
| 条件 | 神经机制 | PRISM 对应 |
|---|---|---|
| 预测误差 | 打开门,床不在原位 → LC 释放去甲肾上腺素 | delta/ 差异检测 |
| 新奇性 | 出现不认识的物品 → 海马体 CA1 强响应 | 未匹配到 L4 节点的新检测 |
| 上下文变化 | 同样的房间但灯光/时间不同 | 时间戳跨度大 + 场景视觉差异大 |
工程启发:PRISM 需要显式的 Reconsolidation Flag——不是所有差异都立即写,而是先标记"待重新协商",在 Consolidator 阶段才决定采纳/部分采纳/拒绝。
8. 双流视觉加工:Where 通路 vs What 通路
8.1 两条通路
| 背侧通路 (Dorsal) | 腹侧通路 (Ventral) | |
|---|---|---|
| 俗称 | Where / How | What |
| 路径 | 初级视皮层 → 后顶叶 | 初级视皮层 → 颞下回 |
| 表征 | 以自我为中心 (egocentric) | 以物体为中心 (allocentric) |
| 功能 | 引导动作、伸手抓取、避障 | 物体识别、语义理解 |
| 速度 | 快、实时 | 慢、需要"辨认" |
| 记忆 | 不持久 | 可持久 |
8.2 两条通路在海马体汇合
海马体是 where + what 的汇合点——它同时接收来自两条通路的信息,把它们绑定成一个"在某个地方有某个东西"的完整记忆(episodic memory 的核心)。
工程启发:PRISM 的 L2 (度量/where) 和 L4 (语义/what) 已经体现了两条通路,但缺少海马体式的汇合层——即把一个物品和它的精确位置绑定为一个不可分割的 episode。当前物品的位置只是 L4Node 的一个
pose字段,而非与 L2 几何深度耦合的绑定。
9. 空间注意力与显著性
9.1 大脑不记录所有东西
每秒钟视网膜输入 ~10^8 bit,但只有 ~10^1-10^2 bit 进入意识/记忆。大脑通过显著性过滤器决定什么值得记住:
| 过滤器 | 机制 | 例子 |
|---|---|---|
| 空间新奇 | 新房间、新走廊 → 海马体强编码 | 第一次进酒店大堂 |
| 物体新奇 | 没见过的东西 → 多巴胺释放 | 新放的装饰品 |
| 变化检测 | 预期被违反 → 预测误差 | 椅子不在原来位置 |
| 目标相关 | 当前任务相关的物品 → 前额叶偏置 | 找遥控器时注意茶几 |
| 情感标记 | 情感事件 → 杏仁核调节记忆强度 | (机器人场景不适用) |
9.2 显著性 → 编码强度
不是所有的经历都以相同精度存储。高显著性事件 → 更强的突触可塑性 → 更持久、更精确的记忆。低显著性 → 只保留模糊的统计信息。
工程启发:PRISM 需要一个 Salience Gate——不是 2 Hz 的 VLM 检测全部写入,而是根据"这个检测有多意外/多重要"动态决定写入精度和持久性。
10. 最新研究进展 (2020-2025)
10.1 继任表征 (Successor Representations)
内嗅皮层不只编码"当前位置",还编码从当前位置出发,未来可能访问的状态——即对环境的"预测地图"。
- 一个位置的 SR 不只看那个位置本身,而是编码"从这里最容易到达哪里"
- 这解释了为什么人能瞬间判断"从卧室到厨房要经过走廊"而不需要显式跑 A*
工程启发:PRISM 的 L3 边目前只存
cost(距离/难度)。PRISM 2.0 应存储 SR 向量——从每个房间到所有其他房间的期望到达频率,让路径规划从 A* 降级为一次矩阵乘法。
10.2 物体向量细胞 (Object-Vector Cells)
MEC 中发现了一类新细胞:当动物处于某个物体(如障碍物)的特定方向和距离时放电。
- 与位置细胞不同——它不关心绝对位置,而是相对于地标的位置
- 解释了为什么人能"走离沙发两米然后右转"而不需要看地图
工程启发:PRISM 2.0 的 L2 应增加 Landmark-Relative Coordinates——不仅存全局位姿,还存相对于最近锚点物体 (L4 家具) 的位置。这在 GPS 不可用场景下比纯 VIO 更鲁棒。
10.3 社交位置细胞 (Social Place Cells)
海马体有专门编码"另一个人(或物体)所在位置"的神经元——空间记忆天然是社会性的。
工程启发:多机器人场景下,PRISM 应为每个机器人/人维护一个独立的位置轨迹——"小明在厨房" 成为一个可查询的 L4 属性。
10.4 认知地图的泛化
2024-2025 年的研究表明,海马-内嗅系统的"认知地图"不仅编码物理空间,还编码抽象空间——概念距离、社交关系、甚至图表结构。同一套神经机制在不同领域重复使用。
工程启发:PRISM 的架构可能不仅适用于物理空间——如果抽象得好,同一个 Schema 可以扩展为机器人对"任务流"、"时间线"、甚至"技能树"的记忆。
11. 总结:从大脑到 PRISM 2.0 的设计原则
| # | 神经机制 | 当前 PRISM 1.5 | → PRISM 2.0 | 优先级 |
|---|---|---|---|---|
| A | 网格细胞:跨环境的度量泛化 | ❌ 缺失 | 新增 GridMetric 层 | P0 |
| B | 模式分离 (DG):区分相似场景 | ❌ 只有 CLIP 相似度 | 新增正交化模块 | P0 |
| C | 模式完成 (CA3):部分线索→完整回忆 | ⚠️ 单向匹配 | 改为双向递归确认 | P1 |
| D | 预测编码:预期→误差驱动更新 | ❌ 被动写入 | 新增预测层 | P0 |
| E | 系统巩固:海马重播 + CLS 双系统 | ⚠️ Pipeline D 太粗糙 | 显式重播 + 快慢双系统 | P1 |
| F | 再巩固:解锁→更新→重新封印 | ❌ 直接覆写 | 引入 Reconsolidation 流程 | P1 |
| G | 显著性门控:不是所有东西都该记 | ❌ 全量写入 | 新增 Salience Gate | P1 |
| H | 继任表征:预测未来状态 | ❌ 只有 A* | L3 边存储 SR 向量 | P2 |
| I | 物体向量细胞:地标相对定位 | ❌ 只有全局位姿 | L2 增加地标相对坐标 | P2 |
| J | 边界细胞:以墙为骨架 | ⚠️ 房间 polygon | 显式计算边界距离特征 | P1 |
| K | Where/What 汇合:位置-物品绑定 | ⚠️ 松散关联 | 紧耦合 episodic binding | P2 |
P0 = 必须在 2.0 实现,P1 = 2.0 应包含,P2 = 2.1 或后续
12. 关键参考
| 发现 | 年份 | 核心贡献 | 诺贝尔奖 |
|---|---|---|---|
| 位置细胞 (O'Keefe & Dostrovsky) | 1971 | 海马体编码空间位置 | 2014 |
| 认知地图 (Tolman) | 1948 | 动物形成内部空间表征,不仅靠刺激-反应 | — |
| 网格细胞 (Hafting, Fyhn, Molden, Moser & Moser) | 2005 | 内嗅皮层六边形网格编码 | 2014 |
| 头方向细胞 (Taube, Muller, Ranck) | 1990 | 独立于位置的方向编码 | — |
| 边界细胞 (Solstad et al. / Lever et al.) | 2008 | 距边界特定距离放电 | — |
| 系统巩固 (McClelland, McNaughton, O'Reilly) | 1995 | 互补学习系统 (CLS) 理论 | — |
| 海马重播 (Wilson & McNaughton / Skaggs & McNaughton) | 1994-1996 | 睡眠 SWR 中重播清醒轨迹 | — |
| 再巩固 (Nader, Schafe, LeDoux) | 2000 | 已巩固记忆可被重新不稳定化 | — |
| 预测编码 (Rao & Ballard / Friston) | 1999-2005 | 大脑通过预测误差驱动学习 | — |
| 继任表征 (Stachenfeld, Botvinick, Gershman / Momennejad et al.) | 2017-2022 | 内嗅皮层编码预测性地图 | — |
| 物体向量细胞 (Høydal, Skytøen, Andersson, Moser & Moser) | 2019 | 相对地标的方向和距离编码 | — |
| Lyra 2.0 (Shen et al., NVIDIA) | 2026 | 几何只做路由不做合成 | — |
文档版本:v1.0
撰写日期:2026-05-17
下一步:将此文档中的 P0/P1 原则转化为 plans/PRISM/20_v2_upgrade.md 的具体架构改动