第二代类脑认知架构:从"液态神经网络"到"液态认知栈"
Cortex(C1)不是 Transformer 的补丁,也不是 MT-LNN 的简单升级——它是从大脑皮层分层结构出发的完整认知架构,把"感知流处理、O(1) 工作记忆、稀疏时间路由、预测编码学习、强化学习涌现"组织成一条五层认知栈。
核心信念:智能不是"下一个 token 预测得更准",而是像大脑一样——只对当下真正重要的信号放电,用 O(1) 状态记住本质,用预测误差驱动学习,用奖赏信号涌现推理。
MT-LNN 证明了"微管液态动力学"能在小规模上跑通:O(1) 内存(8063× @1M 上下文)、跨窗口记忆(0.56 vs 注意力 0.000)、长文本抗噪(×2.0 @T=229)。但它仍然是"用液态网络替换注意力层"——架构还停在"层"的层面。
C1 的跃迁:从"替换层"到"重做认知栈"。
大脑皮层分六层,每层分工不同(输入、联合、工作区、预测、输出、自上而下调节)。C1 用五层认知栈对应这个结构——不是把注意力换成液体,而是让整个信息流按皮层的组织方式运转。
皮层分层 ↕ C1 五层栈
L4 输入层 → L1 感知流原生处理(SensoryFrontend)
L2/3 工作区 → L2 O(1) 液态工作记忆
L5 联合层 → L3 稀疏时间尺度路由(13原丝 × N尺度)
L2/3 预测 → L4 多尺度预测编码
L5/6 输出+调节 → L5 RL 推理涌现 + 系统1/2双轨
DeepSeek 和 Kimi 在同一堵墙前给出了两个答案:DeepSeek 优化"单 token 成本"(MLA 省缓存、MoE 省参数、FP8 省训练),Kimi 优化"整段上下文利用率"(长链推理、原生多模态)。两者共同确认了:稀疏激活、预测式学习、RL 涌现是行业共识方向。
C1 的翻译:
| 行业方向(DeepSeek/Kimi) | C1 的类脑实现 | 状态 |
|---|---|---|
| MLA 压缩 KV 缓存 | O(1) 液态工作记忆——不是压缩缓存,是消除缓存 | ✅ 已验证(8063×) |
| MoE 参数稀疏 | 稀疏时间尺度路由——不是少用参数,是少算 | ✅ 已验证(+7.9% CPU) |
| MTP 多 token 预测 | 多尺度预测编码(k 步前瞻升级) | 🟡 升级中 |
| GRPO 纯 RL 涌现推理 | 液态 GRPO——在液态动力学上做组相对策略优化 | 🔴 首个实验 |
| 系统1/系统2 双轨 | DualSpeedSentry 快反射 + 慢思考(已有) | ✅ 已验证 |
核心差异:DeepSeek/Kimi 在 transformer 框架内做工程优化;C1 在液态框架内做架构重构——它们优化"墙内效率",我们重做"墙本身"。
docs/
ARCHITECTURE_C1.md # 五层认知栈完整 spec
STRATEGY_VS_DEEPSEEK_KIMI.md # 迭代逻辑分析与启示
EXPERIMENT_E1_LIQUID_GRPO.md # 液态 GRPO(RL 涌现推理,对标 R1)
EXPERIMENT_E2_MTP.md # MTP 前瞻预测(对标 DeepSeek MTP)
EXPERIMENT_E3_TEMPORAL_SCALING.md # 时间尺度扩容(液态版 MoE 实验)
ROADMAP.md # 实验路线图
experiments/
e1_liquid_grpo.py # E1 可跑脚本(parity + GRPO + 长度外推评估)
e2_mtp.py # E2 可跑脚本(baseline/mtp/state-mtp)
e3_temporal_scaling.py # E3 可跑脚本(n_scales x topk 矩阵)
README.md
- 🔴 规划中:三个实验已设计并编码(E1/E2/E3),待 GPU 验证
- 🟢 进行中:125M 收敛 + selective_decay A/B(DGX Spark)
- 借鉴基础:MT-LNN 已验证的 O(1) 内存 / 跨窗口记忆 / 稀疏共振 / 预测编码
C1 = Cortex = 大脑皮层 = 高级认知的家。