← 返回主页

🧠 类脑计算

SmolVLA × 认知神经科学 结构映射 | Z-MAX 技术文档

📷 VLM — 腹侧通路 (What: 识别理解)

视觉信号从视网膜到语义理解,对应12层Vision + 16层Language

👁️ 视觉编码器 (Vision Encoder 12层)

层级🧠 脑区神经原理SmolVLA 实现参数
Embed视网膜
LGN
光子→电信号
中心-周边拮抗
PatchEmbed Conv2d(3→768)
PositionEmbedding
0.6M
0.8M
L0-2V1 (17区)朝向选择柱
Gabor滤波器
SelfAttn(768) + MLP(768→3072)21M
L3-5V2轮廓整合
纹理分割
SelfAttn(768) + MLP(768→3072)21M
L6-8V4颜色恒常性
形状识别
SelfAttn(768) + MLP(768→3072)21M
L9-11IT (颞下皮层)祖母细胞
语义分类
SelfAttn(768) + MLP(768→3072)21M

🔗 跨模态连接

角回 Angular GyrusConnector Linear(12288→960) — 视觉空间→语言空间

📝 语言编码器 (Text Model 16层)

层级🧠 脑区神经原理SmolVLA 实现参数
Embed梭状回字形→语义映射Embedding(49152→960)47M
L0-7Wernicke区语音理解
语义整合
LlamaDecoder ×8
SelfAttn(960)+MLP(2560)
78M
L8-15Broca区语法加工
意图生成
LlamaDecoder ×8
SelfAttn(960)+MLP(2560)
78M

🤖 Expert — 背侧通路 (Where: 空间定位)

16层交错注意力,每2层切换:奇数层读VLM(Cross-Attn),偶数层自整理(Self-Attn)

层号🧠 脑区注意力神经原理SmolVLA 实现参数
L0PPC 后顶叶Cross视觉-空间坐标转换CrossAttn 读VLM-L06.3M
L1PMC 前运动Self动作序列预演SelfAttn(960)+MLP6.0M
L2PPCCross多感觉整合CrossAttn 读VLM-L26.3M
L3PMCSelf运动块分割SelfAttn(960)+MLP6.0M
... 交替16层 ...
L14M1 初级运动Cross精细运动编码CrossAttn 读VLM-L146.3M
L15脊髓前角Self最终运动输出SelfAttn(960)+MLP6.0M

🎯 Flow Matching — 皮层下运动控制

组件🧠 脑区神经原理SmolVLA 实现参数
state_proj丘脑 VA/VL核感觉→运动中继Linear(32→960)0.03M
time_mlp_in基底节 直接通路噪声→动作候选Linear(1440→720)+SiLU1.0M
time_mlp_out基底节 间接通路精炼,抑制多余Linear(720→720)0.5M
ODE 10步积分小脑皮层轨迹平滑Euler积分 ×10步
min_period=4ms橄榄核40Hz时序基准正弦位置编码下界
max_period=4s纹状体长时序窗口正弦位置编码上界

📊 参数总览

VLM (腹侧)

350M

Vision 86M + Connector 12M + Text 204M + lm_head 47M

Expert (背侧)

98M

16层 LlamaDecoder × 960维 × 0.75宽度

Flow Head

1.5M

state_proj + action_proj + time_mlp

总计

450M

可训练 100M (Expert+Head) | 冻结 350M (VLM)

⚡ SmolVLA vs 人脑

维度🧠 人脑🤖 SmolVLA差距
并行度10¹¹ 突触层内并行10⁶ ×
反馈连接V1↔IT↔PPC 处处反馈纯前馈 ❌关键缺失
学习方式Hebb + 多巴胺梯度下降无在线学习
多模态视+触+本体+前庭视+语缺触觉
预测持续预测编码一次去噪无持续预测
能耗~20W150W GPU
参数~100T 突触450M20万×