← 返回主页
Z-MAX v1.0.4 · 仿真联调
模型性能报告
Client/Server架构 · 三模型基准 · 实时仿真联调
仿真联调架构
┌─ 小芳 (Mac M1 · ROS2 Client) ─────────────────────┐
│ │
│ 📷 摄像头节点 → /camera/rgb │
│ 💪 力传感器 → /force_torque │
│ ✋ 触觉阵列 → /tactile │
│ 📡 接收Action ← /robot/action │
│ │
└────────────────────┬─────────────────────────────┘
│ gRPC / TCP Bridge
┌────────────────────┴─────────────────────────────┐
│ 静静 (WSL RTX4060 · gRPC Server) │
│ │
│ 🧠 SmolVLA 450M (~215ms/帧) │
│ 🧠 ACT 52M (~8.4ms/帧) │
│ 🧠 MLP-1024 (<5ms/帧) │
│ 📊 性能监控 · 数据记录 · 在线评估 │
│ │
└──────────────────────────────────────────────────┘
已训练模型总览
| 模型 | 数据集 | 步数 | 参数量 | 最终Loss | 降幅 |
| SmolVLA-FlowMatching | lerobot/pusht | 200 | 450M | 2.10 | — |
| SmolVLA-FlowMatching | lerobot/metaworld_mt50 | 300 | 450M | 2.10 | — |
| SmolVLA-MLP-1024 | lerobot/metaworld_mt50 | 500 | 14.7M | 0.085 | 81.1% |
推理性能基准
| 指标 | SmolVLA (450M) | ACT (52M) | MLP-1024 (14.7M) |
| GPU显存(加载) | 0.93 GB | 0.22 GB | — |
| GPU显存(峰值) | 0.97 GB | 0.28 GB | — |
| 推理延迟 | 214.7 ms | 8.4 ms | <5 ms |
| 帧率(FPS) | 4.7 | 119.2 | 200+ |
| 架构 | VLM+FlowMatching | Transformer | MLP-1024 |
测试环境: WSL2 · RTX 4060 8GB · CUDA 11.8 · PyTorch 2.7.1 | 延迟含GPU同步, 20轮平均, 预热5轮
适用场景推荐
| 场景 | 推荐模型 | 推理位置 | 延迟 | 原因 |
| 固定重复操作 | ACT 52M | Orin本地 | 8.4ms | 极快+省显存 |
| 多任务/多指令 | SmolVLA 450M | WSL(gRPC) | 215ms | VLM理解自然语言 |
| 快速原型验证 | MLP-1024 | Orin本地 | <5ms | 极简+极快 |
| 精细力控操作 | SmolVLA 450M | WSL(gRPC) | 215ms | FlowMatching轨迹平滑 |
| 离线仿真调试 | 任意 | WSL本地 | — | 无网络延迟 |
Client/Server 通信协议
| 信号 | 方向 | 格式 | 频率 | 带宽 |
| RGB图像 | Client→Server | 3×512×512, JPEG | 30Hz | ~2MB/s |
| 力/力矩 | Client→Server | float32[6] | 1000Hz | 24KB/s |
| 触觉阵列 | Client→Server | float32[16] | 100Hz | 6.4KB/s |
| 动作指令 | Server→Client | float32[50×6] | 10Hz | 12KB/s |
传输层: gRPC (protobuf) | 延迟预算: 网络<5ms + 推理=总延迟