研究 · 暂未产品化
联邦 MoE 愿景
最后更新:2026-07-18
// 初衷
今天每一个强大的 AI 都跑在一家公司的数据中心里。我们认为不一定非得如此。
MeshMoE 源于一个简单的问题:
如果一个前沿模型是 MoE —— 内部有许多专家 —— 那这些专家能不能拆分到家用电脑上?每个节点贡献一个专家。合在一起就构成一个完整的 GPT 级模型。
"Mesh of Experts" —— Mesh(网络)of Experts(架构)。名字就是这么来的。
// 为什么这很难(诚实地说)
2026 年还没有项目跑通过这个。原因是物理层面的:
1. 跨互联网 MoE 延迟
DeepSeek-V3 生成一个 token 需要在路由器 → 专家 → 聚合之间跳 100–200 次。跨广域网 RTT 50–200ms 意味着每个 token 要 5–40 秒。实时对话根本没法用。
2. 跨节点 KV cache 同步
Transformer 的 KV cache 必须在层之间传输。跨广域网的带宽和延迟都有问题。
3. 容错与反欺诈
当一个节点崩溃或返回垃圾时,如何不让推理崩掉?如何验证一个节点真的运行了专家(而不是返回随机文本来骗积分)?
4. 路由器训练
MoE 路由器是在训练中学出来的。如果专家池变化(节点上下线),路由器如何动态适应?
// 当前技术水平(2026)
- Petals —— 分布式分层切分(不是专家切分)。9K stars,实测"仅适合批处理"。
- exo —— 把你自己的设备组集群。20K+ stars,但是"自用",非共享。
- distributed-llama —— 基于 llama.cpp。2K stars,轻量。
- 联邦 MoE 专家切分 —— 0 个项目跑通过。
我们调研过。没找到先例。这就是空白。也是机会 —— 但也是真实的挑战。
// MeshMoE 的路径:产品先行,研究在上
我们不是在联邦 MoE 上冷启动(物理上还做不到产品级)。但我们的产品架构为它的成长预留了空间:
- 当前产品:节点跑稠密小模型(DeepSeek-R1-Distill-14B)。分布式稠密推理,不是联邦 MoE。
- 长期研究:节点跑大 MoE 模型的单个专家。需要解决延迟、KV cache、容错、路由器。
// 为什么 MeshMoE 是天然的试验场
- 已经有真实的节点网络(今天:稠密小模型;未来:专家)。
- 已经有路由器 + 调度器(联邦 MoE 需要的核心组件)。
- 已经有计费 + 信誉(激励节点贡献专家)。
- 开源客户端(研究者可以在真实的 MeshMoE 节点上做实验)。
// 我们欢迎什么
如果你在研究:
- 分布式 MoE 推理协议(专家激活的节点协调)
- 跨节点 KV cache 传输优化(压缩、预测)
- 拜占庭容错推理(验证节点真的运行了工作)
- 动态路由器训练(随专家池变化而适应)
- 批处理模式联邦 MoE(延迟容忍 —— 可能最先成熟)
你做研究,我们出网络。 联系:research@meshmoe.com
// 我们不会做什么
- ❌ 假装已经解决(许多项目炒作"去中心化 AI";我们不卖空气)。
- ❌ 把它当卖点卖(产品卖的是"边缘小模型,云价格的 70%",不是"革命性的联邦 MoE")。
- ❌ 单独闭门搞 6–12 个月(会饿死主产品)。
- ❌ 发币 / 挖矿(监管红线)。
"AI 革命终将是分布式的。否则它就不是一场革命。"
← 返回 meshmoe.com