MeshMoE
定价 文档 模型 K3部署 状态 赦免名单 登录 → MeshTok EN
研究 · 暂未产品化

联邦 MoE 愿景

最后更新:2026-07-18

// 初衷

今天每一个强大的 AI 都跑在一家公司的数据中心里。我们认为不一定非得如此。

MeshMoE 源于一个简单的问题:

如果一个前沿模型是 MoE —— 内部有许多专家 —— 那这些专家能不能拆分到家用电脑上?每个节点贡献一个专家。合在一起就构成一个完整的 GPT 级模型。

"Mesh of Experts" —— Mesh(网络)of Experts(架构)。名字就是这么来的。

// 为什么这很难(诚实地说)

2026 年还没有项目跑通过这个。原因是物理层面的:

1. 跨互联网 MoE 延迟

DeepSeek-V3 生成一个 token 需要在路由器 → 专家 → 聚合之间跳 100–200 次。跨广域网 RTT 50–200ms 意味着每个 token 要 5–40 秒。实时对话根本没法用。

2. 跨节点 KV cache 同步

Transformer 的 KV cache 必须在层之间传输。跨广域网的带宽和延迟都有问题。

3. 容错与反欺诈

当一个节点崩溃或返回垃圾时,如何不让推理崩掉?如何验证一个节点真的运行了专家(而不是返回随机文本来骗积分)?

4. 路由器训练

MoE 路由器是在训练中学出来的。如果专家池变化(节点上下线),路由器如何动态适应?

// 当前技术水平(2026)

  • Petals —— 分布式分层切分(不是专家切分)。9K stars,实测"仅适合批处理"。
  • exo —— 把你自己的设备组集群。20K+ stars,但是"自用",非共享。
  • distributed-llama —— 基于 llama.cpp。2K stars,轻量。
  • 联邦 MoE 专家切分 —— 0 个项目跑通过。

我们调研过。没找到先例。这就是空白。也是机会 —— 但也是真实的挑战。

// MeshMoE 的路径:产品先行,研究在上

我们不是在联邦 MoE 上冷启动(物理上还做不到产品级)。但我们的产品架构为它的成长预留了空间:

  • 当前产品:节点跑稠密小模型(DeepSeek-R1-Distill-14B)。分布式稠密推理,不是联邦 MoE。
  • 长期研究:节点跑大 MoE 模型的单个专家。需要解决延迟、KV cache、容错、路由器。

// 为什么 MeshMoE 是天然的试验场

  • 已经有真实的节点网络(今天:稠密小模型;未来:专家)。
  • 已经有路由器 + 调度器(联邦 MoE 需要的核心组件)。
  • 已经有计费 + 信誉(激励节点贡献专家)。
  • 开源客户端(研究者可以在真实的 MeshMoE 节点上做实验)。

// 我们欢迎什么

如果你在研究:

  • 分布式 MoE 推理协议(专家激活的节点协调)
  • 跨节点 KV cache 传输优化(压缩、预测)
  • 拜占庭容错推理(验证节点真的运行了工作)
  • 动态路由器训练(随专家池变化而适应)
  • 批处理模式联邦 MoE(延迟容忍 —— 可能最先成熟)

你做研究,我们出网络。 联系:research@meshmoe.com

// 我们不会做什么

  • ❌ 假装已经解决(许多项目炒作"去中心化 AI";我们不卖空气)。
  • ❌ 把它当卖点卖(产品卖的是"边缘小模型,云价格的 70%",不是"革命性的联邦 MoE")。
  • ❌ 单独闭门搞 6–12 个月(会饿死主产品)。
  • ❌ 发币 / 挖矿(监管红线)。

"AI 革命终将是分布式的。否则它就不是一场革命。"

← 返回 meshmoe.com

© 2026 MeshMoE · meshmoe.com