当下的前沿模型 —— DeepSeek-V3、GLM-5.2、Qwen3 —— 全是 MoE(Mixture of Experts,混合专家)架构。 智能不存在于一个巨大的脑里,而是很多小专家协同,由路由器按任务调度。 我们意识到:这不就是互联网的样子吗?
亿万台家用 PC、游戏主机、工作站 —— 每台都有闲置的 GPU 时间。 今天这些算力被白白浪费。Mesh 意味着把它们连成一个统一的、可寻址的网络, 没有任何中心服务器独占算力。
路由器看到每个请求,选最合适的专家处理。DeepSeek-V3 内部用 256 个神经专家这么干。 MeshMoE 在外部这么干 —— 你的请求被路由到对的节点、对的模型、对的算力档位。
| MoE 模型内部 | MeshMoE 网络 | |
|---|---|---|
| 专家 | 256 个小神经网络 | N 台家用电脑,每台跑一个模型 |
| 路由器 | 训练出来的门控网络 | 我们的调度器:信誉·负载·延迟·在线率 |
| 稀疏激活 | 每 token 选 8/256 个专家 | 每请求选 1 个最匹配的节点 |
| 总容量 | 671B 参数 | 无上限 —— 随节点增加而增长 |
| 所有者 | 一家公司 | 没有所有者 —— 公共基础设施 |
这不是营销话术,是同一个想法在不同尺度上的两次实例。 让 37B 激活参数打出 671B 效果的架构, 正是让一堆小电脑打出数据中心效果的架构。
你只需要选 mesh-pro(或其他档位),MeshMoE 读懂你的问题后自动选最优模型。 中转站按价格转发,我们按能力匹配——这就是区别。
// 我们不伪造数据。今天确实小。成为前 100 个节点之一。
节点客户端开源 (MIT)。运行前可以审计——不挖矿、不窃取数据、只做你让它做的事。 手机充电时也能贡献,电脑后台赚取积分。只有真实的边缘命中才有收益。
Gemma-2B / Qwen2.5-1.5B。 充电+息屏时后台跑,接简单任务。人人可参与,降低门槛。积分 ×0.3。
Qwen3-8B / GLM-4-9B。 RTX 4070 / 3060 Ti。通用对话和快速任务。积分 ×1。
Qwen3-14B / Kimi-K2。 主力工作档,路由率最高。积分 ×3。
GLM-5 / Qwen3-32B / V4-Pro。 RTX 5090 / A6000 / DGX Spark / M5 Ultra。个人高端设备。深度推理+旗舰模型。积分 ×10。
你的节点服务请求时,按档位倍数积累分。积分可消费 mesh-pro/max/research,不可提现,仅限平台内使用。只有真实边缘命中才有收益——不空挂机白赚。
今天,每个节点跑一整个小模型 —— 这是"粗粒度的专家"。 梦想是更细粒度的:如果一台家用电脑能跑 671B 模型的一个专家呢? 256 户家庭,256 个专家,一个路由器 —— 互联网本身就成为一个前沿 AI。
这很难。Petals 试过分层切分(9K stars,实测"仅适合批处理")。 没人在跨广域网上跑通过专家切分。这一点我们诚实告知。 但 MeshMoE 网络 —— 它的路由器、调度器、信誉层、计费 —— 是任何最终解决这个问题的人,天然的试验场。
如果你是研究分布式 MoE 推理、跨网 KV cache 同步、拜占庭容错推理、 或动态路由器训练的研究者 —— 联系我们。 我们出网络,你出协议。
一位有 30 年经验的律师,积攒了无数判例。一位医生,有几千份病例。 一位研究员,有从未发表过的内部笔记。GPT-4o 永远不会有这些知识 —— 因为这些数据从没上过网。
MeshMoE 未来的客户端,会让你微调自己的专家模型 (DeepSeek-R1-Distill + LoRA,本地训练 —— 数据从不离开你的电脑)。 这个专家加入网络,成为专门节点。别人调你的领域问题,路由器把请求派给你。 你的专业知识,睡觉时也在赚积分。
// 这才是真正的 Mesh of Experts —— 不是一种模型架构,而是人类专业知识蒸馏成机器的网络。
"AI 革命终将是分布式的。否则它就不是一场革命。"