news 2026/6/9 23:51:08

MoE架构

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MoE架构

🍋🍋AI学习🍋🍋

🔥系列专栏: 👑哲学语录: 用力所能及,改变世界。
💖如果觉得博主的文章还不错的话,请点赞👍+收藏⭐️+留言📝支持一下博主哦🤞


一、Decoder-only原始架构

在MoE中,decoder-only就是改造的前馈神经网络层。

二、MoE图解

三、前向传播过程

Top-k (k=1 或 2)为例:

1、计算路由权重

2、选择专家

  • 取权重最大的 k 个专家,得到索引集合 S(x)。

3、专家前向

  • 对选中的每个专家 e:

4、加权合并

五、MoE的优势

1、参数量大,计算量可控

(1)普通 Transformer:每次前向传播都要用到所有参数,想增加容量就必须增加计算量。

(2)MoE:可以把参数拆分成 N 个“专家”,每个 token 只激活Top-k个专家(常见 k=1 或 2)。

(3)计算量 ≈ k/N × 总参数量,总参数可以做到数百亿甚至上万亿,而实际每步计算只相当于几十亿

2、表达能力更强

不同专家可以学习不同的子任务/语义模式(例如语法、数学、代码、图像描述等)。

通过 gating 机制,每个 token 动态选择专家 →条件计算 (conditional computation), 类似于“如果输入属于某类特征,就让某些专家专门处理”

3、训练与扩展灵活

易于扩展:只需增加专家数量即可增加模型容量,而计算成本几乎不变。

模块化训练:专家可以并行分布到不同 GPU/节点,方便大规模分布式训练。

局部更新:理论上可以只更新某些专家以实现增量学习或领域适配。

4、更好的多样性与鲁棒性

由于专家学习到不同的特征空间,模型在面对分布外数据时往往更有鲁棒性。

对长尾任务更友好:稀有任务可能被特定专家捕获,而不会被主流任务“淹没”。

六、常见变体

  • Switch Transformer:Top-1 路由,最简单高效。

  • GShard:Top-2 路由 + 负载均衡 loss。

  • Mixtral、DeepSeek-MoE:更大规模专家、改进 gating、共享路由策略。

  • Shared MoE / Residual MoE:增加共享专家或残差,稳定训练。

七、总结

MoE 的前馈网络内部仍然是“升维→激活→降维”的 FFN, 区别在于:

不止一个 FFN,而是多个专家并存,由门控网络为每个 token 动态选择少数专家执行, 这样可以在保持计算成本可控的同时显著扩大模型容量与表示能力。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/6/10 13:08:28

17、深入探讨DevOps:概念、挑战与未来趋势

深入探讨DevOps:概念、挑战与未来趋势 1. 嘉宾介绍 Gregory Bledsoe近期加入了MThree Consulting,主要致力于帮助企业实现敏捷转型交付。此前,他在SolutionsIQ担任敏捷、精益和DevOps顾问,还撰写了大量关于DevSecOps、内核和虚拟化的文章,可在Twitter上通过@geek_king找…

作者头像 李华
网站建设 2026/6/10 13:07:45

CJ1M-CPU11-ETN可编程式控制器

CJ1M-CPU11-ETN 是欧姆龙(OMRON)CJ1M 系列的小型可编程逻辑控制器(PLC)中的 CPU 模块,广泛用于中小型自动化系统中,实现逻辑控制、数据处理及网络通讯。以下是详细信息整理:CJ1M-CPU11-ETN 主要…

作者头像 李华
网站建设 2026/6/10 13:07:14

国内做TikTok怎么变现?主流变现模式全解析

TikTok已经成为全球最大的短视频平台之一,拥有超过15亿月活用户,对于国内出海个人、团队和商家来说是一个极具潜力的变现渠道。今天我们整合主流变现方式,按照路径分类细化每种模式应具备的必要条件、操作技巧、适合人群,助你从 0…

作者头像 李华
网站建设 2026/6/10 13:04:56

MDSKSRS071-03伺服电机

MDSKSRS071-03 是三菱(Mitsubishi)系列的伺服电机型号,属于高性能交流伺服电机,通常配合伺服驱动器使用,用于精确位置、速度和扭矩控制的自动化系统。以下是详细信息整理:MDSKSRS071-03 伺服电机主要特点高…

作者头像 李华
网站建设 2026/6/10 10:22:11

3.抽象类、接口、内部类

抽象类、接口、内部类 一、抽象类为子类提供一个通用的模版和框架,定义一些通用的逻辑或规范,同时允许子类根据需要实现具体功能。1、抽象类不能被实例化。 2、抽象类应该至少有一个抽象方法,否则它没有任何意义。 3、抽象类中的抽象方法没有…

作者头像 李华
网站建设 2026/6/10 0:43:19

Kafka简介

kafka简介: Kafka是由Apache软件基金会开发的一个开源流处理平台,由Scala和Java编写。Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者在网站中的所有动作流数据。 这种动作(网页浏览,搜索和其他用户的…

作者头像 李华