📌
本期导读
本期导读
本期深度观察涵盖AI技术突破、大模型竞争格局、算力危机、科技巨头财报等多个维度。月之暗面Kimi创始人杨植麟在GTC 2026大会上首次完整披露K2.5技术路线图,引发业界广泛关注;小米深夜发布三款大模型,以极具竞争力的定价策略切入市场;DRAM短缺危机持续发酵,SK海力士预计缺口将持续至2030年;阿里云、百度智能云相继宣布涨价,算力成本上升正在重塑行业格局。本文将从技术、商业、产业三个层面,为您深度解读这些重大事件背后的逻辑与影响。
01
Kimi K2.5技术路线深度解析
三大底层架构重构引领大模型技术新范式
在2026年英伟达GTC大会上,月之暗面Kimi创始人杨植麟发表了题为《How We Scaled Kimi K2.5》的主题演讲,首次系统性披露了Kimi模型的完整技术路线图。这场演讲被业界视为大模型技术发展的重要里程碑,其中提出的三项底层架构重构——MuonClip优化器、Kimi Linear混合线性注意力架构、以及Attention Residuals跨层注意力机制,正在重新定义大模型训练与推理的技术边界。
💡
核心技术亮点
核心技术亮点
Kimi K2.5的三大技术突破分别针对大模型训练中的三个核心痛点:优化器效率、长上下文处理、以及信息传递机制。这些创新不仅带来了显著的性能提升,更重要的是为大模型技术的下一步发展指明了方向。
技术创新①
MuonClip优化器:打破Adam十年垄断
自2014年Kingma和Ba提出Adam优化器以来,这一算法已经成为深度学习领域的标准配置,统治了大模型训练整整十年。然而,随着模型规模进入万亿参数级别,Adam优化器的局限性日益凸显:内存占用过高、收敛速度瓶颈、以及在极端规模下的数值稳定性问题。
Kimi团队提出的MuonClip优化器,基于Keller Jordan提出的Muon优化器进行了深度改进。核心创新在于引入了Newton-Schulz迭代与QK-Clip机制,这两项技术共同解决了万亿参数规模训练中的Logits爆炸问题。具体而言,Newton-Schulz迭代提供了一种更高效的矩阵求逆近似方法,显著降低了优化器的计算复杂度;而QK-Clip机制则通过对Query和Key的梯度进行智能裁剪,有效防止了训练过程中的数值溢出。
📊
性能数据
性能数据
在同等硬件条件下,MuonClip优化器实现了2倍于传统AdamW的计算效率。这意味着训练一个万亿参数模型所需的计算资源和时间成本都可以减半,对于动辄数千万美元训练成本的大模型来说,这是一个具有革命性意义的突破。
从技术原理来看,MuonClip的改进主要体现在三个层面。首先是梯度计算的优化,传统的Adam优化器需要为每个参数维护一阶和二阶动量估计,这在万亿参数规模下会消耗巨大的内存。MuonClip通过引入Newton-Schulz迭代,将二阶矩估计的计算复杂度从O(n³)降低到接近O(n),同时保持了良好的收敛性质。其次是数值稳定性的增强,QK-Clip机制通过动态调整裁剪阈值,有效防止了训练过程中出现的梯度爆炸问题。最后是与分布式训练的兼容性,MuonClip针对数据并行和模型并行场景都进行了专门优化,使其能够高效运行于大规模GPU集群之上。
技术创新②
Kimi Linear:重新定义长上下文处理
长上下文能力是大模型实用化的关键指标之一。从早期的4K上下文,到后来的32K、128K,再到如今的1M甚至更长,上下文长度的扩展始终是技术研发的重点。然而,传统的全注意力机制(Full Attention)存在一个根本性的瓶颈:计算复杂度与序列长度的平方成正比,这使得长上下文处理的成本呈指数级增长。
Kimi Linear基于KDA(Kernelized Dot-Product Attention)架构,提出了混合线性注意力架构。这一架构的核心思想是:并非所有的注意力层都需要使用计算密集型的全注意力,通过在不同层之间智能分配全注意力和线性注意力,可以在保持模型能力的同时大幅降低计算开销。
🚀
性能突破
性能突破
在实际测试中,Kimi Linear在128K乃至1M超长上下文场景中,将解码速度提升了5到6倍。更重要的是,这种速度提升并没有以牺牲模型能力为代价——在多项长上下文理解基准测试中,Kimi K2.5的表现与使用全注意力的基线模型相当,甚至在某些任务上有所超越。
Kimi Linear的技术细节体现了工程实现与理论创新的完美结合。在线性注意力的实现上,团队采用了核技巧(Kernel Trick)来近似Softmax注意力,通过将注意力计算从O(n²)降低到O(n),实现了线性复杂度。关键在于特征映射函数的选择,Kimi团队经过大量实验,找到了既能保持表达能力又具备计算效率的最优映射方案。此外,混合架构的设计也颇具匠心,通过对不同层的重要性进行分析,团队发现深层网络更适合使用线性注意力,而浅层网络则需要保留全注意力以捕捉细粒度特征。
技术创新③
Attention Residuals:残差连接的进化
残差连接(Residual Connection)是深度学习领域的另一项基础性技术,由He等人于2015年提出,有效解决了深层神经网络的梯度消失问题。然而,传统的残差连接采用简单的等权叠加方式,即每一层都平等地从所有前序层接收信息。这种方式虽然简单有效,但在信息传递效率上存在明显不足。
Kimi提出的Attention Residuals将传统的等权叠加替换为跨层的Softmax注意力机制。这意味着每一层都可以主动、有选择性地从前序层提取信息,而不是被动地接收所有层的等量贡献。这种机制使得信息流动更加高效,模型能够更精准地整合不同层次的特征表示。
🔥
业界反响
业界反响
Attention Residuals发布后在业界引发广泛关注,多位重量级人物发表评论:
🚀 埃隆·马斯克:“令人印象深刻”
🧠 安德烈·卡帕西(前OpenAI联合创始人):“看来我们还没把『Attention is All You Need』按字面意思理解透”
⚡ Jerry Tworek(OpenAI o1主要发明者):称其为”深度学习2.0″的开端
杨植麟在演讲中表示,Kimi将坚持开源路径,把MuonClip、Kimi Linear和Attention Residuals等底层创新贡献给开源社区。这一决定体现了一家技术驱动型公司的责任感与远见——通过开源,这些创新将惠及整个行业,推动大模型技术的整体进步。
02
小米大模型战略布局
三款模型同时发布,以极致性价比切入市场
2026年3月19日凌晨,小米集中发布了MiMo V2系列三款大模型:旗舰语言基座MiMo-V2-Pro、全模态Agent基座MiMo-V2-Omni,以及语音合成模型MiMo-V2-TTS。这次发布标志着小米正式进军大模型领域,并以极具竞争力的定价策略向市场发起冲击。
旗舰模型
MiMo-V2-Pro:参数规模与性能并重
MiMo-V2-Pro是小米大模型家族的旗舰产品,总参数量超过1万亿(1T),激活参数为420亿(42B)。模型采用混合注意力(Hybrid Attention)架构,混合比例从前代的5:1提升至7:1,这意味着在计算资源有限的情况下,模型能够更高效地利用稀疏激活机制。同时,MiMo-V2-Pro支持1M超长上下文窗口,这在当前主流大模型中属于领先水平。
💰
定价策略
定价策略
MiMo-V2-Pro的API定价极具竞争力:仅为Claude同级模型的约1/5。具体定价为:256K上下文以内输入$1/百万token,输出$3/百万token;1M上下文以内输入$2/百万token,输出$6/百万token。这一定价策略显示出小米希望通过价格优势快速获取市场份额的意图。
在能力方面,MiMo-V2-Pro在OpenClaw、Claude Code等智能体框架中表现出色,可在无人工干预条件下完成复杂工作流编排、长程规划与精准工具调用。在Coding能力方面,小米内部工程师评测体感接近Claude Opus 4.6,具备更强的系统设计与任务规划能力。这些能力指标表明,MiMo-V2-Pro已经达到了业界一流水平。
全模态
MiMo-V2-Omni:感知与行动的统一
MiMo-V2-Omni是小米首个在基座层面统一感知与行动的全模态模型。它融合了文本、视觉与语音输入,支持256K上下文,定价为输入$0.4/百万token,输出$2/百万token。官方宣称其音频理解综合表现超越Gemini 3 Pro,图像理解超越Claude Opus 4.6。
在实际应用场景中,MiMo-V2-Omni可结合OpenClaw框架实现浏览器自动化操作,包括跨平台比价下单、短视频制作与发布等端到端任务。这种全模态能力使得模型能够真正理解和操作数字世界,而不仅仅是处理文本信息。对于小米这样一个拥有庞大IoT生态的公司来说,全模态大模型具有特殊的战略价值——它有望成为连接小米各类智能设备的统一大脑。
语音合成
MiMo-V2-TTS:多粒度情感控制
MiMo-V2-TTS语音合成模型支持从整体风格到句内局部情绪的多粒度控制,能够自然处理标点、语气词等格式信号,并支持东北话、四川话、粤语等多种方言,以及角色扮演式风格化演绎和歌声合成。这一模型将与小米的语音助手小爱同学深度整合,为用户提供更自然、更富表现力的语音交互体验。
🎯
生态整合
生态整合
三款模型均已接入金山WPS灵犀,MiMo-V2-Pro同步上线小米手机端Agent产品miclaw及小米浏览器。这标志着小米大模型战略不仅仅是技术发布,更是生态整合的开始。通过将大模型能力嵌入到WPS、手机、浏览器等高频使用场景中,小米正在构建一个以AI为核心的产品生态。
03
科技巨头动态全景
库克否认退休、微信新功能、DRAM短缺危机
🍎
库克否认退休传闻:”无法想象没有苹果的生活”
苹果公司CEO蒂姆·库克在接受ABC《早安美国》节目采访时,正面回应了外界流传的退休猜测。他明确表示卸任说法纯属传闻:”不,我没说过那样的话,从来没有。这只是外界流传的谣言。我深爱自己的工作。28年前我加入苹果,从那天起,我热爱在这里的每一天。我们经历过起伏,但共事的伙伴们无比优秀。他们激发了我最好的一面,我也希望能成就他们。我无法想象没有苹果的生活。”
此前有媒体爆料,苹果已在为库克2026年卸任做准备,加之库克去年已到65岁常规退休年龄,市场对苹果高层更迭的猜测愈演愈烈。库克的这番表态无疑给市场吃了一颗定心丸。在库克任期内,苹果市值从不到4000亿美元增长到超过3万亿美元,成为全球市值最高的公司。他的卸任将对苹果产生深远影响。
📱
微信灰度测试「折叠发图」功能
微信正在iOS端灰度测试折叠发图新功能。用户在聊天界面发送3张及以上图片或视频时,底部将出现「合并发送」选项,发送后内容将以可左右滑动的折叠卡片形式展示。接收方可点击「展开」查看全部原图,也可点击「收起」恢复折叠视图,交互逻辑与苹果iMessage的多图展示方式类似。据悉,该功能目前仅限iOS 8.0.69版本的部分内测用户使用,Android端暂未开放。
💾
DRAM短缺将持续到2030年,缺口超20%
SK集团会长崔泰源在英伟达GTC 2026大会上接受媒体采访时表示,全球DRAM芯片短缺的状况预计将持续至2030年,基础DRAM晶圆的短缺幅度将超过20%。他认为,DRAM产业至少需要「四到五年」来完成产能扩张,「不管到哪里,情况都是一样,即使在韩国之外建立产能,也需要同样的时间」。
⚠️
产能扩张困境
产能扩张困境
制约海外扩产的核心障碍并非资金或政府补贴,而是能源、水资源供应以及当地产业生态系统的成熟度。崔泰源还提醒,若过度聚焦HBM生产,通用DRAM的短缺将进一步加剧,并对智能手机、笔记本电脑等消费电子市场造成冲击。
04
算力危机与云厂商涨价潮
AI需求爆发引发算力资源紧张
受全球人工智能应用快速发展影响,算力需求持续攀升,核心硬件及相关基础设施成本出现显著上涨。国内主要云厂商相继宣布涨价,标志着算力成本上升正在重塑行业格局。
📈 阿里云
最高涨价34%
平头哥真武810E等算力卡产品上涨5%-34%,文件存储产品CPFS(智算版)上涨30%
📈 百度智能云
涨价5%-30%
AI算力相关产品服务上调约5%-30%,并行文件存储等上调约30%,4月18日起执行
腾讯高管在财报发布后的媒体会上表示,人工智能需求激增不仅带动DRAM及高带宽内存(HBM)需求回升,乃至CPU、固态硬盘、机械硬盘等需求全面回升。目前订单已需提前几个月、几个季度甚至数年预定。供应商优先保障规模最大、合作最稳定的客户,比如腾讯云。规模较小的云厂商如今已难以确保获得稳定的供应链支持。
💡
行业洞察
行业洞察
知情人士透露,此轮涨价另一个重要原因是”Token调用量暴涨”。阿里云的MaaS业务百炼在今年1-3月创下了历史最高增速。阿里云正在将紧缺的AI算力资源向Token业务倾斜。这表明,大模型API调用量的爆发式增长,正在推动整个云计算行业的商业模式发生根本性变化。
腾讯高管表示,在此背景下行业或别无选择,只能将成本上涨转嫁至售价。过去24小时内,已目睹多家中国云厂商在多方面的价格上调。这一表态预示着,算力成本的上升将成为未来一段时间内AI行业发展的主旋律,可能会加速行业的整合,让资源更向头部企业集中。
05
产业变革深度观察
财报解读与行业动态
📊
腾讯财报:AI推动盈利结构优化
腾讯控股发布2025年第四季度及全年财报。AI持续推动公司盈利结构优化:Q4营收1943.7亿元,同比增长13%;Non-IFRS经营利润695.2亿元,同比增长17%。全年营收7517.7亿元,同比增长14%;Non-IFRS经营利润同比增长18%。
💰
薪酬数据
薪酬数据
截至2025年12月31日,腾讯集团共有员工115849名,较2024年的110558名增加超过5000人。腾讯2025年度的总薪酬成本达到人民币1307亿元,同比增长约15.9%。按此计算,腾讯员工人均年薪成本约为112.8万元。
腾讯2025年第四季资本开支付款224亿元,主要用于支持AI业务发展。财报还披露,腾讯全年砸792亿押注AI,马化腾首次公开谈「养虾」——这里的「养虾」是腾讯内部对AI战略投资的隐喻,意味着需要长期投入、耐心等待收获。
🎬
泡泡玛特携手索尼影业,LABUBU真人动画电影官宣
泡泡玛特与索尼影业共同宣布了LABUBU电影的最新进展,双方将围绕泡泡玛特旗下经典IP形象THE MONSTERS(LABUBU)开发真人动画电影。目前影片尚处早期开发阶段,计划采用真人实景与CGI相结合的形式。电影计划由曾执导《帕丁顿熊》系列及票房大作《旺卡》的保罗·金出任导演及制片人,THE MONSTERS艺术家龙家升将深度参与电影创作。这标志着中国潮玩品牌的IP影响力正在向全球市场拓展。
🤖
MiniMax发布新一代大模型M2.7
MiniMax发布新一代Agent旗舰大模型M2.7,首次展示「模型自我进化」路径。该模型通过构建Agent Harness体系,深度参与自身训练与优化流程,在部分研发场景中可承担30%-50%的工作量,并在内部评测集上实现约30%的效果提升。这一进展表明,AI系统开始具备自我改进的能力,向真正的智能体(Agent)迈出了重要一步。
06
总结与展望
AI产业进入新阶段
回顾本期观察的几大事件,我们可以清晰地看到AI产业正在进入一个全新的发展阶段。技术层面,以Kimi K2.5为代表的新一代大模型正在突破传统架构的瓶颈,从优化器、注意力机制到残差连接,基础组件的全面革新正在释放新的性能潜力。商业层面,小米等科技公司以大模型为切入点,正在重构产品生态和竞争格局。基础设施层面,算力资源的紧张正在成为制约行业发展的关键因素,云厂商的涨价潮可能只是开始。
🔮
未来展望
未来展望
展望未来,我们有理由相信,2026年将是AI技术从实验室走向大规模应用的关键之年。随着技术的不断突破和成本的逐步优化,大模型将在更多领域展现其价值。同时,行业格局也将在这个过程中不断演化,技术实力、生态整合能力、以及资源获取能力,将成为决定企业成败的关键因素。
对于普通用户而言,这意味着更智能的产品、更便捷的交互、以及更丰富的生活体验。对于从业者而言,这既是最坏的时代——竞争空前激烈,也是最好的时代——机遇前所未有。让我们共同见证AI技术如何重塑这个世界。
📬 关于本期深度观察
本期内容由科技观察团队精心整理,涵盖AI技术突破、产业动态、商业趋势等多个维度。
如需获取更多科技资讯,请持续关注我们。
发布时间:2026年3月19日 · 编辑:科技观察团队
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...