天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

Kimi新架构引硅谷热议:马斯克点赞Karpathy锐评,深度学习迎变革?

2026-03-17来源:快讯编辑:瑞雪

传统残差结构自2015年提出以来,始终是神经网络加深的基石。但当大模型层数突破数百层后,这种"一刀切"的信息叠加方式暴露出致命缺陷:所有层级输出以固定权重涌入主干路径,导致早期提取的关键特征被后续海量信息淹没。研究团队通过实验发现,在PreNorm架构下,模型隐藏状态范数随深度呈指数增长,迫使深层网络必须产生极大输出才能获得"发言权",这种机制不仅造成参数浪费,更使梯度分布严重失衡——初始层梯度占总量80%以上,而深层梯度几乎可以忽略不计。

AttnRes的创新在于将深度维度转化为可检索的特征空间。每层配备的"伪查询向量"如同智能导航仪,通过计算与历史层输出的相似度生成注意力权重,配合RMSNorm归一化防止异常值主导。为解决全量注意力计算成本过高的问题,团队开发出分块注意力机制:将数百层网络划分为8-16个模块,模块内维持基础累加,模块间进行精细注意力聚合。这种设计使显存占用仅与模块数量成正比,在Kimi Linear架构(480亿参数)的实测中,端到端推理延迟增加不足2%,却带来1.25倍的算力效率提升。

在1.4万亿token训练数据的验证下,新架构展现出惊人的性能跃迁:在知识深度测试GPQA-Diamond中提升7.5分,数学竞赛任务Minerva Math和代码生成任务Humaneval分别提高3.6分和3.1分,通用理解基准MMLU和中文能力测试C-eval也全面超越传统模型。更关键的是,梯度分布可视化显示,所有层级均保持活跃状态,首层嵌入信息能穿透数十层直达决策层,彻底解决了传统架构的信息稀释难题。

这项由18岁准高三生陈光宇领衔的研究,正在改写深度学习的发展轨迹。前OpenAI核心研究员Jerry Tworek评价:"当残差连接从机械叠加变为智能调度,我们正在见证深度学习2.0时代的曙光。"随着计算硬件突破内存带宽瓶颈,这种深度维度的全量检索机制或将重新定义模型扩展法则,使AGI之路不再依赖单纯的参数堆砌,而是转向更高效的深度调度艺术。

特斯拉Optimus Gen 3走出实验室将量产,马斯克要求年底前达成产能目标
报道还称,给供应链下单前,在六月底的一次高管会上,马斯克评审通过了 Optimus 的最新版本,这意味着 Optimus Gen 3 在研发三年多后,终于将走出实验室,进入量产阶段。原因在于,Optimus…

2026-07-10

英伟达黄仁勋:AI时代软件工程师更热衷构建智能体而非传统写代码
IT之家 7 月 9 日消息,据《商业内幕》今天(9 日)报道,英伟达 CEO黄仁勋在采访中提到,智能体系统已经成为一项新技能,英伟达目前有许多软件工程师参与智能体开发。 黄仁勋在 5 月的一次电视采访中说…

2026-07-10

雷军抖音官宣:小米SkyNomad澎程SUV开启试产 智能多变空间引期待
快科技7月9日消息,雷军今晚通过抖音对外公布小米汽车全新产品系列SkyNomad小米澎程,这款主打智能可变空间的SUV,目前已经在北京亦庄小米汽车工厂开启试产。 小米汽车现在分成两条产品线,SU7和YU7主打…

2026-07-09