Kimi K3:2.8 万亿参数、百万上下文的开源混合专家模型
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
- 39 星/7日
- 16 引用
- 519 点赞
- #1 mathvision
榜单
最近 90 天的大模型论文,按三路独立信号排序:官方实现仓在 GitHub 上的涨星速度、论文被引用的次数、以及在 Hugging Face 上获得的关注。只有单路信号突出的论文不进榜。每天重排。
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
这篇工作为双工语音模型设计了一套流式记忆架构:左脑负责事实信息,右脑负责情绪与个性化,让语音助手在实时对话中同时记住“你说了什么”和“你是怎么说的”。
这篇工作给“递归自我改进”找了一个具体机制:系统记录每个用户回合预测的能力档位、实际路由到的服务层和交互结果,把这些记录经结构校验与六维语义评估后转成训练样本,保留交错推理、工具调用和 harness 上下文,驱动下一轮 agentic 后训练。
这篇技术报告升级了 LingBot-VLA:重构数据管线,用约 6 万小时预训练数据(20 种机器人本体共 5 万小时轨迹,外加 1 万小时第一人称人类视频),并把控制范围从双臂扩展到头部、腰部、移动底盘和灵巧手,目标直指实验室到真实部署之间的落地鸿沟。
小米机器人团队的视觉-语言-动作基础模型,用 10 万小时以上的真机 UMI 轨迹做预训练,并自动标注场景转换语言,再经后训练适配不同本体和人类的指令式提示。论文称数据量和参数量增加时性能持续提升,在新环境里可以开箱即用,灵巧任务上也能高效微调。
符号式音乐模型能显式规划作曲,但成品不像真正的录音;音频模型能生成整首歌,编曲逻辑却藏在里面。YuE2 把两者统一到单个 AR-NAR 混合 Transformer 架构里:先生成可读的乐谱,再展开成语义音乐 token,最后渲染成完整歌曲,并配套 MERT2、SheetSage2 两个表征模型,从没有对齐乐谱的录音中学习。论文称其在 WildSongBench 的 SongBench Global 平均得 6.73(best-of-8 为 6.96);专家盲听中 best-of-8 版本胜过 Suno v4.5、与 Suno v5 基本持平。生成的乐谱是可读的,外部语言模型 agent 可以直接按乐谱修改编曲。
RoboDojo 是一个仿真与真机统一的机器人操作基准,用 42 个仿真任务加 18 个真机任务考察通用策略的泛化、记忆、精度和长程控制能力;附带并行 Isaac Sim 评测和云端真机评测系统,作者已用 30 个策略完成首轮集成榜单。
物体离开画面后,视频生成模型还记得它存在吗?作者从认知科学出发造了 WROP:150 个任务横跨六类认知能力,用 Blender 渲染并在光照、速度、机位上随机扰动,产出 150 万条训练样本和一份 300 题的考试,用来考 14 个视频模型。他们还基于自研的 AWS Trainium2 原生 PyTorch 训练栈训出 160 亿参数的 PWM-WROP 世界模型,数据、考题、得分和权重全部开源。在盲评两两 Elo 对决中,它在续写类模型中排名第一,与最强的参考视频类模型基本打平。
Frontis-MA1 附带 OpenMLE 全栈开源系统(任务环境、强化学习算子学习、进化搜索),用来研究递归自我改进;其 350 亿参数元进化智能体围绕 Draft、Improve、Debug、Crossover 四类程序进化算子做后训练,作者称在 MLE-Bench Lite 上超过 GPT-5.5 加 Codex 的组合,组件还能迁移到没见过的 NatureBench Lite。
这套可复用技能覆盖研究选题的第一步:多源文献检索(Paper-Search)、查新检撞(Scoop-Check)和端到端成稿(IdeaSpark),让生成的研究方向建立在真实文献证据和与已有工作的差异化分析上,而不是凭空出题。
通用视觉编码器没见过密集文字,直接套文档任务效果差。MonkeyOCRv2 构建了 1.13 亿张、17 语种的文档预训练语料,把图转文生成和像素级笔画重建结合起来联合预训练,让模型真正学会字符级的文档感知。
AuK 把语音生成和语音编辑统一到同一个开源基础模型里:用户用自然语言描述想要的效果,模型就能合成新语音,或按指令修改已有音频的措辞、音色和声学表现。
Edge0 是一个开源推理引擎,让 35B 混合专家模型在单张 24GB 显卡上跑起来:专家权重按需从 SSD 流式加载,每层用一个训练好的预路由头提前一个 token 预测下一层该激活哪些专家,让磁盘读取藏在计算背后;再配一个恢复 LoRA 补回 int4 量化的质量损失。作者称单卡可达约 20 tok/s、峰值活跃显存约 3GiB,五个公开基准上平均只比 fp16 原版低几个点。
从想法到成稿不只是写字。Spark-to-Paper 不搭新平台,而是在现有编程助手里实现十三个可组合技能:检索文献、设计与执行实验、按证据修正结论、产出出版级图表,并把模型判断和可机械验证的操作分开,实验规划与报告撰写也相互独立。
流式视频助手既要实时看懂直播画面,又得记住几分钟前发生的事。OneStreamer(南京大学)让一个 4B 模型用同一套生成过程同时干两件事:看视频时主动把时间戳标注的局部细节和事件摘要写进分层文本记忆,之后被追问时直接查这些文字记录,而不用回头重新编码历史帧。它还配套发布了 OneStreamer-1M 流式视频交互数据集(逾百万条记录),论文声称其 4B 模型在全部八个流式视频理解基准的比较方法中结果最好。
最近 90 天的大模型论文,按三路独立信号排序:官方实现仓在 GitHub 上的涨星速度、论文被引用的次数、以及在 Hugging Face 上获得的关注。只有单路信号突出的论文不进榜。每天重排。
短横线表示该路信号取不到,不代表数值为零。