小米公开MiMo-V3核心架构HySparse2降Agent成本

IT时代网9月24日消息,小米MiMo团队今日公布面向MiMo-V3的核心架构HySparse2,瞄准下一代长上下文智能体,目标是让模型以更低成本处理网页、文件、代码和工具调用记录,并从不断增长的任务历史中更准确地检索关键信息。

官方介绍称,HySparse2面向长程多轮Agent场景,带来更少的Prefill计算、更小的KV Cache以及更精准的长上下文检索。从MiMo-V2系列开始,团队持续探索模型能力与计算效率的共同提升,V2采用的Hybrid SWA混合注意力架构已将全注意力与滑动窗口注意力结合使用。

新架构借鉴YOCO设计,把模型分为前后两部分:前半部分Self-Decoder采用全注意力与SWA混合结构,后半部分Cross-Decoder采用全注意力与稀疏注意力混合结构。KV共享分为KV Bridging与KV Reuse两个层次,让后半部分全注意力层的KV Cache不必等输入逐层经过后才能生成。

第一代HySparse采用块级稀疏选择,长上下文中选中一个重要token往往要把周围整块内容纳入计算。HySparse2改为token级选择,让同样注意力预算更精细地分配到分散在不同轮次对话、工具结果和代码片段中的线索;在相同全局token预算下,token级选择在RULER-v2、多轮检索MRCR-v2和图推理基准上均带来精度提升。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END