Qwen-Scope: 解析智能,释放潜能
HUGGING FACE MODELSCOPE TECHNICAL REPORT 可解释性分析是探测大模型行为、提供性能优化视角、进行可控式推理的重要方向。今天,我们非常高兴地给大家带来Qwen-Scope——基于Qwen3系列和Qwen3.5系列模型训练所得的可解释性模块。具体来说,我们在Qwen隐藏层插入稀疏自编码器(SAE)并加以训练,通过施加稀疏性约束,自动提取出高度解耦、低冗余且更具可解释性的隐藏空间特征。Qwen-Scope不仅可以用于分析Qwen模型行为的内在机制,也在模型优化上有着巨大潜力,应用场景包括推理结果定向控制、数据分类与合成、模型训练与优化、评估样本分布分析与对比等。 Qwen-Scope核心亮点包括: 推理:无需显示给出自然语言指令,实现推理结果定向控制; 数据:仅需少量种子数据便可收集用于数据分类的特征,显著降低数据依赖;同时可以使用未激活特征信息定向构造数据,补足长尾能力; 训练:通过分析语言混用和重复生成等低错问题,定位异常激活特征,在监督微调和强化学习阶段辅助模型训练,降低此类回复出现频率; 评估:计算不同样本间或不同评测集间特征激活模式,联合判断评