DART:免训练路由框架,根据草稿共识自适应分配推理预算
原始标题 / DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models
本文介绍了一种名为DART的免训练路由框架,用于混合推理模型,它通过比较两次廉价的无思考草稿的一致性来决定是直接回答还是分配更多推理预算。该方法无需标注数据或梯度更新,能根据问题难度动态调整计算量,从而在保持或提升准确率的同时大幅减少思考令牌的使用。
01 摘要
本文提出DART框架,利用两个无思考草稿的共识和熵来路由查询,在简单问题上直接回答,在复杂问题上预测思考预算。作者报告,与始终思考的基线相比,DART在多数设置中保持或提升了准确率,同时将思考令牌使用减少32%-73%,并在奥林匹克数学和代码生成任务上分别提升最多9.0和22.5个百分点。作者认为,该信号在不同模型规模、模型家族和API托管环境中均有效。这些结果基于论文报告的具体实验,具体数据集和实验细节未在摘要中详述。
02 关键点
- DART是免训练路由框架,无需标注数据或梯度更新。
- 它通过两次无思考草稿的共识决定直接回答或分配推理预算。
- 在多数比较中,DART保持或提升了准确率,同时将思考令牌使用减少32%-73%。
- 在奥林匹克级数学和代码生成任务上,准确率分别提升9.0和22.5个百分点。
- 信号在0.6B至32B模型规模、不同模型家族和API托管环境中均有效。
回到一手来源
阅读原文 ↗AI GENERATED SUMMARY / DISCOVERED BY ARXIV CS.CL