ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning 该文章提出了“关键令牌微调(CFT)”方法,通过仅更新对推理正确性至关重要的令牌,解决了传统监督微调(SFT)的局限性,在数学推理等任务中实现了更高的准确性、多样性和泛化能力。一、文章主要内容总结研究背景与问题传统SFT在微调大语言模型(LLMs)时,会对所有令牌进行统一惩罚,忽略了只有少数“关键令牌”决定推理正确性。这种统一监督会导致模型输出多样性降低、泛化能力受限,且在处理不完美推理轨迹时效率低下。核心方法:关键令牌微调(CFT)关键令牌识别:通过反事实扰动,替换正确推理轨迹中的每个令牌并重新生成后续内容。若所有替换都导致答案错误,则该令牌被标记为关键令牌。选择性微调:仅对关键令牌应用梯度更新,保留非关键令牌的多样性,避免令牌分布坍缩。效率优化:采用并行解码技术,在Qwen2.5-7B模型上实现了超过25倍的关键令牌标注速度提升。实验验证实验设置:在3个模型家族(Qwen、OLMo、LLaMA)的5个模型上,针对11个数学推理基准(如GSM8K、MATH、SVAMP)进行测试,并与SFT、DFT等方法对比。核心结果:CF
返回列表