ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

从去重去污染到 Scene 级标注:NeoHorse-1-4B 后训练数据质量流水线全解

从去重去污染到 Scene 级标注:NeoHorse-1-4B 后训练数据质量流水线全解 从去重去污染到 Scene 级标注NeoHorse-1-4B 后训练数据质量流水线全解【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B是由 TokenRhythm 团队基于 Qwen3.5-4B 后训练得到的 4B 参数智能体Agent语言模型。它最大的看点之一是一条覆盖去重 → 去污染 → 结构校验 → 语义评估 → Scene 级标注五道工序的后训练数据质量流水线——正是这套流水线让它在 10 项基准测试的宏平均上达到 64.87 分比基座模型高出5.93 分。本文面向新手完整拆解这条数据流水线是如何把Agent 执行轨迹变成可靠训练信号的。一、先认识 NeoHorse-1-4B为 Agent 而生的 4B 模型如果你只关心模型本身先记住这几点属性说明模型规模约 4B 参数的因果语言模型基座模型Qwen3.5-4B后训练微调能力定位智能体工具调用、编码、推理、指令遵循上下文长度原生 262,144 tokens可扩展至约 100 万权重格式Safetensors / BF16许可证Apache 2.0 更完整的模型细节见 README.md 的 Model Details 与 Evaluation 章节。模型架构参数32 层、混合线性/全注意力、BF16 精度等都记录在 config.json 中其中modification_notice字段明确说明了 TokenRhythm 的修改内容仅在语言模型权重上做了微调与纯文本推理重打包张量数值本身未被重打包改动。对话行为则由 chat_template.jinja 模板控制。二、为什么数据质量是后训练的生命线 新手常见疑问模型不就是喂数据训练吗为什么要专门搞一条数据质量流水线关键在于 NeoHorse 这类 Agent 模型的训练数据来源与普通模型不同——它来自智能体在 Harness执行环境中的真实执行轨迹模型调用工具、收到返回、继续推理每一步都可能出错、重复或跑偏。如果直接拿原始轨迹训练会出现三个问题模板化重复Agent 轨迹大量共享同模板精确重复和近重复样本会让模型背题而非学会泛化评测污染训练数据混入评测集内容分数好看但不代表真实能力提升结构破损工具调用格式错误、上下文断裂的轨迹教给模型的是坏习惯。因此NeoHorse-1-4B 的后训练流水线把清洗数据变成了一道有明确分工的流水线见 README.md Highlights 的 Data quality 条目原始 Agent 轨迹 ↓ ① 精确/近重复去重 ↓ ② 评测去污染 ↓ ③ 结构校验 ↓ ④ 六维语义评估 ↓ ⑤ 子场景级 Scene / Goal / Outcome 标注 高质量训练数据 → 路由训练框架 → 下一轮训练配比下面逐道工序拆解。三、五道工序拆解数据质量流水线全解工序① 精确与近重复去重Deduplication精确去重完全相同的记录只保留一份是最基础的一步近重复去重识别换了几个词、调换了顺序的相似样本。Agent 轨迹天然模板化同一任务换参数重跑近重复尤其高发。 通俗理解去重就像题库清理防止模型把一套题的 100 个变体当成 100 个新知识点。工序② 评测去污染Decontamination把训练数据与评测集做比对删除或隔离与评测题目重叠的样本。NeoHorse 参与对比的评测包括 QwenClawBench、HumanEval、LiveCodeBench、IFEval、tau2-Bench 等十余项——只有先防住考试泄题最终的5.93 平均分才站得住脚。工序③ 结构校验Structural ValidationAgent 轨迹对格式极其敏感工具调用必须是合法结构、参数与返回要能对应、Harness 上下文要完整。结构校验会在语义评估之前先把格式上就不合格的样本筛掉避免后续评估浪费算力。工序④ 六维语义评估Six-dimensional Semantic Evaluation过了结构关的样本还要在六个语义维度上接受质量打分完整维度定义以技术报告为准。这类多维语义评估的典型关注点包括指令与回答是否对齐、工具使用是否合理、推理链条是否自洽、执行结果是否正确等。它的意义在于——结构合法 ≠ 语义优质一道参数写对但逻辑跑偏的轨迹同样会教坏模型。工序⑤ 子场景级 Scene / Goal / Outcome 标注这是整条流水线最有Agent 味的一步标签含义作用Scene这段轨迹处于什么场景刻画任务分布Goal这段轨迹要达成什么目标刻画能力需求Outcome实际执行结果如何刻画成功/失败信号标注粒度是子场景subscene即把一条长轨迹切成多个小片段分别打标而不是给整条轨迹一个笼统标签。这样路由训练框架才能精确估算当前模型在哪类能力上需求最大进而动态调整下一轮训练数据配比。四、路由训练框架让数据质量形成闭环 标注不是终点而是路由Routing训练框架的输入。整个原型闭环如下路由框架把任务分发给一组异构模型池记录每次工具交互与执行结果结合 Scene/Goal/Outcome 标注估算各能力的需求强度用能力级反馈塑造下一轮训练数据配比更新后的模型回到 Harness 继续执行——评估→筛选→更新的循环就此闭合。官方称这是通往**递归自我改进RSI**的原型路径模型不仅被训练还参与决定下一步该被训练什么。五、数据质量的回报十项基准对比一览 清洗与标注做得扎实分数说话摘自 README.md Evaluation 表格Δ NeoHorse-1-4B − Qwen3.5-4B能力方向基准测试Qwen3.5-4BNeoHorse-1-4BΔ 智能体QwenClawBench38.4744.686.21 智能体WorkBuddy Bench24.6234.419.79 智能体PinchBench71.1977.336.14 编码HumanEval87.2096.959.75 指令遵循IFEval87.0688.351.29 综合十项基准宏平均58.9464.875.93 评测协议SGLang v0.5.17、thinking 模式开启QwenClawBench、WorkBuddy Bench、tau2-Bench 各跑三次取均值其余遵循官方协议。六、快速上手部署 NeoHorse-1-4B⚡ 想亲手体验两步即可。第一步获取模型文件git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B第二步用 SGLang 或 vLLM 启动服务二者均暴露 OpenAI 兼容接口pip install sglang0.5.17 python3 -m sglang.launch_server \ --model-path /path/to/NeoHorse-1-4B \ --served-model-name neohorse-1-4b \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder启动后即可向/v1/chat/completions发送请求完整示例见 README.md 的 Deployment 章节。七、仓库关键文件速查 文件作用README.md模型卡能力、评测结果、部署指南config.json架构配置与修改声明chat_template.jinja对话模板含思考与工具调用格式model.safetensors.index.json权重分片索引总大小约 8.4 GBmodel-00001-of-00002.safetensors / model-00002-of-00002.safetensors模型权重BF16tokenizer.json / vocab.json / merges.txt / tokenizer_config.json分词器资源LICENSEApache 2.0 许可文本总结NeoHorse-1-4B 给出的核心启示可以浓缩成三句话去重与去污染守住公平不背题、不泄题提升才真实可信结构校验 六维语义评估守住合格先剔除坏格式再筛掉坏语义Scene / Goal / Outcome 子场景标注守住方向让路由训练框架知道下一轮该往哪里发力形成通往 RSI 的闭环。对自研 Agent 模型的同学而言这条五道工序流水线是一份可以直接参考的数据质量检查清单——模型能力上限往往就藏在数据管线的细节里。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表