
2026年8月一份技术报告悄悄上线里面藏着一个让人愣了一下的事实一个参数量只有35B的模型靠着某种系统设计在多个专业任务测试里追上了那些参数规模不明、动辄被认为是更聪明的顶级闭源模型。你可能会觉得这不就是老套路吗小模型蹭个热点碰瓷大模型。但如果你往深看一层就会发现这份报告真正想说的事情其实和参数量没什么关系。它想说的是语言模型这几年一直在卷回答得好不好但复杂工作真正卡住AI的地方从来不是回答得好不好而是能不能把一件事从头做到尾还得经得起检查。这就是Apodex 1.1这份报告的核心主张。它给这种能力起了个名字叫working capability工作能力。**工作能力**不是指模型能不能给出正确答案而是指模型能不能在一个不断变化的真实环境里持续做出有效进展直到把一件事情实实在在地完成并且交出的东西经得起验证。这个定义听起来抽象但它戳中了一个大家都心知肚明却很少说破的事实一个模型可能知道正确答案该是什么样子但让它去翻文件夹、执行代码、追踪信息来源、在出错后恢复现场、最后交付一份别人能拿去用的成果它常常就露馅了。卡住AI的到底是什么先说清楚问题出在哪。这几年通用大模型在知识、推理、数学、写代码这些能力上进步飞快几乎每个季度都有新纪录。但很多有价值的真实工作即使模型知道该怎么做依然做不好。原因很简单这些工作要跨越一个很长的时间尺度。你得先去找证据、看懂各种格式的文件然后写代码跑分析代码报错了你得会调试过程中计划可能要改好几次某一步操作失败了你不能把之前做对的东西也一起扔掉最后你交出去的东西得让另一个人能看懂、能接着用。这中间任何一环掉链子整件事就废了。打个比方这就像让一个刚毕业的实习生去做一份需要三天才能完成的市场调研报告。他可能对着面试官能把行业分析讲得头头是道理论功底扎实但真让他去翻五十个网页交叉验证数据、把Excel表格和PPT做出来交给客户中途文件命名乱了、Excel公式算错了没发现、被老板临时改了需求也不知道哪些已完成的工作还能用那这份报告最后大概率是烂尾的。如果没有一套把长任务拆解、执行、检查、交付的完整流程支撑光靠脑子聪明是不够的。这正是working capability要补上的那块拼图。那么在Apodex 1.1出现之前行业里的标杆水平是什么样的报告里给出了对照前一代Apodex 1.0在专业工作测试APEX-Agents上只拿到16.5分而同期的Claude Opus 5能拿到42.3分DeepSeek V4 Flash拿到34.4分。这个差距接近三倍说明能不能把长任务扛下来这件事在模型之间的分化是非常剧烈的绝不是简单的参数堆叠能解决的。两条路把世界做大把团队做活Apodex团队给出的解法分成两条并行的主线报告里叫做Environment Scaling和Agentic Coordination Scaling。**环境扩展Environment Scaling**不是让模型看更多文字数据而是让模型在更多样、更真实、结果可验证的可执行世界里练手包括文件操作、网络搜索、代码执行这三大类环境。这句话翻译一下就是以前训练模型靠的是给它看很多例子告诉它正确答案是什么这是静态的。而环境扩展做的事情是造出一个个真实的小世界里面有文件系统、有可以执行的代码、有搜索引擎模型在这些世界里试错、犯错、修正然后被真实地检验对错。这就好比学游泳你不能只靠看教学视频学会游泳你得真的下水。而且水池得足够多样有浅水区、深水区、有浪的、没浪的你才能真正学会应对各种情况而不是只会应付一种泳池的水温和深度。**智能体协同扩展Agentic Coordination Scaling**训练模型学会把一个大任务拆解成多个子任务分配给不同的分身子智能体并行处理中途根据反馈调整计划最后把各路结果汇总成一份完整交付。如果说环境扩展解决的是模型会不会干活那协同扩展解决的是一群模型怎么一起把活干好。这不是简单地多开几个进程跑同一个任务而是训练模型具备真正的项目管理能力知道什么任务能并行什么时候该根据新证据推翻旧计划哪个分支已经过时该及时叫停。这两条线各自独立又互相支撑靠一套叫做AgentOS的执行系统连接起来。**AgentOS**Apodex团队自研的持久化运行时系统负责在整个任务执行过程中维护文件状态、检索证据、代码执行日志、产出物索引让模型在漫长的任务里不会失忆或手忙脚乱。完成的工作才是智能的度量单位报告里有一段特别值得琢磨的表述传统的语言模型评测往往是给一个问题看回答对不对这是一种一次性的静态映射。但Apodex团队认为真正该被度量的是agent在一个持续变化的世界里留下的最终状态也就是完成的工作本身。他们给出了一个正式的任务契约公式把一个复杂任务拆成八个组成部分初始工作空间、目标、可执行动作、状态转移规则、观察接口、资源预算、交付契约、以及交付验证器。听起来很学术但拆开看其实很直观。任何一件真实工作都可以这样理解你手头有一堆初始材料工作空间你被告知要做成什么样目标你能用哪些工具去处理动作每次操作会怎样改变现状状态转移你能看到什么反馈观察你有多少时间和调用次数的限制资源预算最后要交出什么、按什么标准验收交付契约和验证器。这套框架最有意思的地方在于它明确区分了两种验证一种是过程中模型自己看到的反馈比如代码跑出来报错了这只是一个普通的观察信号模型可以据此调整策略另一种是任务结束后对最终交付物的裁决这个裁决者不受模型左右专门用来判断这件事到底有没有真的做完做对。这个区分很关键因为它防止了一种常见的作弊心态我说我做完了你就得信。Apodex的设计哲学是光靠一个流畅自信的回答骗不过系统最终裁决权握在一个独立的验证机制手里。造世界这件事比想象中讲究环境扩展听起来像是多找点数据但报告花了大量篇幅说明这件事的难度远超预期。报告把可执行环境分成三大家族文件世界、搜索世界、代码世界。文件世界解决的问题是权威性和转换。你想象一个真实的职场场景一份任务的关键信息不是写在提示词里的而是散落在几十个文件、跨越多个历史版本、格式五花八门的文件夹里。模型必须自己去找出哪份文件是权威版本理清文件之间的引用关系过滤掉过时或重复的记录最后把理解转化成一份专业的成果文件。这类环境的构建思路很特别报告说这是解题的逆过程先定义好一套业务逻辑和权威关系再把它投射成一个凌乱的工作空间让模型去逆向还原出这套逻辑。目前这套场景库已经覆盖33个领域、318种职业、1208个交付物集群这个数字规模说明团队是真的在按照真实职场的分工细致度在铺量。验证这类任务对不对靠的是能不能被代码独立地重新算出来而不是看起来像不像对的答案。这一点很像审计工作里的实质重于形式原则审计师不会因为一份报表格式规整、逻辑通顺就认定它没问题真正靠谱的做法是拿原始凭证重新核算一遍两个数字对得上才算过关。如果不这样要求模型很容易学会生成看起来很专业但其实经不起推敲的假答案这在真实工作场景里是致命的。搜索世界解决的是发现和证据对齐的问题模型得学会拟定搜索词、筛选候选来源、追踪引用链条、在多个信息源冲突时判断该信任谁、并且知道什么时候证据已经够了可以停下来。这里最难的不是找到信息而是知道什么时候该停。代码世界则专注于可执行的转换和验证模型改动一个代码仓库后靠测试结果的反馈来判断改得对不对。这里报告提到一个很实际的工程细节由于合成出来的任务可能没有天然的标准答案裁判团队专门设计了一套红队测试机制专门尝试用各种手段骗过验证器拿到奖励却没有真的完成任务只有能扛住这种攻击的验证器才被认为可信。**验证器**判断一个任务是否真正完成的独立裁判机制它和执行任务的agent完全隔离agent无法修改验证器的判定逻辑。这套设计思路让我想起小学考试防作弊的逻辑如果批卷老师和出题老师是同一个人还允许学生看着自己批自己的卷子那这场考试的分数根本没有意义。验证器和执行体分离正是为了保证最后打出来的分数是真实可信的而不是自娱自乐的数字游戏。让智能体学会真正的团队协作如果说环境扩展是给模型造练习场那协同扩展要解决的是一群模型怎么一起干活不添乱。Apodex Agent Team保留了上一代1.0版本的核心架构一个主智能体先通盘思考问题把它拆成若干个可以独立研究的子问题然后按需临时组建专门的子智能体去处理而不是从一个固定的角色目录里挑几个现成的角色凑数。在1.1版本里这套架构被外化成了一个叫做任务看板的持久化状态。**任务看板Task Board**一个独立于对话历史之外的共享协调记录每个任务条目都记录着具体目标、依赖关系、完成状态、负责的智能体和已返回的证据子智能体从看板上领取任务范围完成的工作也挂回看板上。为什么要单独搞一个看板而不是靠对话记录来维护计划因为长任务的对话历史会被反复压缩、重新格式化跟大段的工具调用结果混在一起早期的关键决策很容易在这个过程中被冲刷掉。这就好比一个项目团队如果只靠群聊记录来管理进度几百条消息刷下来谁负责什么、什么卡在哪儿根本没人说得清楚团队必须有一个独立于闲聊之外的项目管理看板任务状态才不会失踪。如果不这样做模型在漫长任务里很容易失忆忘了前面已经确认过的事实或者把已经作废的分支当成还在进行的工作继续投入资源。围绕这个看板Apodex 1.1加上了四项新能力。第一项是异步人工介入。真实的研究任务往往在开始时是模糊的执行过程中才会逐渐清晰。可能一份新材料推翻了原来的假设也可能用户中途意识到报告的方向跑偏了。1.1版本让系统能在执行过程中接收用户的新消息并且训练模型去判断这条消息到底改变了什么哪些工作依然有效接下来该怎么继续。这里有个很细致的设计系统会区分用户只是澄清了一下要求和用户彻底改变了任务目标这两种情况。前者保留原有的任务契约后者则视为开启了一个新任务同时允许沿用工作空间里依然有效的部分。这种分寸感的把握很像一个靠谱的项目经理面对客户临时提需求时的反应如果客户只是补充了个细节项目经理会把它塞进现有计划里继续推进但如果客户说要重做整个方案项目经理不会假装什么都没变而是重新拉一条时间线同时把之前调研好的资料保留下来接着用。第二项是非对称验证。1.0版本引入了独立于主智能体之外的验证角色但报告坦承这还不够。如果一个验证智能体被要求把整个问题重新做一遍它很可能会掉进和生成智能体一样的思维陷阱产出第二套同样不靠谱的错误链条。**非对称验证**验证的任务被特意设计得比生成任务窄得多验证智能体只负责攻击一个具体的论断比如找反例、用独立信息源交叉核实、检查具体的名字日期数字对不对而不是重新解决整个问题。这个设计背后的道理其实很朴素证伪一个具体说法比重新构建一整套论证要容易得多也更聚焦。这就像质检环节如果让另一个工人把整件产品重新组装一遍来验证质量那第二个工人也可能装错但如果让他专门检查某一颗螺丝是否拧紧这个任务窄而具体出错的概率就小得多反馈也更精准。第三项是自适应的最大团队投入简单说就是不搞平均分配资源而是把更多的独立调查投给那些还有争议、证据薄弱、或者对最终结论至关重要的关键论断已经确定的部分不再浪费算力反复验证。第四项是证据导向的综合报告生成。团队执行和最终成稿这两件事的要求其实不太一样前者需要不断规划调度、消化各路返回的信息后者需要把散落在无数轮交互中的关键细节、证据出处、分歧和未解决的不确定性都完整地保留下来。1.1专门加了一道独立的综合环节先把所有分支的结果和分歧构建成一张证据图再交给写作智能体在同样的约束下生成最终报告一个论断如果没法追溯到证据或计算过程就会被淡化处理或者干脆删掉而不是被写成一句听起来言之凿凿的空话。那个撑住这一切的运行时系统前面说的所有协调行为都需要一个稳定的地基去承载这就是AgentOS要解决的问题。报告里有个很扎实的工程细节让我印象深刻整个运行环境被划分成三个文件命名空间。/inputs是只读的存放任务原始文件/workspace是草稿区供智能体计算、记笔记、生成候选产出/outputs是收集根目录只有被正式确认交付的内容才有资格进入这里。这个三层结构听起来是个纯技术细节但它解决的其实是一个很现实的信任问题怎么区分半成品和最终答案。你可以类比一个厨房的操作流程切菜配料的台面草稿区和端上桌的餐盘交付区必须是物理上分开的两个地方厨师在配料台上失手掉了块肉在地上没关系反正没端上桌但一旦某道菜被摆上了给客人上菜的托盘那就必须是真正做完、检查过、能吃的。如果所有东西都堆在同一张台面上客人随时可能吃到一盘还没炒熟的菜。围绕交付这一环系统还设计了一套发布租约机制同一时间只有一个执行会话拥有提交交付物的权限交付的文件清单必须精确声明任何未在清单中的写入路径会被直接拒绝交付前系统还会拿基准快照做比对防止一个空文件或者上一轮遗留的同名旧文件冒充成真正的成果。另外还有一套针对长任务两大典型失败模式的应对机制上下文超出模型能处理的长度以及任务还没消化完就被强制超时打断。前者靠分级压缩解决先便宜地清空旧工具调用的具体内容但保留结构如果还不够再用模型总结中段内容后者靠软硬两级时限解决接近软时限时系统会主动提醒智能体先把已有发现整理成一份有用的阶段性成果而不是等硬时限到了直接被无情打断白白丢掉快完成的工作。这套机制让我想起写论文赶deadline的经历。如果没有一个提前预警的机制提醒你还剩多少时间很可能就是在电脑突然死机或者系统强制关机的那一刻才发现自己几个小时的心血一个字都没保存。软时限的存在本质上是给系统留出体面收尾的空间这比一刀切的硬性截止要人性化得多也更能保住已经完成的有效劳动。训练把两条扩展路径变成真本事光有环境和协调机制还不够得有一套训练方法把这些能力真正教给模型。Apodex的训练分两个阶段。第一阶段是监督微调SFT把通用推理、工具使用、搜索、文件处理、代码、数学、科研和金融推理、专业交付、多智能体协作这些领域的数据统一成一套结构化的交互格式让模型在一个策略里同时学会这些行为而不是分裂成互不相通的专项模式。第二阶段是强化学习这里报告介绍了一个叫PIVOT-RL的方法我觉得是整篇报告里工程含量最高的一个细节。**PIVOT-RL**一种针对长任务轨迹的局部化强化学习方法先通过事后分析找出轨迹中真正出问题的关键转折点保留转折点之前有用的部分只针对转折点之后的部分构造带有简短纠正提示的续接任务进行强化训练。这个设计要解决的问题是一个长达几百步的任务轨迹如果最后结果是失败的那前面九十步可能都做对了只是第一百步走岔了而只用最终结果去打分会让模型误以为前面九十步也是错的这种粗糙的信号会严重拖慢学习效率。打个比方这有点像给一场长达三小时的足球比赛复盘。如果裁判只看最终比分说你们输了所以整场比赛都打得不好球员根本不知道具体是哪个战术决策出了问题但如果专业教练能精确指出第67分钟那次传球失误直接导致了丢球前面66分钟的配合其实是有效的球员才能真正学到东西下次针对性地改进那一个环节而不必把整套打法推倒重来。如果不做这种精细定位模型的学习效率会大打折扣因为它没法分清楚哪部分决策才是真正需要修正的。报告里给出的训练曲线显示在搜索、知识、科学这三类留出的评测任务上随着强化学习计算量的增加分数持续稳定上升这说明这套局部化优化的思路是真正有效的不是纸上谈兵。数据说话Apodex 1.1到底表现如何讲了这么多设计理念最终还是要看数字。报告给出的评测覆盖了专业工作、金融、科研、通用推理、数学、代码这几大领域采用两种执行模式对比ReAct模式代表模型本身的原始能力Agent Team模式代表加上团队协同后的系统能力。在专业工作能力测试GDPVal上Apodex 1.1用Agent Team模式拿到78.8分比ReAct模式的69.5分高出9.3分而对照组里表现最强的Claude Opus 5拿到89.4分。在APEX-Agents测试上Apodex 1.1的Agent Team达到38.5分相比前一代Apodex 1.0的16.5分提升超过一倍。金融领域的FrontierFinance测试上Apodex 1.1的Agent Team拿到54.3分是所有对比模型里最高的一个超过了Claude Fable 5的49.2分。科研能力测试FrontierScience-Research上Apodex 1.1的Agent Team达到63.3分同样是对比中的最高分超过了DeepSeek V4 Flash的55.0分。| 测试项目 | Apodex 1.0 | Apodex 1.1 (ReAct) | Apodex 1.1 (Agent Team) | 对比最佳外部模型 ||---|---|---|---|---|| APEX-Agents | 16.5 | 34.4 | 38.5 | 42.3 (Claude Opus 5) || GDPVal | 59.3 | 69.5 | 78.8 | **89.4 (Claude Opus 5)** || FrontierFinance | 40.3 | 48.7 | **54.3** | 49.2 (Claude Fable 5) || FrontierScience-Research | 28.3 | 55.0 | **63.3** | 55.0 (DeepSeek V4 Flash) || Humanitys Last Exam | 49.0 | 53.2 | 56.1 | 64.7 (Claude Opus 5) |数学能力上的进步尤其显眼。在IMO 2025竞赛级别的评测里Apodex 1.0用Agent Team模式只能拿到12.5分而Apodex 1.1的Agent Team模式拿到36.5分超过了国际数学奥林匹克金牌线35分的门槛。IMO 2026和USAMO 2026上也都跨过了各自的金牌门槛分别是30.5分对29分和26.5分对25分。这意味着这套系统在竞赛数学的证明题上达到了人类顶尖学生金牌选手的水平线。值得一提的是,报告没有回避自己的短板。在一项叫FrontierResearchBench的高难度端到端科研测试里即便是表现最好的外部模型GPT-5.6-Sol和Grok-4.6也只能完整通过20.6%的任务而Apodex 1.1的Agent Team模式是12.4%。报告直接写道可靠地完成一整套指定的科研流程并交付每一个要求的产出物对所有被测系统来说仍然是件难事。这种坦诚反而让整份报告的可信度更高。小模型也能打35B的效率验证最让我觉得有意思的一组数据是关于35B参数的迷你版本Apodex 1.1 mini。**参数量Parameters**模型内部可调整的数值总数通常被认为和模型能力大致相关参数越多理论上能学到的东西越复杂但也意味着更大的计算和部署成本。在FrontierFinance测试上这个35B的小模型用ReAct模式就拿到40.0分比自己的上一代Apodex 1.0 mini的33.2分提升明显加上Agent Team协同后进一步冲到50.2分超过了几乎所有开源对比模型包括参数量大得多的DeepSeek V4 Pro的45.5分。这组数据说明的道理其实挺朴素:环境扩展和协同训练这两条主线带来的提升并不只是靠堆更大的模型才能兑现,一个体量小得多、可以本地部署的模型同样能享受到这套方法论带来的红利。这对于那些没有海量算力、又想在本地跑一个靠谱agent的团队来说是个挺实在的信号。光看结果不够还要看过程靠不靠谱报告的最后一层评测叫HDS6这是我觉得整份报告里最有诚意的一部分。**HDS6Heavy-Duty Solver六维分析**一套专门评估执行过程质量而非只看最终结果的评测框架涵盖长程状态连贯性、证据可信度、假设管理、边界与失败推理、工具使用与执行状态管理、验证下的自我纠正这六大能力维度每个维度下设四个评分项另外加一道诚信关卡。为什么要专门评过程因为一个任务哪怕最终结果对了也可能是靠瞎猫碰上死耗子中间的推理过程可能是混乱的、证据是编造的、失败后没有任何反思。报告特别强调了一个诚信关卡如果轨迹里出现了虚构的工具调用结果或者叙述了一个实际上根本没发生过的动作整条轨迹的分数直接归零不管最终结果表面上看起来多漂亮。这个设计思路让我想起考试作弊被抓的处理方式哪怕一份卷子的每道题看起来都答对了一旦查出是抄袭或者伪造答题过程这份卷子的成绩会被直接作废而不是按部分正确打折扣分。这种一票否决式的诚信机制比单纯看最终得分要严格得多也更符合真实工作场景里对可信度的要求。如果不设这道关卡模型完全有可能学会一种投机取巧的策略编造一个看起来天衣无缝的执行过程最后凑出一个正确答案但这种蒙对了的能力和真正解决问题的能力是两回事一旦遇到没见过的新情况就会露馅。从HDS6的雷达图对比来看Apodex 1.0到1.1之间提升最明显的两项分别是初始任务分解提升1.3分和最终验证提升0.8分这恰好呼应了前面提到的任务看板机制和验证体系的加强说明系统层面的改进确实体现在了执行过程的质量上不是空口白牙。写在后面读完这份报告最让我意外的其实不是那些排名对比的分数而是报告花了大量篇幅去讲什么时候不该做什么。比如非对称验证那部分明确说验证智能体的任务必须比生成任务窄不能让它重新做一遍整个问题。这背后其实是承认了一件很反常识的事让一个足够聪明的模型去检查另一个模型的工作并不会自动带来更可靠的结果因为检查者可能陷入同样的思维误区。这一点在人类社会里其实早就被验证过无数次同行评审出问题、审计报告漏洞百出本质上都是检查者和被检查者共享盲点的问题只是这次它被明确写进了AI系统的设计原则里。还有一处细节让我觉得挺有意思报告里提到发布租约机制的设计初衷是防止多个智能体分支同时往同一个交付目录里写东西造成冲突。这其实是分布式系统里经典的并发写入问题被原样搬到了多智能体协作的场景里。这说明所谓的智能体系统工程很大程度上是在把过去几十年软件工程和分布式系统积累的经验重新应用到一个新的载体上而不是凭空发明了一套全新的东西。有一个问题我还没想明白当一个系统的诚信关卡靠的是检测虚构的工具调用结果那这套检测机制本身的可靠性边界在哪里如果模型学会了生成更精巧的虚假痕迹这道防线还能撑多久QAQ1Apodex 1.1和上一代Apodex 1.0相比最大的进步是什么A在多个专业任务测试上都有大幅提升比如APEX-Agents测试从16.5分涨到38.5分数学竞赛IMO 2025从12.5分涨到36.5分并跨过金牌线同时新增了任务看板、异步人工介入、非对称验证等一整套协同机制。Q2为什么一个35B参数的小模型也能表现这么好A因为Apodex团队的核心方法是靠更丰富的可执行训练环境和更聪明的多智能体协同机制来提升能力这两条路径对小模型同样有效不完全依赖堆参数量所以Apodex 1.1 mini能在FrontierFinance等测试上追平甚至超过参数量更大的开源模型。Q3HDS6评测和普通的准确率测试有什么区别AHDS6专门评估任务执行的过程质量而不只是最终结果对不对包含证据可信度、失败后的自我纠正等六个维度还设有诚信关卡一旦发现虚构的工具调用记录整条任务轨迹的分数会被直接判零。