ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Grok 4.7五次跳票后,xAI直推4.8:2.5万亿参数C++重写,路线图指向AGI

Grok 4.7五次跳票后,xAI直推4.8:2.5万亿参数C++重写,路线图指向AGI 2026年9月13日Elon Musk在X平台宣布xAI的下一代模型Grok 4.8正在完成主体训练参数量2.5万亿基于xAI从零自研的C软件栈构建训练结束后将立即进入强化学习阶段。这一消息发出时参数量2.1万亿的Grok 4.7仍处于未发布状态——也就是说xAI在上一个模型尚未交付的情况下已经宣布了规模更大、架构更新的下一个版本。五次未兑现的承诺Grok 4.7的延期历史颇为曲折。据cellcog.ai梳理从2026年7月24日“四周内发布”到8月12日“三到四周内”再到9月1日“十天后”Musk先后给出了至少五个不同的发布节点全部落空。9月11日他给出了迄今最具体的技术解释强化学习训练对模型的回复长度施加了过度惩罚导致模型在能力范围内的困难问题上提前放弃而不是坚持解题自我检验也不够严格。大模型在RL对齐阶段出现能力退化并不罕见但Grok 4.7的情形指向一个具体的设计权衡为了让模型输出更简洁训练信号惩罚了过长回复但副作用是削弱了需要长链推理才能解决的高难度任务上的表现。这与“参数量更大即更强”的直觉预期产生了矛盾。9月14日Musk进一步下调了对4.7的公开定位将其描述为“大致与Anthropic的Opus 5.0相当”而非此前暗示的全面超越市场现有最强。Grok 4.8的架构赌注Grok 4.8的技术差异不只是参数量从2.1万亿增加到2.5万亿增幅约19%这一项。据progressiverobot.com报道xAI为这一版本构建了全新的C训练基础设施运行在22万张英伟达GB300 GPU上GPU之间通过800G高速网卡互联大量使用流水线并行。Musk声称这套方案的训练效率比主流JAX方案高出“一个数量级以上”。自研训练框架是一项高风险高回报的选择。PyTorch、JAX等主流框架积累了多年的社区调试和优化从零构建意味着xAI要独立处理所有底层的数值稳定性问题、分布式通信的边界情况和内存管理细节。一旦调通这套栈将与xAI自身的Colossus超级算力集群形成深度绑定竞争对手无法直接复制。Grok 4.7已经展示了RL阶段的脆弱性切换到自研训练框架后Grok 4.8的风险点同样有增无减。SpaceX数据的护城河Grok 4.7的训练纳入了SpaceX的工程数据包括内部文档、遥测数据、星链卫星记录和火箭研发资料。据bighatgroup.com报道这一补充训练阶段在主预训练结束后进行是发布前的最后一步。这是xAI拥有的唯一一类竞争对手在物理上无法复制的数据资产。OpenAI、Anthropic、Google DeepMind都没有办法获取SpaceX的工程遥测数据库。基准坐标从Grok 4.6的实际表现出发理解4.7和4.8的相对位置需要从唯一已公开发布的上代模型出发。据finance.biggo.com报道的评测数据Grok 4.6在AA智能指数上得分61与GPT-5.6 Sol Max持平但低于Claude Fable 5 Max的62分。在GDPVal-AA v2基准上Grok 4.6得分1753领先同代竞品。但在Terminal-Bench v3.0上Grok 4.6仅得26%明显落后于GPT-5.6 Sol Max的34.6%。这组数字勾勒出一个能力分布不均的模型综合推理接近顶级但在涉及终端操作、命令行执行的任务类型上存在结构性短板。Grok 4.5在同一指数上仅得56分4.6升至61这一代际跃升是真实的。但Musk将4.7定位在“Opus 5.0相当”意味着4.7相对4.6的实际提升幅度比最初的宣传保守了不止一个台阶。定价唯一无争议的竞争优势在性能定位来回调整的背景下Grok家族目前最可量化的优势是价格。据progressiverobot.com报道Grok 4.6的API定价为每百万token输入$2、输出$6而竞争对手旗舰模型通常在$10/$50区间。这个五倍左右的价格差在大批量调用场景中足以改变企业的选型逻辑。如果Grok 4.7和4.8在正式发布时维持相近的定价区间并能在Terminal-Bench类任务上弥补4.6的结构性弱项这将是企业用户实际迁移的触发点。路线图与验证信号Musk给出了一条自评性质的发展路线图Grok 4.7大致对标Opus 5.0Grok 4.8比4.7有明显提升Grok 4.9“大概达到Astra/Fable级别”Grok 5则被定位为xAI的首个AGI级别模型。这条路线图不是基于发布的基准卡也没有独立机构核验——它是创始人在社交媒体上的自我描述。Grok 4.7的经历给这条路线图打了一个底线注脚宣布与交付之间存在结构性时差性能预期在接近发布时会经历下调修正。这不等于路线图本身是错的但对于依赖API稳定性做产品规划的开发者而言需要保留足够的缓冲。以下三个信号将是验证路线图可信度的具体观测点Grok 4.8正式发布时在Terminal-Bench v3.0类任务上的得分官方发布是否附带完整的基准卡、API文档和定价表以及RL训练完成到正式上线之间的实际时间跨度。如果这三项在2026年10月中旬前同时到位且Terminal-Bench得分明显改善xAI的路线图将获得实质性支撑。本文首发于赢政天下 (https://www.winzheng.com/article/xai-grok-4-8-2-5t-cpp-stack-agi-roadmap-grok-47-delay)获取更多深度技术内容与资源欢迎访问官网。
返回列表