ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AI 算力需求从集中训练到广泛推理:端脑科技如何构建云边端协同算力体系

AI 算力需求从集中训练到广泛推理:端脑科技如何构建云边端协同算力体系 摘要随着人工智能从大模型集中训练走向面向创作、科研、开发与企业业务的广泛推理算力基础设施正在由以中心化集群承载训练为主向云端、边缘与本地设备分层协同演进。基于在人工智能、高性能计算及国家超级计算广州中心南沙分中心建设与运营中的长期实践端脑科技联合创始人、CEO兼CTO丁烨形成了一个核心判断算力的价值不仅取决于设备性能更取决于计算资源能否被验证、调度并持续完成真实任务。本文以丁烨从超算基础设施建设走向人工智能产品商业化的职业经历为线索梳理端脑科技自2023年成立以来的业务逻辑以脑花AINPC承载本地模型、AI智能体、专业工作流与私有存储以端脑云连接应用需求、云端资源和分布式算力节点在云端调用与本地自建之间构建云、边、端协同的第三种选择。端脑科技致力于以分布式算力的业务模式补足AI推理抵达真实工作场景所需要的边缘与本地基础设施使分散的计算资源转化为可验证、可计量、可调度和可交付的AI生产力。如果把人工智能看作一个正在生长的生命体大型智算中心是它的主动脉。那里有成排的机柜、高速互联的芯片以及昼夜不停的训练任务。过去几年模型参数不断增加训练集群从千卡走向万卡产业不断为这条主动脉扩容。但只有主动脉智能还不能抵达身体末端。它到不了一名创作者的工作室进不了一位科研人员的实验室也无法自然进入一家中小企业的日常业务。那些离数据最近、离用户最近、每天都在发生的AI任务需要另一套更加细密的系统。丁烨把它称为算力的“毛细血管”。从超算中心到端脑科技算力只有完成真实任务才能创造价值丁烨曾站在算力的另一端。在香港科技大学取得计算机科学与工程博士学位并完成博士后研究后他长期从事人工智能、大数据、并行计算、时空数据分析和高性能计算研究参与发表40余篇国际期刊和会议论文并作为发明人参与80余项授权专利。在香港科技大学霍英东研究院工作期间他作为核心负责人参与国家超级计算广州中心南沙分中心的建设与整体运营。超级计算中心拥有庞大的计算能力。但设备进入机房只是工作的开始。科研任务从哪里进入不同用户如何获得资源数据怎样流转任务失败以后如何恢复计算能力又如何从设备参数变成科研机构和企业真正可以调用的服务这些问题没有一项能够只靠增加芯片解决。也是从那时起丁烨逐渐形成一个判断一台设备只有被调用才真正拥有算力一份算力只有完成任务才真正产生价值。多年以后这个判断从大型机房来到普通桌面。2023年5月端脑科技成立。彼时大模型浪潮正推动全球算力投资向大型人工智能数据中心集中。模型越来越大集群越来越密行业的目光大多投向云端。丁烨却看向云端之下。训练大模型需要集中算力大模型训练完成以后的使用却是分散的。创作者生成一段视频科研人员检索一批文献开发者调用一次代码模型企业让AI Agent在后台执行一项任务。这些计算发生在不同地点、不同时间对时延、成本与数据边界也有不同要求。训练发生在少数中心推理却伴随着每一次使用。“万卡级训练集群是AI时代的主动脉。”丁烨说“但只有主动脉没有毛细血管智能就到不了工厂、实验室、创作工作室和每个人的办公桌。”端脑科技没有试图用分布式算力取代大型数据中心。它想做的是补上那些尚未充分生长的毛细血管。云端调用与本地自建的两难成本、数据与部署门槛如何平衡要让算力抵达用户首先要面对两种并不轻松的选择。第一种是调用云端服务。云端降低了AI使用的初始门槛。用户不必购买显卡也不必安装复杂环境注册账号、充值费用就可以开始调用模型。但当AI从偶尔问答转向视频生成、科研分析和Agent长期运行云端的另一面开始显现。创作者为了得到几秒钟满意的画面可能需要反复生成、修改和重试科研人员需要持续处理文献、图像与实验数据一个AI Agent可能在后台运行数小时甚至更久。每一次生成、每一个Token、每一分钟计算都在推动计费表继续转动。对高频用户而言最初轻便的调用方式可能逐渐成为一笔难以预测的长期支出。费用还不是全部。对于企业、科研机构和创作者把任务交给云端也意味着数据离开原有设备和内部环境进入由第三方管理的网络、服务器与存储系统。云端并不天然意味着不安全。但当数据离开本地控制边界、责任边界和审计方式都会发生变化。企业上传的可能是客户资料、合同、源代码、经营数据和内部知识库科研机构处理的可能是尚未公开的实验数据、论文初稿和研究思路创作者交出去的则可能是尚未发布的剧本、分镜、人物形象、声音样本和创作流程。用户必须不断追问数据去了哪里由谁处理保留多长时间是否进入日志能否彻底删除是否可能被用于其他用途云端提供了便利却未必同时给予用户对成本、数据、权限和工作流的完整控制。第二种选择是自建本地服务器。这条路看起来更加自主。设备属于自己模型部署在本地数据也不必离开现场。但真正开始以后用户很快会发现购买一张高性能显卡只是第一步。处理器、内存、存储、主板、电源和散热需要彼此匹配驱动、CUDA、推理框架、模型版本和各种依赖需要逐项安装。一次版本升级可能让原本能够运行的工作流突然失效一次环境冲突也可能让技术人员花费数天排查。设备运行以后还要面对模型下载、量化适配、权限管理、数据备份、故障恢复和后续升级。自建服务器给予用户控制权也把建设、维护与试错的成本一并交给了用户。机器还没有开始创造内容、分析资料和推进研究人已经被困在驱动、配置和报错信息之中。一边是不断转动的云端计费表另一边是需要持续安装、维护和升级的本地机房。端脑科技希望在两者之间找到第三种选择。脑花 AINPC整合本地模型、AI 智能体、专业工作流与私有存储答案首先落在一台主机上。端脑科技将自己的端侧产品命名为“脑花AINPC”。它不是一台普通电脑的重新包装也不是将服务器缩小以后搬到桌面。在端脑科技的设想中计算硬件、本地模型、AI Agent、专业工具、工作流和私有存储应当被整合进同一套可以直接开始工作的系统。复杂的安装、适配和维护被尽可能留在产品背后用户面对的则是一个已经准备好承接任务的AI工作环境。能够在本地完成的任务留在本地需要更大显存和更多算力时再由边缘节点或云端资源接力。用户不必在“完全依赖云端”和“从零自建服务器”之间被迫二选一。数据、速度、成本和模型能力开始获得重新组合的空间。围绕不同工作场景脑花AINPC形成了四类主要产品。MiniMax H3视频工作站面向创作者与内容团队将视频生成模型和创作流程部署到本地减少对外部API的持续调用。端脑科技将其产品主张概括为“0 API调用成本本地畅快生大片。”AI科研工作站将文献处理、知识检索、数据分析、本地模型和AI Agent带进实验室。它保护的不只是数据也包括科研人员长期形成的知识体系和工作习惯。AI大模型工作站面向开发者与企业用户。在相应硬件配置和模型量化条件下它可以运行120B以内的大模型为私有知识库、代码辅助、企业智能体和内部应用提供本地运行环境。AI算力节点工作站则拥有两重身份它首先服务设备拥有者也可以在符合条件时接入端脑云成为分布式算力网络的一部分。四类产品均设有PRO和MAX版本。它们面对不同用户却试图完成同一件事不再要求所有人先成为部署工程师才能使用AI。一台主机由此醒来。它不再只等待用户点击鼠标也不再只在一个人工作时产生价值。它开始承载模型、保存知识、运行Agent并在必要时与更大的算力网络连接。“NPC”也由此有了另一层含义。在游戏中NPC承担持续而重复的工作玩家决定自己要去哪里。端脑科技希望AI也能扮演这样的角色——它在后台整理资料、执行流程、生成内容、推进任务但人始终拥有目标、判断和生活。“让AI当NPC你才是工作和生活的主角。”端脑云连接 AI 应用需求与云端、边缘及本地算力一台设备能够承载AI却无法独立承担所有任务。当模型规模超出本地显存当多模态任务需要更多资源当多个AI Agent开始并行工作算力必须越过机箱寻找更大的空间。反过来当设备处于空闲状态它所拥有的计算能力也不必继续沉睡。端脑云由此出现。分布式算力平台通常从收集设备开始。接入更多GPU、服务器和边缘节点算力池便会不断扩大。一张算力网络似乎已经成形。但接入节点并不等于拥有算力。如果没有持续发生的计算任务大量设备即使保持在线仍然只能等待。它们被记录、被展示却没有真正工作。这像一座已经建成的车站。站台、轨道和列车一应俱全却没有足够的乘客。丁烨认为算力供给只是半张网真实需求才是另外半张。端脑云试图同时连接这两部分。供给侧来自云端计算资源、边缘节点和本地设备需求侧则来自脑花AINPC、AI Agent以及文字、图像、语音、视频等多模态模型。创作者生成一段视频科研人员处理一批文献企业调用一次内部模型AI Agent执行一项长期任务都会形成具体的计算需求。这些任务有不同条件。有的需要更大显存有的对延迟敏感有的数据不能离开本地有的必须在限定时间和成本内完成。端脑云需要识别这些条件再判断任务应该留在本地、交给边缘节点还是调用云端资源。端脑科技将这一过程概括为应用出题平台派单节点解题结果交付。脑花AINPC不只是硬件也是产生任务的入口端脑云不只是资源后台而是连接需求与算力的中枢分布式节点承担计算再把结果交还给用户。半张网与另外半张网由此连接起来。信任与调度分布式算力从设备接入走向稳定交付连接发生以后真正的难题才刚刚开始。丁烨曾用网约车解释分布式算力一万辆汽车停在街上不会自动形成一张出行网络。平台需要确认车辆和司机的身份掌握位置与状态匹配订单规划路线处理故障完成结算。算力节点同样如此。平台需要知道设备属于谁、真实性能如何、何时在线、适合运行哪些模型用户则需要知道数据是否安全、任务中断如何处理、结果能否验证、费用是否透明。这些问题无法回答再多节点也只是一张设备清单。分布式算力必须跨过两道门槛。第一道是信任。信任不是把交易写进区块链就宣告完成。区块链可以证明谁记下了一笔账却无法保证设备不会宕机也无法替平台完成一次稳定交付。真正的信任需要落实到节点身份、性能证明、数据隔离、任务验证、服务等级、计量结算和责任追溯。第二道是调度。不同节点使用不同品牌的GPU拥有不同规模的显存网络质量和在线状态也不断变化。不同任务对模型、时延、成本和数据位置又有各自要求。端脑云既要知道每台设备此刻在做什么也要判断它下一分钟是否有空既要为任务寻找成本合适的节点也要保证模型跑得动、数据边界不被突破、结果能够按时返回。信任决定用户敢不敢把任务交给平台调度决定平台接下任务以后能不能完成。节点数量由此不再是最重要的指标。真正有价值的是有多少节点正在执行任务有多少任务得到稳定交付又有多少算力没有被浪费在等待和空转中。一块显卡插上电仍然只是一块显卡。只有当它可以被验证、被计量、被调度并完成交付它才会从一台沉默的设备变成算力毛细血管中可以流动的生产力。创始团队协同从技术研发、平台运营到产业与市场拓展端脑科技选择了一条并不轻的道路。它同时涉及硬件、模型、智能体、云平台、分布式节点和产业交付。任何一个环节无法衔接整个系统都可能停在演示阶段。丁烨负责技术与产品。他的经历连接了超算基础设施、人工智能研究和用户产品。联合创始人兼COO崔哲铵负责平台运营、增长模型、产品协同和算力生态资源整合。他需要回答节点为什么加入、任务从哪里产生、合作伙伴如何获益、用户为什么持续使用。联合创始人兼CFO谢玲负责投融资、政府与产业关系、品牌公关、国际市场及综合管理。她需要把研发、供应链、生产、渠道、产业合作和海外市场连接起来让技术走出实验室和发布会。三个人分别站在技术、运营和市场的一端却需要共同完成同一条链路把系统做出来把资源组织起来再把产品送进真实场景。中心化与分布式算力协同让 AI 基础设施抵达真实工作场景这场试验仍在继续。异构设备能否稳定调度分布式节点能否建立长期信任脑花AINPC能否进入足够多的工作场景端脑云能否形成持续增长的任务规模都将决定这条道路最终能够走多远。但算力流向桌面的趋势已经越来越清晰。原因并不复杂。数据产生在本地工作发生在本地人与AI的交互也发生在本地。当AI从偶尔回答问题转向持续处理工作本地算力就不再只是云端的备用方案而会成为AI基础设施不可缺少的一层。大型数据中心继续提供强大的主动脉边缘节点和桌面设备则让算力抵达每一处真实需求。毛细血管不是为了取代主动脉。它存在的意义是让整个系统真正循环起来。多年以前丁烨面对的是如何让一座超级计算中心真正运转如今他试图回答的问题变成了如何让散落在各处的设备共同工作又如何让这些算力抵达每一个需要AI的人当算力最终来到桌前AI在后台工作。而人重新回到生活的前台。让AI始终在线让人自由离线。
返回列表