ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AI芯片选型实战:云端、边缘、端侧三条线怎么选?

AI芯片选型实战:云端、边缘、端侧三条线怎么选? 开头可以先聊行业现象比如AI芯片大会、创业者迷茫选型然后引出三条线。注意不能有元信息。尝试写正文AI 芯片这行这几年热得发烫几乎每个做 AI 应用的朋友都会问同一个问题训练和推理到底该买谁的卡其实“AI 计算芯片”并不是一个孤立的品类它背后对应的是三个完全不同的战场——云端、边缘、端侧。这三条线对算力的要求、功耗限制、生态依赖、成本结构都不一样选错了不只是花冤枉钱严重的时候会让整个产品从技术上就站不住脚。这篇文章就按这三条线把主流玩家和选型思路拆开聊透帮你搞清楚自己到底该在哪条线上挑芯片。然后主体。1. 先搞清三条线的本质差异1.1 从场景倒推需求算力、功耗、时延、成本先做一个最基础的思维转变不要盯着芯片参数看要盯着场景看。同样是识别一张图像里的行人放在云端允许几十毫秒的网络往返随便用大模型放在边缘摄像头里必须在几十毫瓦内完成还不能断网放在手机里要兼顾续航和发热可能还得考虑隐私能不能不出终端。这三个完全不同的约束条件决定了芯片设计路线完全不同。我把关键差异整理成了下面这张表方便后面按图索骥对比维度云端AI芯片边缘AI芯片端侧AI芯片核心场景大模型训练、高并发推理工业质检、智慧安防、自动驾驶手机、PC、IoT、智能家居首要指标绝对算力、互联带宽、显存容量能效比、确定性时延、接口丰富度极低功耗、集成度、成本典型功耗数百瓦到上千瓦5W-60W左右0.5W-10W部署位置机房现场设备/网关终端设备内部核心挑战分布式扩展、散热、生态恶劣环境、模型适配、OTA内存带宽、量化精度、散热看完这张表你就应该明白把云端的旗舰卡塞进边缘盒子不是性能不够而是功耗和体积完全不匹配反过来把端侧的NPU搬上云端算力又撑不住动辄几十亿参数的大模型。所以“三条线”不是营销概念是物理约束下的必然分层。1.2 为什么不能“一片打天下”有人会问能不能设计一种全能芯片云端边缘端侧通吃说实话理论上能但做出来一定是灾难。云端需要的是大规模并行计算而且模型规模越来越大单卡算力已经不够还要靠高带宽互联把几千张卡连成一个超级计算机边缘和端侧面对的是单模型或小模型推理数据结构更多样还得和摄像头、传感器、电机控制器这些外设直接打交道。用做饭来打比方云端芯片是中央厨房追求的是同一时间炒几千道菜拼的是灶台数量、煤气管道和调度系统边缘芯片是连锁店的后厨你得在有限空间里快速做一桌菜还要保证菜品稳定端侧芯片则是随身带的保温饭盒你得考虑用几节电池加热、能不能塞进背包、成本贵不贵。三者的设计哲学完全不一样这才是选择困难的第一层原因。2. 云端AI芯片大厂主场生态就是护城河2.1 主流玩家盘点云端是AI芯片竞争最血腥的地方因为天花板够高一个订单就是几亿美元。目前有资格站上牌桌的主要就是下面这一批厂商/产品线代表芯片核心优势主要顾虑NVIDIAA100、H100、H200、B200CUDA生态无人能敌大模型训练事实标准价格高、供货周期长、依赖NVLinkAMDMI300X、MI325X性价比优于同代N卡HBM容量大生态和通信库仍需追赶IntelGaudi 2、Gaudi 3网络互联设计巧妙性价比高软件栈成熟度一般GoogleTPU v5p、TPU v6自研架构超大规模集群经验丰富仅云服务对外绑Google CloudAWSInferentia、Trainium深度集成SageMaker成本可控只能在自己云上跑华为昇腾910B、昇腾910C支持FP16/BF16自研达芬奇架构生态仍在完善供应受限制寒武纪思元590国产化选择训练推理覆盖软件生态相对小众海光深算一号x86生态迁移成本低算力与国际头部有差距GraphcoreColossus IPU推理延迟低架构独特商业上处于调整期我见过不少团队手里握着十几张H100的订单结果也是要排队等货。这里想问一句你真的需要训练千亿参数大模型吗如果只是推理完全可以用性价比更高的方案。2.2 选型时最容易被忽略的隐蔽成本很多团队选云端芯片只看FP16算力打个比方H20这个特殊型号其实算力并不差但是互联带宽被砍得厉害多卡并行时性能直接塌方。所以不能只看单卡指标还得看“集群效果”。另一个隐蔽成本就是生态锁定。NVIDIA贵有贵的道理CUDA生态里的PyTorch、TensorFlow、DeepSpeed、vLLM基本是即插即用遇到问题搜一下就有答案换成其他芯片经常得自己编译算子、修通信bug、调分布式参数这部分人力和时间成本很容易被低估。我自己帮人调过一家国产卡跑大模型推理光是FlashAttention的适配就折腾了两周最后性能还比预期低三成。但情况也在快速变化。如果你只是做纯推理PyTorch的TorchInductor、ONNX Runtime的EP架构都在做多后端支持逐年内生的适配成本其实在降低。选型时不能光看“能不能跑”要看“跑出八成性能需要多少人力”。2.3 云端部署的实操建议我的习惯是先做三轮实测。第一轮把你要用的真实模型跑起来不要跑ResNet这种玩具要跑你生产环境里最大那个模型第二轮测并发吞吐和P99延迟用真实的请求分布去压测不是连续打满第三轮把量化开关打开对比FP16和INT8的精度损失、吞吐提升。这三轮跑完再结合价格、供货周期和运维成熟度做决策方向基本不会跑偏。此外显存容量是个比算力更隐蔽的瓶颈。一个70B的模型就算用INT4量化权重也要35GB左右加上KV Cache和中间激活至少要40GB以上的显存。所以如果你要部署大语言模型优先看单卡显存和HBM带宽而不是单纯看算力TOPS。这也是AMD MI300X虽然软件栈弱一些但在大模型推理场景很有竞争力的原因——192GB的HBM3一块卡顶三块H100的容量。3. 边缘AI芯片在功耗墙和性能墙之间走钢丝3.1 边缘计算到底需要什么边缘这个词经常被混用有人把边缘理解为“放在机房里的小型服务器”有人把边缘理解为“摄像头里的主控芯片”。我倾向于把边缘定义为处于云端和终端之间在物理位置上靠近数据源头具备独立算力、可运行AI模型的计算节点。它的典型形态是边缘盒子、工业IPC、车载域控制器、机器人主板这些。边缘最大的特点是“没人伺候”。放在配电房的推理盒子可能一年才有人去巡检一次装在铲车上的域控制器得承受振动、高低温、电源波动。这意味着芯片必须满足宽温工作、抗冲击、功耗可控、掉电保护以及Linux内核长期稳定。这些指标在数据手册里看起来很枯燥实际落地时比算力还要命。3.2 主流芯片与开发板对比边缘AI推理的主流选择目前集中在英伟达Jetson系列、国产的昇腾/地平线/瑞芯微/算能这几家具体比较如下芯片/模组典型算力功耗适合场景上手难度Jetson Orin Nano40 TOX稀疏7W-15W轻量视觉、小型机器人低生态活跃Jetson AGX Orin275 TOX15W-60W自动驾驶、多路视频分析低昇腾 Atlas 200 DK22 TOPS8W-20W工业质检、智能安防中需要学CANN地平线旭日X3派5 TOPS2W-5W低价位AI摄像头、智能IoT低瑞芯微 RK35886 TOPSNPU5W-15W中控面板、边缘盒子、多屏交互低算能 SE517.6 TOPS12W-25W边缘盒子、算法仓中工具链尚可这里特别提一下Jetson系列为何在边缘领域几乎成为事实标准。一方面是有完整的JetPack SDK包括CUDA、TensorRT、DeepStream你的云端模型可以平滑搬迁另一方面社区资料极其丰富踩坑帖子一搜就有。如果你要做边缘AI且不限国产化Jetson Orin系列是我给的第一推荐。不过要注意今年Jetson Thor系列也在迭代如果你想跑多模态模型尽量往高内存版本走Orin系列对7B以上模型还是有些吃力的。3.3 边缘部署常见坑边缘部署的坑几乎都在“软件集成”而非“芯片本身”。我遇到过三个非常典型的问题第一散热设计没留余量。Jetson Orin在满载时功耗直冲40W如果你装在密闭金属盒里还不加主动风扇用不了多久就会过热降频推理帧率直接从30掉到10。规划时绝对要按最高功耗做一个热仿真别被“典型功耗”误导。第二存储卡损坏。边缘设备经常露天部署电压波动和高温会让SD卡很快就出坏块。我这两年几乎不再用SD卡跑生产环境全部改成eMMC或NVMe固态并且把日志写到内存文件系统里重启自动清理最大程度减少写盘次数。第三模型转换后的精度掉点。TensorRT/CANN在FP16量化后很多模型会出现几个点的精度损失尤其检测框坐标偏移很常见。一定要在转换后做端到端精度回归测试不能只看“能跑通”。常用的办法是在转换时用混精度对敏感算子保留FP32损失能控制在1%以内。4. 端侧AI把大模型塞进口袋4.1 手机SoC的AI算力竞赛端侧AI芯片没有一个独立的名字它藏在手机SoC里作为“NPU”或者“AI加速器”。这几年手机厂商发布会必讲TOPS参数为了跑本地大模型高通、联发科、苹果三家已经打到刺刀见红。SoCAI算力内存带宽代表机型骁龙8 Gen 3约45-50 TOPS78.3GB/s小米14、三星S24骁龙8 Elite约70 TOPS至少128GB/s多款旗舰天玑9300/9400约45-70 TOPS到100GB/svivo、OPPO旗舰苹果A17 Pro/A18约35-55 TOPS100GB/siPhone 15 Pro/16要注意这些TOPS大多是INT8稀疏算力实际跑模型时内存带宽才是瓶颈。端侧大模型目前普遍是2B-7B的参数规模每解码一个token都需要把几十GB权重从LPDDR搬到NPU里带宽不够算力再高也是空转。这也是为什么手机大模型反而比想象中慢——不是NPU不够强是DRAM带宽封顶了。4.2 端侧AI的落地形态端侧AI并不是真的跑ChatGPT级别的大模型给你聊生活而是把那些对时延和隐私敏感的任务本地化。最典型的几个形态语音助手唤醒词、本地语音识别、语义理解在端侧完成隐私收益极大响应速度也快。影像增强夜景降噪、超分辨率、物体消除都是靠NPU在拍照瞬间完成。文档摘要/翻译3B小模型在手机本地提取会议纪要实时摘要。智能穿戴与家居手表上的心率异常提醒、门锁上的人脸识别全靠端侧NPU。做端侧AI最重要的是“克制”。芯片厂商会给出很多跑分数据但真实产品不需要全速跑只需要在预算功耗内跑赢特定场景。比如人脸解锁要求从待机到识别在400ms以内平均功耗最好小于0.5W超过这个阈值就发热掉电体验全毁。4.3 端侧部署的技术要点想把模型部署到端侧我习惯按这个顺序走先做量化感知训练不要等训练完再量化否则精度崩掉重来很费时间。看算子支持矩阵主流的NPU对Conv、FC、Softmax等支持很好但对FlashAttention、RMSNorm这样新算子不一定原生支持要提前确认或用CPU回退。做算子融合和内存复用比如Residual加Activation在NPU上最好合成单个算子减少中间张量写回DDR的内存带宽压力。用真实设备做功耗评估不要只看芯片表底要接电流计跑完整场景。现在很多端侧芯片供应商都有自己的模型部署工具链比如高通的AI Engine Direct、联发科的NeuroPilot、瑞芯微的RKNN。这些工具链在示例模型上表现良好但一遇到自定义结构就开始拉胯这是我的长期体验。所以如果你的模型比较新颖一定要预留两周以上的工具链适配时间。5. 跨场景选型决策框架5.1 需求拆解清单聊到这儿你可能已经开始拿自己的项目条件比照了。为了避免被厂商宣传带跑我建议你用一个五维清单来收敛需求决策维度需要回答的问题模型类型是CNN还是Transformer为主参数量多大吞吐需求每秒处理多少路视频流/多少次请求时延上限单次推理能容忍多少毫秒功耗预算可用功耗是多少散热条件如何部署环境室内/室外移动/固定是否需要长时间无人值守一个技巧是先定下来“最不可能妥协的那条约束”。比如你的产品必须在无风扇密闭盒子内运行那功耗就是第一约束算力只能续往功耗里求如果你的产品是做实时游戏对战AI那时延就是第一约束谈任何离线批处理都没意义。把第一约束明确后筛选范围直接缩小大半。5.2 参考案例智能安防摄像头用一个最常见的场景来说明决策路径某园区需要一台边缘盒子对16路1080P摄像头做实时人形检测。如果选云端方案全部视频推到云上光带宽成本就够喝一壶的且时延受网络抖动影响大直接pass。如果选端侧方案每个摄像头内置AI芯片成本确实低但16路合流分析、跨摄像头轨迹追踪无法在端侧完成pass。最终应该在边缘盒子上选一款算力在20-50 TOPS之间、支持多路解码的芯片。比如Jetson AGX Orin或者昇腾Atlas 200I都可以胜任8-16路解码芯片自带NVDEC或DVPP。这里如果做纯人形检测单路推理时延控制在30ms内即可不需要追求极致算力。5.3 成本模型很多团队喜欢用“硬件单价”来比价但真实的成本结构往往是三层硬件成本、开发成本、运维成本。硬件成本是芯片和板卡的采购价开发成本体现在工具链学习、模型适配、性能调优上运维成本则是整机功耗、故障率、现场维护和OTA升级体系。举个例子Jetson方案单板比RK3588方案贵两三倍但Jetson的TensorRT生态能帮你节省至少两个月的开发时间而且支持远程无缝更新JetPack包。如果你有10个工程师投入6个月一天的开发成本就是小几万这两个月省下来的钱足够覆盖所有硬件差价了。反过来如果只是做个门锁摄像头用2W的瑞芯微单芯方案就够了用Jetson就是杀鸡用牛刀。6. 趋势观察与个人心得6.1 三条线在走向融合与分化表面上看三条线越走越远云端在冲万亿参数和超高互联边缘在强调整车算力和确定性时延端侧在压缩功耗和成本。但另一个趋势是架构的融合。现在云端芯片开始加入稀疏化、低精度计算能力边缘芯片开始支持Transformer和注意力机制端侧NPU则出现了越来越多的“本地多模态”专用单元。与此同时开发范式也在趋同。出了NVIDIA生态的开发者在国产芯片上一样用类ONNX的中间表示一样写“编译-转换-部署”的流水线。这意味着你选芯片时可以先不看底层细节而先看“这个工具链能不能把我的模型快速转成高效推理”。工具链的完整度和文档质量正在变成比硬件参数更重要的决策变量。6.2 我的几条经验建议最后分享几条我这些年踩坑换来的经验第一别迷信峰值算力。AI芯片标称的TOPS几乎都是理想条件下的稀疏INT8算力真实应用能跑到一半就不错了。直接用你的真实模型去测测出来的才是你知道的准。第二把模型先做好再挑芯片。很多项目先在展示模型上看着很好等做完才发现目标芯片连某个算子都不支持又要重新改结构。我养成一个习惯在项目一开始就把目标芯片的算子支持表拉出来把待部署模型过一遍有风险项提前改。第三一定留出“软件升级”的接口。芯片的硬件性能和软件优化之间往往还有很大的挖掘空间比如NVIDIA每年更新TensorRT都能白捡10-30%的推理性能。选择芯片时要考察他的软件团队是否在持续更新这远比某个参数堆得高不高重要。第四如果想快速做原型验证优先选开发资料多、社区活跃的芯片哪怕贵一点也值得。你的时间也是成本一个连入门文档都写不清楚的芯片再便宜也贵。这几年国产AI芯片发展非常快从云端到边缘都有能用的产品了但很多时候大家抱怨的并不是性能而是软件生态的碎片化。我个人觉得未来的选择逻辑会越来越多地从“选硬件”转向“选软件体系”谁能让你最快把模型跑起来并持续稳定运行谁就是最适合你的芯片。这比盯着功耗和TOPS做算术有意义得多。
返回列表