
这两年聊国产AI算力芯片已经不用再解释“为什么要用”了客户上来直接问的是“哪家的卡适合跑我的模型我要上推理预算有限。”这个变化很有意思说明赛道逻辑已经从“做出来”转向了“用起来”。我自己接触到的实际项目中推理和边端这两个方向出现了明显的放量云端的语言模型、视觉模型推理服务边端的智能盒子、工业视觉、边缘大模型一体机都在批量切换或评估国产芯片方案。这篇文章不打算讲泛泛的行业趋势直接把品牌格局、选型逻辑、技术参数和部署经验摊开聊给正在做技术选型、准备落地推理项目的同学一份能直接参考的实操手册。1. 国产AI算力芯片品牌全景谁在做、做到哪一步了1.1 先分层云端、边缘、端侧别混在一起谈很多人一开口就问“国产AI芯片哪家强”这个问题其实没法直接回答因为AI算力芯片不是单一市场。真正落到项目上至少可以分成三层每一层的玩家、评判标准和技术难点都不一样。第一层是云端算力对应数据中心里的AI训练服务器和推理服务器典型负载是大模型预训练、微调、批量推理、在线对话服务。这个赛道对算力规模、卡间互联、集群调度、软件生态完备度的要求最高也是国产芯片和成熟方案差距最明显的领域。第二层是边缘算力形态以边缘服务器、智能盒子、便携工作站为主常见场景是工厂质检、电力巡检、园区安防、智慧交通功耗通常在30瓦到300瓦之间对算力要求适中但对能效比、工具链成熟度和部署便捷性非常敏感。第三层是端侧算力芯片直接嵌入摄像头、机器人、汽车域控制器、手持终端功耗被严格限制在几瓦到十几瓦比拼的是集成度、低功耗和工具链的轻量程度。把品牌按这三层去看脉络会清晰很多云端看生态和集群能力边缘看性价比和工具链端侧看功耗和集成度。选型时先把场景钉死在这个分层里再去对比具体型号才不会出现拿云端训练卡去评估边缘盒子需求这种南辕北辙的错误。1.2 云端玩家昇腾、寒武纪、海光还有一批全功能GPU云端AI算力芯片的品牌分布相对集中而华为昇腾是当前市场声量最大、出货最广的玩家。昇腾的产品线从早期的Atlas 300I系列推理卡、昇腾310系列到中期的昇腾910B训练卡、310P推理卡再到近两年的910C和310B新版本覆盖了训练和推理的完整路径。昇腾最大的优势除了硬件本身更在于原生工具链CANN和周边生态的持续投入尤其是这几年昇腾对vLLM、SGLang、TGI这类主流推理引擎的适配做得相当到位很多开源模型的Serving方案已经能直接跑这在实际项目里是巨大的加分项决定了你能不能以较低成本把现有软件栈迁移过去。寒武纪也是老牌玩家思元系列从220一路迭代到370、590产品同时覆盖训练和推理。思元590是新一代旗舰单卡算力提升明显支持FP16、BF16、INT8等主流精度定位是云端训练和推理场景。思元370是目前出货量很大的推理卡常见形态是MLU370-S4半高卡和MLU370-X8加速卡性价比突出在智算中心推理、视频结构化、大模型推理中应用广泛。寒武纪的软件栈叫Neuware早期不少用户抱怨工具链不够顺手但最近两三年的迭代明显加快了尤其是对PyTorch的兼容性比几年前好了很多。海光信息走的是一条差异化的路。他们的DCU深度计算处理器架构和ROCm体系兼容性非常高软件生态迁移成本相对低。如果你原来在AMD的ROCm环境下写过算子或做过性能调优切到海光DCU会比较顺滑。海光的另一个优势是服务器CPU加DCU的整机方案成熟很多国产化服务器项目直接采用海光CPU加DCU的组合。不过DCU在AI推理场景的生态积累相比昇腾和寒武纪稍弱更多出现在训练和科学计算类项目里。再往下是一批全功能GPU路线的玩家摩尔线程、景嘉微、沐曦、壁仞。摩尔线程的MTT S系列具备完整的图形和计算管线定位接近通用GPU既能做图形渲染也能做AI计算适合需要一卡多用的场景。沐曦有两款产品值得关注曦云C500主打训练曦思N100主打推理产品定位清晰近两年在一些行业大单里开始批量出现。壁仞的BR100系列发布时单卡算力数据非常亮眼但落地放量的速度相对慢。这些厂商的共同特点是软件生态仍在爬坡期如果是成熟业务切过来建议先做概念验证再决定是否大规模铺开。百度昆仑芯的情况不太一样。昆仑芯是百度自研的XPU架构产品早期用于支撑百度搜索、推荐、语音等大规模业务昆仑芯2代在互联网公司内部有扎实的应用基础。它的核心优势在于经历过大规模业务验证稳定性和工程成熟度高而且生态重点适配了PaddlePaddle和常见深度学习框架在搜索推荐类推理任务上表现相当稳健。1.3 边缘和端侧碎片化市场里的新老玩家边缘和端侧市场比云端热闹得多品牌也杂得多。昇腾的边缘产品主要是Atlas 200I/300I系列和昇腾310B在边缘设备市场占有率很高尤其是电力、交通、安防这几类政企项目里经常是首选。算能在国产边缘AI市场也占有一席之地BM1684、BM1688系列芯片配合SE5、SE7智能盒子在工业视觉项目里出现频率很高工具链和文档做得比较踏实适合项目制交付。端侧SoC级芯片更是百花齐放的格局。瑞芯微RK3588应该是这两年开发者圈子里见得最多的国产端侧NPU芯片内置6 TOPS算力的NPU跑YOLO系列目标检测、OCR、人脸识别等中小模型绰绰有余而且开发板生态极其庞大几乎是边缘原型验证的首选。晶晨的A311D、全志的V853适合成本更敏感的终端产品功耗更低常用于摄像头和轻量智能硬件。地平线征程系列主要面向智能驾驶征程5和征程6在车载域控制器里大量使用但近两年也开始进入机器人、无人机等泛AIoT领域它的BPU架构对视觉Transformer优化很到位跑BEV类模型的效率相当不错。黑芝麻智能、爱芯元智等厂商也在这一赛道各有侧重。这里特别提一下存算一体路线。后摩智能的鸿途H30基于存算一体架构核心思路是让计算直接在存储阵列上完成大幅减少数据搬运能效比非常突出。这类芯片尤其适合边缘场景里功耗严格受限、同时又要跑Transformer模型的设备虽然生态还比较年轻但代表了国产芯片在架构创新上的一条不同路径值得持续关注。2. 为什么推理与边端才是真正的突破口2.1 训练市场的高墙不只在芯片本身很多人的第一反应是国产AI芯片要突破当然应该从训练卡开始毕竟训练是最显眼的算力需求。但实际做下来你会发现训练市场反而是最难啃的骨头。大模型训练是一个集群级的系统工程不是单卡算力堆得上去就行的。训练需要多卡高速互联、集合通信库、梯度同步、断点续训、集群调度这些能力要芯片、网络、软件栈一起协同打磨很多年。即便单卡性能勉强跟得上组网之后的线性扩展比往往差距很大这导致国产训练卡在高性能训练场景里始终要面对比其他方案更严格的审视。更现实的障碍是软件生态的绑定效应。训练框架和模型代码大多基于CUDA生态编写各种定制算子、分布式策略深度依赖NVIDIA的库生态。要让一套模型在国产芯片上跑到和原来相当的性能往往要花大量时间做算子迁移、精度调试、性能调优。所以训练市场的态度必须现实可替代但要付出实实在在的迁移成本。绝大多数客户更倾向于用国产训练卡承接非核心业务或增量业务而不是一刀切替换核心训练集群。2.2 推理是更大的市场也是更务实的入口推理和训练的商业逻辑完全不同。推理服务是持续运行的单个请求的计算量相对固定核心指标是单卡吞吐、响应延迟、功耗和每一千token的成本。推理任务的负载形态更接近标准化的运行服务一个模型部署上线后可能要稳定跑几个月甚至几年不会频繁改动。这意味着推理场景对集群互联的依赖度低得多对单卡能效和单位成本的敏感度高得多软件栈迁移的复杂度也比训练低一个量级。这两年的市场信号非常明显大模型从训练热潮转向应用落地推理需求开始爆发。上线一个ToB智能客服、一个文档审阅Agent、一部AI短剧生成系统背后都是推理服务在支撑。而且推理的算力消耗是按token计量的每一次请求都在烧钱成本天然就是最敏感的指标这就给了国产芯片很好的切入点如果推理服务在主流方案上每月的算力账单很高换用国产芯片在可接受的性能损耗下能省下30%甚至更多的算力成本这笔账在商业上立刻就能算过来。从技术实现角度看推理部署也确实更容易被国产芯片拿下。主流推理引擎如vLLM、SGLang、TGI已经做了大量兼容层工作配合ONNX导出、量化、张量并行等手段把开源模型迁移到国产芯片上的工作量比一年前小了很多。我实测下来一个中等规模的开源模型从模型导出、量化到目标设备推理框架适配熟练的话两到三天就能跑出一个可用的基准测试结果。这个周期已经进入很多企业可以接受的决策范围了。2.3 边端场景的碎片化红利恰好是国产芯片的长处边缘和端侧是国产芯片更舒服的战场原因可以总结为三点。第一碎片化场景对单一生态垄断的依赖非常弱。边缘AI没有一个统一的运行时标准每个项目用的模型、框架版本和部署模式都不一样项目制交付本身就是常态芯片厂商只要愿意投入技术支持就能拿到单子。很多国产芯片厂商在政企项目里派驻本地化的技术支持团队这种贴身服务是大型海外生态厂商很难做到的。第二功耗和成本约束天然偏向够用就好的方案。边缘场景不需要上万TOPS的云端算力需要的是在10瓦功耗内把某个指定模型稳定地跑起来。这种需求对单卡极限算力不敏感对能效比、成本、集成度和长期稳定性更敏感恰好绕开了国产芯片在极限算力上的短板。第三数据隐私和合规要求推动本地化部署。不少工厂、医院、金融机构不愿意把视频流和敏感业务数据上传到云端边缘推理盒子可以在本地直接完成数据分析和结果输出。这种需求近两年在安防、工业、医疗影像等方向越来越普遍直接带动了国产边缘AI设备的出货量增长。所以结论不是简单的“训练不行所以做推理”而是推理和边端在商业逻辑、技术门槛、交付模式上确实更匹配国产芯片当前的能力结构。训练赛道是压强赛比拼的是极限工程能力推理和边端是宽度赛比的是场景理解、成本控制和交付效率后者显然更适合作为突破口和根据地。3. 推理与边端芯片的核心技术指标怎么看3.1 算力不能只看TOPS要看有效吞吐芯片厂商宣传页面上的“XX TOPS INT8算力”看起来很猛但实际部署效果经常打对折。原因很简单TOPS是理论峰值而推理性能的真实瓶颈往往出在内存带宽、算子实现效率和并发调度能力上。以大语言模型为例单次生成一个token的计算量主要来自矩阵乘加操作真正的瓶颈往往在权重数据的搬运上。如果显存带宽只有300GB/s模型权重又有几十GB那么理论上每生成一个token最快也要几十毫秒这是物理瓶颈算力再高也突破不了。所以同是标称200 TOPS的两款芯片带宽差一倍实际的大模型推理吞吐可能差30%以上。看参数时建议拉一张表同时看四个指标单卡INT8/FP16算力、显存容量、显存带宽、功耗TDP。其中显存带宽对大语言模型推理的重要性通常排在算力前面。还要追问一句这个TOPS是在什么频率、什么功耗条件下测得的同样的芯片把频率拉高一点TOPS数字就能好看不少但实际部署时可能根本不允许长期满频跑散热和供电跟不上就会降频性能立刻缩水。这种数字游戏在国产芯片里不少见选型时千万别只看宣传页。3.2 精度支持矩阵FP16、BF16、INT8、INT4一个都不能少翻国产芯片的规格表最容易被忽略的就是精度支持范围。不少老一代的国产AI芯片只支持FP16和INT8两三年前够用但今天的主流大模型推理几乎离不开FP8、BF16和低比特量化。FP8能把显存占用和带宽需求直接砍半数值范围和FP16不同的BF16在很多模型上的表现也不一样如果目标设备只支持FP16某些用BF16训练的模型导出后精度表现很可能出问题。另外如果你打算部署的模型用了FP8动态量化或AWQ/GPTQ低比特量化芯片是否支持对应的算子和数据类型直接决定工作量的大小。建议在选型阶段就拿目标模型做一次精度摸底导出FP16和INT8两个版本分别在参考平台和候选国产芯片上跑一遍用相同的测试样本集对比输出结果的数值偏差。如果困惑度或BLEU这类业务指标偏差在可接受范围内再进入性能测试。这一步看着琐碎但能屏蔽掉上线后才发现精度崩掉的一大半风险。3.3 工具链和框架兼容性决定你的交付周期芯片的硬件指标只是半场另外半场是软件栈和工具链。国产芯片和主流方案最大的差距其实就在这主流生态沉淀了十几年几乎所有框架、推理引擎、算子库都有成熟适配国产芯片的工具链则还在追版本的道路上。好消息是这几年改善非常明显而且有一个很直观的判断标准看它对外部推理引擎的支持程度。一个芯片如果官方或社区已经适配了vLLM、SGLang、TGI、ONNX Runtime甚至llama.cpp说明它的生态是活跃的你有大量现成代码可以复用如果只是自家框架里支持模型导出外部框架没有适配那交付成本会高出一个量级。我个人的经验是优先选择那些在开源社区能看到活跃适配仓库、Issue响应及时的品牌这些信息比任何宣传物料都真实。另外一个容易被忽略的点是驱动稳定性和多进程调度能力。推理服务器经常要同时跑多个模型实例对并发调度和显存隔离都有要求。有些芯片单模型推理表现不错多实例并发就出现显存碎片、调度抖动这种问题看规格表发现不了必须在采购前用真实负载做压力测试。3.4 边端场景还有三个隐性指标编解码、内存和继承性边缘和端侧选型除了AI算力还得看视频编解码能力、内存带宽和接口丰富度。视觉类项目通常要对视频流做解码、缩放、推理、编码如果芯片的硬件编解码器太弱CPU会被拖到崩溃。瑞芯微RK3588能成为爆款不单是因为那6 TOPS NPU还因为它的8K编解码能力和丰富的外设接口让一个SoC就能撑起一个边缘盒子的全部功能。内存方面要注意端侧NPU通常和CPU/GPU共用内存内存带宽和容量直接决定你能跑多大的模型。RK3588跑YOLOv5s或轻量OCR没问题但跑大一点的视觉Transformer模型就要掂量了这类场景建议选支持LPDDR5更高带宽的型号。整机功耗、工作温度范围、平均无故障时间这些工规参数也不能省毕竟边缘盒子和摄像头经常要在没空调的配电间、户外杆件上常年运行稳定压倒一切。4. 从选型到部署一套可落地的实操参考4.1 推理服务器选型从模型规模和QPS倒推推理服务器选型建议用倒推的方法不要先看芯片再想用途。具体步骤是先确定要部署的模型参数量、batch size和目标延迟再统计并发请求量和QPS要求最后推算需要几张卡、多大显存和什么带宽的芯片。以部署70B参数对话模型为例假设用INT8量化后模型权重约70GB那么单张卡的显存至少需要80GB以上或者用两张40GB以上显存的卡做张量并行。这种情况更适合考虑昇腾910B、寒武纪MLU590这类旗舰推理卡。如果只是部署7B的小模型INT8量化后权重约7GB一张32GB显存的推理卡就能跑起来还能同时常驻多个模型副本提升吞吐。推理卡选型还要关注卡间互联方式。张量并行推理对卡间通信带宽要求很高如果卡间走的是普通PCIe而不是专用的高速互联大模型推理会因为通信开销增大明显掉速。在单机推理服务器这种不进集群调度的场景里还要确认驱动对显存映射、并发上下文的支持能力。这些细节最好让芯片厂商的现场工程师提前出方案你只需要提供模型清单、QPS预估和延迟上限这三样关键信息。4.2 边缘与端侧选型从功耗、精度和场景出发边缘盒子选型比服务器复杂因为场景太发散。我给自己总结了一个实用的判断框架先把任务分成纯视觉任务和多模态或大模型任务。纯视觉任务如目标检测、OCR、人脸识别、工业缺陷检测大多数场景用NPU SoC就够RK3588、BM1688、昇腾310B这几类芯片都能胜任模型小、算力中等、整机功耗控制在10到30瓦。多模态和轻量大模型任务比如边缘端语音理解、图像描述生成才需要上更高内存带宽的推理卡或专门的大内存盒子。边缘场景里工具链体验往往比算力数字更影响交付。重点关注这几个能力模型转换工具上不上手比如ONNX转目标芯片格式的流程是否顺畅支不支持动态输入尺寸有没有完整的C和Python部署SDK文档和示例代码质量如何。我的选型标准里有一条不成文的土办法按厂商文档复现一个官方YOLO部署示例如果两小时内跑不起来这个厂商就要慎重考虑了。这个测试能筛掉一大部分工具链拉胯的产品。4.3 部署流程示例从PyTorch模型到国产芯片推理服务下面以最常见的流程为例写一条从PyTorch模型到国产芯片推理服务的标准路径不同品牌的步骤大同小异具体以目标芯片的工具链为准。第一步是导出模型。视觉模型用PyTorch的torch.onnx.export导出ONNX格式注意固定输入尺寸或设置动态轴动态轴在后续转换中会更灵活。语言模型优先考虑用推理引擎的量化入口导出例如通过vLLM或SGLang的脚本直接导出INT4或INT8模型比先导出FP16再转量化省事很多。第二步是格式转换与量化。用厂商提供的转换工具把ONNX转成芯片专用格式同时做INT8 PTQ量化。量化校准集的选取很关键建议从真实业务数据中采样200到500张图片或几百条文本纯随机校准集容易导致精度偏差这一点后面还会细说。第三步是编写推理封装。用厂商SDK写一个推理服务提供HTTP或gRPC接口或者直接把推理能力封装成静态库交给业务方集成。如果做Serving类场景优先选择已经适配好vLLM或SGLang方案的芯片可以直接用官方镜像和启动脚本工程成本直线下降。第四步是性能调优。重点调整batch size、并发线程数、输入队列深度统计首token延迟、吞吐和显存占用。实测中把batch从1调到4很多芯片的吞吐能接近线性增长但延迟也会同步上升需要根据业务要求做权衡。第五步是稳定性压测。用模拟真实流量的脚本跑连续48小时推理观察是否存在显存泄漏、驱动崩溃、温度过高导致的降频。这一步必须做边缘设备常在高温环境运行温度一高就降频推理延迟立刻抖动起来。5. 部署中的常见问题与避坑实录5.1 精度踩坑量化后输出突然崩了量化是推理部署里最容易出问题的环节。我踩过一个很典型的坑把一个大模型做INT8 PTQ量化部署到国产推理卡上离线测试指标一切正常上线后发现特定领域的生成内容开始出现逻辑混乱。排查到最后问题出在校准集上——我用了通用公开数据集做量化校准而线上业务的数据分布差异很大导致量化比例尺在长尾数据上失效。换用真实业务数据重新校准之后问题就消失了。另一个高频问题是算子精度差异。不同芯片实现的算子内部算法不一样浮点运算不满足结合律误差会逐层累积。如果部署精度是FP16或BF16务必做数值敏感度分析。最简单的做法是拿10到20条典型测试用例跑一遍比较参考平台和部署芯片的输出概率分布如果KL散度超过0.01这种量级的阈值就要考虑换成更高精度或用算子融合的方式做调整了。5.2 性能瓶颈带宽吃紧和并发抖动大模型推理中显存带宽是最大的硬瓶颈。我有一次在边缘盒子上部署中等规模的视觉语言模型芯片标称算力远超需求实测吞吐却只有理论值的30%。排查之后发现瓶颈几乎全在权重读取上模型权重超过片上缓存每次推理都要从内存搬数据带宽被彻底卡死。解决办法是缩减batch size、用更激进的INT4量化或者直接换更高内存带宽的型号方案取决于成本和性能的权衡。并发抖动的问题也值得单独说。推理服务器上多个模型实例共用一张卡时如果驱动显存调度策略不给力会出现显存碎片化导致后续模型加载失败。这种问题一般可以通过预加载模型、显存池化、或者给关键模型固定显存配额来缓解。实测下来部分国产芯片驱动对显存碎片的主动管理不如老牌方案激进规划显存时要预留额外冗余不要精确打满。5.3 生态和工具链的隐性成本国产芯片工具链的问题是全方位的文档更新滞后、算子覆盖不全、版本兼容性差。在主流方案上可能一行代码都不用改就能跑的模型到了国产芯片上可能要替换算子甚至手写算子。这个工作量在选型阶段就要有预估一次算子覆盖审计能帮你把风险算明白把模型的所有算子列出来和目标芯片的算子支持表逐项比对如果缺口超过10%就要做好大量适配工作的准备了。还要特别注意驱动和框架版本的配套关系。国产芯片的框架适配对版本非常敏感一个Python小版本升级、一个依赖库的更新都可能导致整条推理链路二进制不兼容。比较好的做法是锁死一套经过验证的版本组合用Docker镜像把环境固化下来后续要升级就单独搭环境验证不要在生产环境里随意升级任何组件。5.4 一份可以直接保存的问题速查表这里整理一份部署时常见问题的速查表可以直接收藏问题可能的根因排查建议模型转换报错“算子不支持”算子缺失或框架版本过旧查询目标芯片算子支持表替换或手写算子量化后精度下降明显校准集分布与业务数据不匹配改用真实业务数据重新做量化校准推理延迟突然升高温度降频或显存碎片查看温度曲线和显存分配日志定位根因多实例并发失败显存规划不足增大显存冗余启用显存池化首token延迟偏高权重加载和静态图初始化开销启用常驻模型和上下文缓存机制服务启动报驱动版本错误驱动与框架不匹配锁死经测试的版本组合用Docker固化环境6. 写在最后我的选型建议与个人体会从品牌格局来看国产AI算力芯片已经明显过了“有没有”的阶段现在真正比拼的是“好不好用”和“能不能落地”。昇腾、寒武纪在云端推理和边缘市场已经有了不少规模化商用案例海光DCU在国产服务器整机市场占有一席之地端侧更是百花齐放。如果你现在有推理项目要落地我的建议是不要只盯一个品牌做好多平台适配的准备。这两年很多客户一开始只绑定一套生态后来因为成本、交付周期或新场景需求被迫做二次适配那才是真花冤枉钱。实操上有三个经验都是我吃过亏之后沉淀下来的。第一选型阶段先跑通一个最小Demo再谈采购工具链体验决定后续所有工程成本这是一票否决项。第二性能评估不能只看厂商公开数据自己用业务流量复测典型负载以延迟分布、吞吐和单位成本三个数据做最终决策依据。第三预算里一定要预留适配和优化的工程师成本。国产芯片的省钱逻辑是省在算力账单上不是省在人力投入上这两者要分开算账。推理与边端的窗口期还在持续打开模型会越来越小量化技术会越来越成熟边端算力需求只会往上走。已经入场的朋友建议多做深挖少做观望。真正把一个垂直场景吃透用国产芯片做出稳定、低成本、可量产的边缘推理产品这个价值并不比打磨一个云端大平台小。希望这篇内容能让你少踩几个坑有选型或部署的新问题欢迎在评论区分享你的案例和心得一起把这条路走踏实。