ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

直播间里的AI,怎么才能听懂“这个颜色好显白“这句话

直播间里的AI,怎么才能听懂“这个颜色好显白“这句话 你有没有想过一场淘宝直播里主播说的每一句话其实藏着好几层信息她嘴上说着这款连衣裙显瘦手里同时把裙子转了个圈屏幕角落还弹出一行限时五折的字幕货架上摆着的商品图片又标注了详细的材质参数。这些信息分散在声音、画面、文字、图片里人类观众可以毫不费力地把它们拼在一起理解但对一个AI模型来说这几乎是噩梦级别的任务。更麻烦的是直播是连续几个小时的主播说的一句关键卖点可能对应着十分钟前展示的某个画面。你要让AI记住这种跨越时间的关联还要让它在实时对话场景里快速给出准确回答这个要求听起来就不轻松。阿里巴巴淘宝天猫集团的团队做了一件事他们造了一个专门为电商直播场景打磨的全模态理解模型叫TLive-Omni。这篇论文详细讲了他们怎么让AI真正看懂、听懂一场直播。直播理解到底难在哪里先说清楚一件事市面上已经有不少全模态大模型了比如MiniCPM-o 4.5、Qwen3-Omni、OmniVinci这些开源模型它们都能同时处理图像、视频、音频和文本。**全模态模型**能够同时理解并处理图像、视频、音频、文本等多种类型输入的AI模型不像早期模型只能处理单一模态的数据。但这些模型有个共同的问题它们的训练数据和评测体系都是为通用场景设计的不是专门针对电商直播的。你拿它们去问主播刚才展示的那款白色帆布鞋鞋底是什么材质效果就会打折扣。原因也不难理解。电商直播有自己的特殊性主播语速快经常蹦出一堆专业术语材质、色号、型号背景嘈杂还经常好几个人同时说话画面里的商品分类五花八门直播间背景又乱人工标注根本标不过来一段视频里产品出现的时间点和主播说到这个产品的时间点未必对得上你得让AI学会跨模态、跨时间地把这些线索串起来。论文里提到一个对比数据挺说明问题的在视频理解的时序定位任务上通用模型OmniVinci的mIoU衡量预测时间段和真实时间段重合程度的指标只有13.1而TLive-Omni-9B做到了81.49差了将近70个百分点。这不是同一个数量级的表现说明专门为场景定制的模型和通用模型之间的差距可以有多大。音频不是配角是第一公民TLive-Omni的架构设计里有个细节值得说一说它没有把语音先转成文字再喂给模型而是直接把原始音频当作和图像、视频同等重要的输入。这个选择背后有个很实际的考量。如果先用外部语音识别系统把主播的话转成文字再把文字喂给大模型你确实能省事但会丢掉两样东西一是语音和画面之间的时间对应关系二是说话人的语气、身份这些弦外之音。比如主播说这个颜色真的很好看时的兴奋语调或者两个主播抢着说话时谁先谁后这些信息一旦转成纯文字就没了。**AuT音频编码器**TLive-Omni使用的音频处理模块来自Qwen3-Omni项目用2000万小时的音频数据从零训练而成能把语音压缩成大约每秒13个token方便长时间录音也能塞进模型的处理窗口里。这里有个生活化的比方。你想象一下开会记录如果只留下会议纪要的文字稿你会丢掉谁在什么时候打断了谁、谁的语气带着犹豫、谁说话时背景音里传来了敲门声。这些信息乍看无关紧要但如果你要复原这场会议到底发生了什么它们其实很关键。TLive-Omni保留音频这个原始档案就是不想在转文字这一步就把信息损耗掉。Per-vGrid给每一帧画面配一个同声传译视频理解最核心的难题是时间对齐。一部一分钟的视频你怎么知道第30秒说的话对应的是哪一帧画面TLive-Omni给出的方案叫Per-vGrid。**Per-vGrid**一种把视频画面和对应时间段的音频打包成时间网格的组织方式每个网格前面会加上明确的时间戳网格边界也用专门的标记token隔开让模型能清楚知道哪段声音对应哪几帧画面。具体怎么做的呢论文里举了个很细节的例子。假设一个视频原本有119帧帧率30FPS时长大约3.97秒。你想按2FPS的速率采样理论上应该正好每0.5秒取一帧但因为帧数是整数实际采样出来的帧索引可能是[0, 20, 39, 59, 79, 98, 118]这种不规则的序列实际采样率变成了大约1.76FPS而不是预设的2FPS。这时候问题来了如果你还是按照预设的2FPS去计算每个视频网格对应的音频时长那这个时间戳就是错的。TLive-Omni的做法是老老实实按照实际采样到的帧去反推时间戳和音频片段长度哪怕这意味着每个网格对应的音频token数从13个变成14到15个。这个细节听起来很琐碎但它体现了一种态度宁可多算一步也不让时间对齐出现哪怕零点几秒的偏差。想象你在看一部字幕组翻译的电影如果字幕比画面慢了半秒你会觉得别扭如果这半秒的误差叠加在一段十分钟的直播讲解里模型对这句话对应哪个画面的判断就可能整体跑偏。Per-vGrid做的事情就是把这个误差从一开始就摁死。三阶段训练先学听再学懂最后学会答TLive-Omni的训练不是一步到位的而是分成三个阶段一步步把能力叠加上去。第一阶段只训练音频对齐模块让语言模型和音频编码器都保持冻结用500万条语音识别数据先建立起声音特征和语言模型能理解的表示之间的初步映射关系。这一步的目标很朴素先让AI的耳朵和嘴巴对上频道。第二阶段扩大到2600万条音频样本涵盖语音识别、音频描述、音频问答这次连音频编码器本身也一起训练语言模型仍然冻结。这一步是让AI不光能听清楚说了什么还能听出背景音乐是什么风格、这是谁在说话这类更细粒度的信息。第三阶段才是真正的全面开花1400万条多模态样本一起上阵涵盖语音识别、说话人分析、产品视觉定位、文字识别、时序定位、视频密集描述、全模态问答等等这次连语言模型本身也参与训练。**SFT有监督微调**用标注好的数据让预训练模型学会针对具体任务给出正确答案的过程。这种循序渐进的设计其实很像学一门乐器。你不会让一个刚摸钢琴的人直接弹协奏曲而是先练音阶再练简单曲子最后才是完整的曲目演奏。如果反过来一上来就上难度学习效率反而会更低甚至可能把基础没打牢的问题带到后面所有阶段里去。数据从哪来一整套净化流水线这套模型能训练出来光有架构还不够得有干净的数据喂进去。而直播场景的数据天生就是脏的噪声大、标注难。团队为此专门设计了一整套数据生产引擎音频、图像、视频各有各的处理办法。音频这边主播语速快、术语多普通语音识别模型经常认不出品牌名、材质名、型号这类低频词。团队的解法是先用多个ASR模型投票取一致结果**ASR**自动语音识别技术把语音转成文字再用大语言模型从转写文本里挖掘出这些专业术语建立一个直播关键词词典反过来帮助语音识别提高准确率。说话人识别也是个难题直播间经常有多人同时说话或者突然插话。团队用了个交叉验证的思路一边用纯音频的声纹分析模型判断是谁在说话一边用能看画面的多模态模型结合唇动信息来判断两边结果重合度高的直接采纳不一致的地方再靠视频画面和唇形细节做二次核实。这有点像刑侦里的双重证据链你不会只靠一个证人的证词定案而是要看指纹、监控录像、证人口供能不能互相印证。任何一环单独拿出来都可能出错但交叉验证能把误判率压下去。图像这边的核心难题是产品视觉定位也就是让AI在画面里框出商品的具体位置。人工标注框太贵了团队用了检测器加裁判的循环一个模型先提议候选框另一个模型当裁判把不准的框剔除掉。**产品视觉定位Visual Grounding**在图片或视频画面中用边界框精确标出某个特定商品所在位置的任务。视频这边最麻烦的是物理镜头切换和语义事件边界经常对不上。一个物理镜头比如摄像机没有切换角度里可能包含好几个不同的语义事件比如先展示裙子的正面又展示了裙子的背面。团队先用TransNet V2做物理镜头切分得到画面连贯的片段再让专门的模型给每个片段配上语音转写和视觉描述最后交给大语言模型融合成一段完整的密集描述。Faithful-RFT不鼓励长篇大论只奖励说真话前面的三阶段训练解决的是能不能看懂、听懂的问题但还有一个问题没解决模型给出的回答是不是真的忠于它看到、听到的证据会不会为了显得聪明而编造一些没有依据的细节这就是团队引入Faithful-RFT的原因。**Faithful-RFT**论文提出的一种强化微调方法全称是忠实性强化微调核心思路是直接给最终答案打分而不是奖励模型生成很长的思考过程。**GRPO组相对策略优化**一种强化学习算法让模型针对同一个问题生成一组候选答案再根据这组答案之间的相对好坏来调整模型参数。这里有个很关键的设计取舍。现在很多强化学习方法喜欢奖励模型多想一步让它生成很长的思维链认为这样能提高准确率。但直播场景是实时的用户问一句这个多少钱能优惠到多少你不能让AI思考半分钟才回答。所以Faithful-RFT反其道而行明确压制模型生成不必要的思考痕迹只对最终答案本身按照任务是否可验证来打分。这就好比考试有的老师看重你的解题步骤写得多详细而这套系统更像是一个只看最终答案对不对的严格阅卷人你写多少草稿纸它不管但答案错了就是错了。如果不这样设计会怎样答案可能是模型学会了用更长的解释来掩盖答案的不准确这在客服场景里是致命的用户等不及看你长篇大论。奖励函数的设计也很讲究。论文里把奖励拆成了不同的类型针对选择题、视觉定位、文字识别这种有明确答案的任务用规则判断对错针对开放式问答这种没有唯一标准答案的任务用大语言模型当裁判打分每个候选答案只会被适用于它所属任务类型的奖励函数打分不适用的奖励会被自动剔除、权重重新分配。还有一个很实用的细节动态重采样。强化学习训练时如果一组候选答案的得分完全一样那这组样本对模型更新其实没有信息量因为模型学不到哪个更好。团队的解法是检测这种零方差的情况一旦发现就重新生成这组答案直到组内出现有意义的分数差异为止。这个思路很朴素与其浪费算力在没有信号的样本上不如把资源用在能真正教会模型东西的地方。训练效率也不能忽视怎么让GPU不空转模型训练是个体力活尤其是这种要同时处理音频、图片、短视频、长视频的多模态训练样本长度差异极大一段几秒的音频和一段几分钟的视频塞进同一个批次很容易造成负载不均衡有的GPU很快跑完了在等有的还在死磕长样本。**同步分组采样Synchronized Length-Grouped Sampling**论文提出的一种数据采样策略按照样本长度分组让同一批次里的样本长度尽量接近同时保证每个训练步骤里所有工作节点worker处理的样本数量固定。这个设计的取舍很实际。业内常用的序列打包方法会把几个短样本拼接成一个长序列来减少填充浪费但这样做会让每一步实际处理的样本数量变得不固定也让位置编码、注意力掩码这些细节变得复杂。TLive-Omni选择了另一条路不拼接样本而是提前把同长度的样本分到同一批次里用固定的批次大小换取更简单的实现和更均匀的负载。这就像工厂流水线排班与其把长短工序混在一起分给每个工位让有的工位干得快有的干得慢不如提前把相似耗时的工序分到同一批次大家几乎同时完工谁也不用等谁。成绩单直播场景里到底表现如何说了这么多设计思路最终还是要看数据说话。在语音识别相关任务上TLive-Omni-9B拿到了最低的字符错误率CER6.464B版本也做到了6.66比参数量大得多的Qwen3-Omni30B-A3B6.75还要低。在说话人区分准确率cpWER上TLive-Omni同样处于开源模型里的领先位置。图像理解方面的数据更亮眼。产品视觉定位的准确率AP上TLive-Omni-4B做到了91.45远超所有对比的开源模型甚至比谷歌的Gemini 3.5 Flash74.89还高出十几个百分点。文字识别的编辑距离指标越低越好也是TLive-Omni系列表现最好只有4.24到4.72而不少开源模型的这个数字在30到70之间差距不是一星半点。视频理解上TLive-Omni-9B在时序定位mIoU 81.49、视频问答准确率93.23、密集描述准确率74.63上都是开源模型里最好的而且密集描述的幻觉率Hal.指生成内容里没有依据的部分占比只有8.76是所有开源模型里最低的。| 任务维度 | TLive-Omni-9B | 最强开源对比模型 ||---|---|---|| 语音识别CER | **6.46** | Qwen3-Omni 6.75 || 产品视觉定位AP | **89.96** | Nemotron 3 Nano Omni 48.62 || 时序定位mIoU | **81.49** | MiniCPM-o 4.5 43.20 || 视频问答准确率 | **93.23** | Gemini 2.5 Pro 92.62闭源 |更值得说的是这个模型没有为了在直播这个细分领域做到极致而丢掉通用能力。在MMMU、MathVista这些通用多模态推理基准上TLive-Omni相比它的底座模型Qwen3.5还有提升说明专精一个场景并没有让它变笨反而是在原有基础上又长了一门手艺。这一点其实反直觉很多人以为垂直领域优化必然意味着牺牲泛化能力就像你以为一个专精法语的翻译英语水平多半会退步但TLive-Omni打破了这个假设。定性案例AI到底怎么看懂一场直播论文里给了一些具体案例挺能说明问题。比如有个例子主播说这双白色帆布鞋有隐形增高4公分的效果问题是主播是怎么展示鞋底的。模型给出的回答是主播把鞋子翻转过来展示了厚实的黑色橡胶鞋底用这种视觉呈现配合讲解说明增高效果来自加厚的鞋底设计。这个回答同时用到了画面信息翻转鞋子的动作和音频信息主播提到这个鞋垫有隐藏的4厘米增高效果是典型的跨模态融合理解。还有个OCR文字识别的例子模型被要求识别图片里所有的文本块提取文字内容、边界框坐标并且分类成产品信息价格信息促销活动品牌标识等九个类别输出成结构化的JSON格式。这种结构化输出对电商场景特别实用因为后续的业务系统可以直接读取这些字段不需要人工二次整理。写在后面读完这篇论文最触动我的其实不是那些漂亮的分数而是Per-vGrid那个关于119帧视频的计算细节。这种为了0.几秒的时间对齐误差较真的态度说明团队真的在直播这个场景里摸爬滚打过知道时间戳一旦错位会带来多大的连锁问题。另一个让我意外的地方是Faithful-RFT对抑制思考痕迹的坚持。现在大部分强化学习论文都在鼓励模型多想、想得越长越好觉得这是提升推理能力的关键。但这篇论文提醒我们在真实的商业场景里速度本身就是一种正确性一个想了半天才给出的完美答案可能还不如一个立刻给出的够用答案有价值。还有个没被充分讨论的问题这套系统在处理多人同时说话、背景噪音很大的极端场景时到底能撑到什么程度论文里的说话人识别交叉验证方案听起来靠谱但直播间的真实噪声往往比论文测试集复杂得多这个鲁棒性边界在哪里值得后续继续追问。QAQ1TLive-Omni是什么ATLive-Omni是阿里巴巴淘宝天猫团队开发的一款专门针对电商直播场景的全模态理解模型能同时处理图像、视频、音频、文本四种输入用于自动识别直播中的产品信息、语音内容、时序事件等。Q2TLive-Omni和Qwen3-Omni这类通用全模态模型有什么区别ATLive-Omni基于Qwen3.5架构打造专门针对直播场景做了数据构建和训练优化比如Per-vGrid时间对齐技术、Faithful-RFT强化微调在产品视觉定位、时序定位等直播相关任务上明显超过通用模型同时还保留了不错的通用能力。Q3Faithful-RFT解决了什么问题AFaithful-RFT是一种强化微调方法专门解决模型回答不忠实于证据、或者为了追求推理深度而生成冗长思考过程的问题它直接对最终答案打分抑制不必要的思考痕迹兼顾回答的准确性和实时响应速度。
返回列表