ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

0.69B参数、4GB显存:拼接微调给Qwen3-0.6B装上SigLip视觉模块

0.69B参数、4GB显存:拼接微调给Qwen3-0.6B装上SigLip视觉模块 0.69B参数、4GB显存拼接微调给Qwen3-0.6B装上SigLip视觉模块【免费下载链接】happy-llm 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm融合模型 Qwen3-SmVL 共 0.69B 参数推理占用 4GB 显存同时保留 Qwen3-0.6B 的中文对话、思考过程与函数调用能力并获得图像理解能力。整条路线只需替换语言模块、改造对话模板、重建一层特征映射全文带你按代码顺序完整复现这套拼接微调流程。效果对比0.6B 中文小模型获得视觉问答能力模型参数量显存占用中文支持视觉能力Qwen3-0.6B0.6B3GB✅❌SmolVLM20.256B1GB❌✅Qwen3-SmVL0.69B4GB✅✅改造前后的直观差异可以看推理结果同一张三只狗的配图同一句中文提问200 步的小批量训练会答错成兔子1000 步训练后回答图中有三只狗。训练侧的关键数字可训练参数 12.00M总参数 662.87M占比 1.81%8 卡沐曦 C50064G 显存跑满 1000 步约 1.5 小时验证损失稳定在 0.58。原理拆解视觉编码器、连接器、语言模型三段式SmolVLM2 的推理链路是标准的三段式视觉编码器SigLip-93M提取图像特征特征映射层做维度对齐再与文本特征直接拼接后送入语言模型SmolLM-135M。整个架构没有交叉注意力视觉 token 就是普通 token这正是语言模块可即插即拔的前提。本次改造只做两件事模块替换语言模型 SmolLM-135M → Qwen3-0.6Btokenizer、词嵌入、LM Head 一并换掉。视觉编码器和图像前后处理流程原样保留额外引入的参数只有 0.09B。维度适配SigLip 输出 768 维Qwen3 隐藏层 1024 维原连接器无法复用需要按 768→1024 重建。对话模板兼容模板里用 Qwen3 预留的vision令牌替换 SmolVLM2 的image占位符并保留think/【免费下载链接】happy-llm 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表