
0.69B 多模态小模型拼接微调如何给中文模型装上眼睛【免费下载链接】happy-llm 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm把 SmolVLM2 的视觉模块嫁接到 Qwen3-0.6B 上用 0.69B 参数、约 4GB 显存跑通中文看图问答。这套小模型多模态的拼接微调方案改动点只有三处一篇讲完。模型内部长什么样 ✅SmolVLM2 就三块视觉塔SigLip-93M把图像编码成 768 维特征序列特征映射层一个带 Pixel Shuffle 降采样的 MLP把视觉特征从 768 维拉到语言模型需要的维度语言模型SmolLM2-135M把图像特征和文本嵌入拼在一起做序列预测。没有交叉注意力视觉和文本就是直接 concat——这正是它适合当供体的原因语言部分拆下来换掉就行类似换发动机但不动底盘。要动的只有两处SmolLM2 整个换成 Qwen3-0.6B映射层重建。视觉塔 93M 参数原封不动。跑通它需要做的几个动作改上下文模板Qwen3 的 chat template 里有 【免费下载链接】happy-llm 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考