创业团队拥有的通常不是海量算力,而是一个具体问题、少量领域数据和快速试错的需求。迁移学习的价值,就是把已经训练好的通用模型当作起点,不必为每个新任务重新学习语言、视觉或声音的基础结构。
但“复用大模型”有很多层次。直接写提示、接入检索、冻结模型提取特征,以及更新少量参数,都属于利用已有能力,却有不同成本和适用边界。
## 先从最轻的方法开始
如果任务能用清晰指令和少量示例稳定完成,提示词就是最便宜的适配。它不改变权重,迭代快,也容易回退。
模型缺少最新产品资料或内部事实时,优先使用检索。资料保留在外部知识库,更新后立即生效,并能附上来源。
只有当模型知道任务,却长期输出错格式、术语或决策模式,参数适配才更合理。把本可由检索解决的事实写进权重,会增加训练和更新成本。
## 特征迁移适合边界清楚的小模型任务
图像、音频和文本基础模型可以输出向量表示。团队冻结主模型,只训练一个轻量分类器,就能完成质量检测、相似搜索、意图识别等任务。
这种方法训练快、数据需求相对低,也容易在普通硬件上迭代。风险是基础表示与目标场景差异过大,例如网络图片训练出的视觉特征未必适合特殊工业传感器。
评测要包含真实设备、光线、噪声和长尾情况,而不只是随机切分的干净样本。

## LoRA只训练低秩更新
完整微调会更新大量模型参数,需要较多显存并产生独立权重副本。LoRA 假设任务适配的权重变化可以用两个低秩矩阵近似,只训练这些新增参数。
训练参数和存储明显减少,不同客户或任务可以保存不同适配器,共享同一基础模型。Hugging Face PEFT 等工具把 LoRA 集成进常见训练流程。
低成本不等于不需要数据质量。几十条重复或矛盾样本仍会让模型学到坏习惯。先准备小而经过审校的样本,再观察学习曲线,通常比一次生成几万条合成数据更可靠。
## QLoRA进一步降低显存门槛
QLoRA 将冻结的基础模型量化到较低精度,再在其上训练 LoRA 适配器。论文展示了在显著减少内存的同时进行大型模型微调的路径。
它适合资源有限的实验,但训练速度、硬件支持和最终任务质量仍需实测。量化误差可能对数学、代码、低资源语言或精细格式更敏感。
团队应把“能在一张卡上训练”与“上线后表现足够好”分开验证。
## 数据应围绕真实失败构建
早期训练集不必大,但要覆盖最有价值的分布:常见请求、模糊请求、边界条件、合理拒绝和工具失败。
理想输出由真正理解任务的人审校。若直接用同一个基础模型批量生成答案,适配器可能只是放大原模型习惯,并把未发现的错误固化。
将线上失败按类别回流,比无目的增加数据更有效。每个新样本都应对应一个明确问题和评测项。

## 评测先于训练
没有训练前基线,就无法知道微调是否真正改善。先建立独立评测集,记录原模型在任务成功、格式、延迟、成本和人工修改时间上的表现。
训练后使用同一评测,再增加未见过的边界样本。还要检查通用能力是否退化:一个更会说行业术语的模型,可能在普通问答中变得僵化或过度套模板。
线上可以让少量流量进入新版本,观察真实完成率和转人工比例。满意度不能代替正确性,特别是答案流畅但可验证的任务。
## 适配器也有版本依赖
LoRA 通常与特定基础模型及其层结构绑定。基础模型升级后,旧适配器未必能直接使用。Trans-LoRA 等研究探索跨模型迁移适配器,也说明这种依赖是现实问题。
生产系统要记录基础模型、tokenizer、量化配置、训练数据、适配器和提示版本。升级时重新运行评测,必要时重训,而不是默认“新底座一定更好”。
## 用成本表比较完整方案
API调用看似按次付费,却省去部署和运维;自托管单次成本可能低,但需要 GPU、监控和容量规划;微调还增加数据审校和版本管理。
比较时应计算每个成功任务的总成本,包括生成、检索、重试、人工修改和失败。一个便宜模型若需要频繁返工,整体未必更省。
AI创业中的迁移学习,不是为了显得技术更深,而是用最少改造获得足够可靠的任务能力。先提示与检索,再轻量分类或参数适配;让每一步复杂度都由真实失败和独立评测证明。
## 参考资料