花16美元训练出0.8B小模型

最近看到一个挺有意思的实践:有人想复刻 Qwen-Image 2.1 里那个提示词改写模型,但官方版本是 9B 参数、要 20GB 显存,写一段话前还要思考几千个 token,普通设备根本跑不动。他在 Hub 上翻了一圈,能找到的只有同一个 9B 模型的压缩版,没有真正轻量的替代品。

于是他干脆自己描述需求,让 ML Intern 帮忙干活。第二天就拿到了一个 0.8B 的版本,能在 CPU 上跑,有效输出率 99.7%,token 消耗大约只有教师模型的四分之一。更夸张的是成本:包括让 9B 模型给 8797 条示例请求打标签在内,整个项目算下来只花了 16 美元。接下来几天他用同样的方式又做了五个模型,每个都从 HuggingChat 里一条消息开始,最后变成 Hub 上的公开模型,连评估结果都写进了模型卡。ML Intern 会先规划任务、在动手前问预算,整个流程更像是在带一个实习生,而不是在调参。我觉得这件事真正的信号不是「16 美元能训模型」,而是小模型定制的门槛正在肉眼可见地塌下来。以前想做一个垂直场景的轻量模型,得先有数据、有卡、有工程团队;现在只要能清楚描述需求、愿意花点小钱买标注算力,个人开发者也能把想法变成能跑的东西。当然也别过度乐观,0.8B 能替代 9B 的前提是任务足够窄、评估标准足够清晰。如果场景本身模糊,蒸馏出来的小模型大概率也只是「看起来能用」。但对做跨境工具、边缘部署或者成本敏感型产品的团队来说,这条路值得认真试一试。
2

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼