用聊天造出六个小模型

上周我想给 Qwen-Image 2.1 配一个轻量版的提示词改写器,官方那个 9B 模型要 20GB 显存,写一段话前还要思考几千个 token,实在不适合本地跑。在模型社区翻了一圈,能找到的只有同一个 9B 的压缩版本,没人做过真正的小模型。于是我把需求描述给了 ML Intern,第二天就拿到了一个 0.8B 的版本,能直接在 CPU 上跑。

这个 0.8B 小模型的有效输出率是 99.7%,消耗的 token 大约只有教师模型的四分之一。整个项目算下来,包括让 9B 模型给 8797 条示例请求打标签,总共只花了 16 美元。这个成本放在两年前几乎不可想象,那时候光是标注数据的人工费用就远不止这个数。接下来几天我用同样的方式又做了五个模型。每一个都始于 HuggingChat 里一条开启 ML-intern 的消息,最后都变成了 Hub 上的公开模型,评估结果直接写在模型卡里。ML-intern 会自己规划任务,动手前先问我预算,整个流程比我预想的要省心。我总结了一下这类需求大致分四种:懂你所在领域的模型、能画你角色的模型、会某个新花招的模型、能塞进你设备的模型。以前这四类需求都得找团队从头训练,现在一句话描述清楚,第二天就能拿到可用的权重。我的判断是,小模型定制的门槛正在被彻底拉平。真正稀缺的不再是算力或标注预算,而是你能不能把需求描述得足够具体。对做跨境工具和本地化产品的团队来说,这意味着可以针对每个语种、每个终端单独养一个小模型,而不必再迁就通用大模型。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼