不存在的模型,自己动手造
8 小时前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
一位开发者想要一个轻量版的提示词改写模型,官方版本要9B参数、20GB显存,跑一次要思考几千个token才写出一段话。他在Hugging Face上只找到同一个9B模型的压缩版,于是干脆把自己想要的东西描述给一个叫ML Intern的AI代理,第二天就拿到了一个0.8B、能在CPU上跑的版本,输出有效率99.7%,token消耗只有原版的四分之一。整个项目的算力成本,包括让9B模型给8797条示例请求打标签,一共花了16美元。
这件事的背景是,大模型越做越大,但很多具体场景其实只需要一个小而专的模型。过去要自己训一个,得懂数据、懂训练脚本、懂评测,门槛不低。而现在像ML Intern这样的代理工具,把规划、预算申请、小规模测试、训练、评测、发布这一整套流程都包了下来,开发者只需要在第一条消息里把需求讲清楚。这位作者在接下来几天里用同样的方式又做了五个模型,每个都始于HuggingChat里一条开启ML-intern的消息,终于Hub上一个带评测结果的公开模型。
作者总结出一套写提示词的方法。第一条消息最关键,他第一个项目写了约450词,到第六个已经接近2000词,因为每个项目都教会他下一个项目该补什么。提示词开头用一句话说清想法和动机,然后点名具体部件:数据集、基础模型、训练脚本。凡是自己已经验证过的东西,单独放在一个标题下,字面意思就是"已验证事实,不要重新推导",这样代理就不会把预算浪费在重复发现已知信息上。比如做相机角度LoRA时,这一节列出了哪个训练器刚加了透明图像支持、哪些未解决的GitHub issue让备用训练器有风险。
提示词里有两行是必须的。第一行要求训练前先跑一个基线,比如柑橘那个项目里写着"训练前也报告基础模型在同一指标上的零样本得分,这样能看出提升幅度"。没有这一行,你只会得到一个训练完的模型,却不知道它比原来的强在哪。第二行是带检查的冒烟测试,做图像LoRA时他要求先跑50步训练,然后检查保存的权重是否真的变了,确认无误再付全款跑完整训练。提示词结尾要列出预期交付物并限制成本,比如"总花费上限12美元,超支前先问我"。因为ML-intern每个任务都从零预算开始,执行付费任务前必须获得许可,这个限额会被严格执行。如果不写预算,代理会根据项目规模给出几条路径让你选。
作者用这套方法在两天里做了六个东西。第一个是懂农业的垂直模型:通用视觉模型能描述发黄的柑橘叶子,但判断这是螨虫还是缺镁、给出生物和非生物防治方案就很难。他用Claude整合了Hub上Project-AgML组织的三个数据源,做出一个包含3017张标注图像、覆盖21种病虫害和营养缺乏及治疗方案的数据集,再让ML-intern基于Qwen3.5-2B做微调,并确保对基础模型做了基准测试。
对跨境电商卖家和AI工具用户来说,这件事的意义在于:定制小模型的门槛和成本正在快速下降。以前要花几万美元、几周时间才能训出的专用模型,现在可能只要十几美元算力和一条写清楚的提示词。商品图片分类、评论情感分析、多语言listing优化这类场景,都可能用这种方式做出比通用大模型更准、更便宜、更快的专用小模型。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
