英伟达Kumo Tabular为表格预测树立精度效率新标杆
8 小时前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
英伟达正在把大语言模型的"上下文学习"思路搬到表格数据上。9月29日,英伟达在Hugging Face上开源了NVIDIA Kumo Tabular,这是一个专门处理表格数据的预训练基础模型,支持分类和回归任务。它的核心卖点是:给定一张带标签的表格,模型无需训练、无需调参、无需特征工程,一次前向传播就能预测新行的标签。模型提供2800万到2.15亿参数三个版本,采用OpenMDW-1.1许可证,允许商业使用。目前该模型在TabArena、BeyondArena、TALENT和ScoringBench四个基准测试中均排名第一。
这件事的背景值得展开。表格数据一直企业机器学习的支柱——客户记录、交易流水、传感器日志、理赔单、订单,全都躺在表格里,而流失预测、违约判断、需求预估、定价这些最常见的工业级机器学习任务,本质上都是在处理表格。过去二十年,这类工作基本由梯度提升树(如XGBoost、LightGBM)主导,效果确实不错,但整个流程极其笨重:每来一个新问题,就要重新收集标签、做特征工程、搜索超参数、验证、部署,模型对表格本身一无所知,每个任务都从零学起。Kumo Tabular想改变的就是这个生命周期。它的思路和大语言模型的上下文学习一致:一个在数百万张表格上预训练过的模型,可以把带标签的表格当作上下文直接读取,然后预测新行的结果,全程不更新任何权重。技术上,它基于Transformer架构,围绕表格结构设计了列注意力、行注意力和上下文注意力三种机制,能理解单个数值在所在列中的分布位置(比如42是正常还是极端)、一行内各列之间的交互关系,以及如何把有标签的上下文行与待预测行关联起来。数值和类别值通过傅里叶特征处理,缺失值无需填充、被特殊对待。
对跨境电商卖家和出海团队来说,这类工具的意义在于降低建模门槛。以往想做一个销量预测或用户流失预警,往往需要专门的数据科学团队;如果Kumo Tabular这类表格基础模型真能兑现"开箱即用"的承诺,中小团队用一张历史订单表就能跑出可用的预测结果,不必再走完整的训练调参流程。当然,实际落地效果还要看它在真实业务数据上的表现,以及英伟达开源库的易用程度,但方向已经明确:表格数据的建模方式,正在从"每个任务训一个模型"转向"一个模型读表就能干活"。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
