英伟达表格模型登顶,但别急着换掉XGBoost

英伟达最近放出了 Kumo Tabular,在几个公开的表格数据基准上刷新了准确率纪录。团队阵容挺豪华,Jure Leskovec 和 Matthias Fey 这些图神经网络领域的老面孔都挂名了,看得出来不是玩票。但做数据科学的人都知道,表格数据这个赛道,XGBoost 和 LightGBM 已经统治了快十年,不是随便来个新模型就能掀桌子的。

Kumo Tabular 的核心思路是把表格数据转成图结构,再用图神经网络做表征学习,本质上是在走「表格基础模型」这条路。这和之前谷歌的 TabNet、以及一些基于 Transformer 的表格模型方向一致,但英伟达把工程实现和 GPU 加速绑得很紧。从公开的评测看,它在分类和回归任务上确实有优势,尤其当数据里有大量类别特征和复杂交互时,传统树模型容易欠拟合,而图结构能捕捉到更高阶的关系。不过有几个现实问题值得冷静看待。第一,推理成本。树模型在 CPU 上就能跑得飞快,Kumo Tabular 要发挥实力基本离不开 GPU,对中小团队来说,部署门槛和账单都是实打实的。第二,可解释性。树模型的特征重要性、SHAP 值已经是很成熟的工具链,图神经网络的解释性至今没有让业务方普遍接受的方案。第三,调参复杂度。XGBoost 的默认参数往往就能打,新模型要调出好结果,对工程师的经验要求更高。我的判断是,短期内 Kumo Tabular 更适合两类场景:一是数据量大、特征交互复杂、且已经有 GPU 基础设施的团队,比如推荐和风控;二是作为集成模型里的一个强学习器,和树模型做 stacking,而不是完全替代。对于大多数日常的表格任务,XGBoost 依然是性价比最高的起点。英伟达这步棋的意图也很清楚,它不只想卖卡,还想在数据科学工具链里占住位置。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼