返回博客
·算法与原理

不用训练就能预测表格:NVIDIA 开源 Kumo Tabular,顺手刷了四个榜

NVIDIA 开源 Kumo Tabular,无需训练、无需特征工程即可预测表格数据;同日 Cohere Embed 5、Gemini 4 Argon 也上线——「专用模型」正在填满通用模型够不到的角落。

#表格数据#NVIDIA#开源模型#机器学习

# 不用训练就能预测表格:NVIDIA 开源 Kumo Tabular,顺手刷了四个榜

9 月 29 日,NVIDIA 在 Hugging Face 上发布了 **Kumo Tabular**。它可能是这轮模型发布潮里最「不性感」、但最实用的一款:**不用训练、不用调参、不用做特征工程**,把一张带标签的表格喂进去,它一次性输出新行的预测结果。

一、它解决了什么「老大难」

在真实业务里,**表格数据(tabular)才是绝大多数**:风控、销量预测、用户分层、设备故障预警……但传统机器学习在这块有个尴尬——**每个新任务都要重新训练模型、清洗特征**,门槛高、周期长。

Kumo Tabular 的思路是把这件事**「基础模型化」**:

  • 读入一张带标签的表格;
  • 一次前向传播就给出新行的预测;
  • 无需训练、无需调参、无需特征工程。
  • NVIDIA 一次性放出**三种规格(2800 万到 2.15 亿参数)**,采用 **OpenMDW-1.1** 许可,允许商用。按官方测量,它在 **TabArena、BeyondArena、TALENT、ScoringBench** 四个基准上都排名第一。

    二、边界也很清楚

    NVIDIA 没有回避局限,明说了两点:

  • 只处理数值型和类别型列(不处理文本);
  • 需要 CUDA GPU。
  • 也就是说,它是**「表格领域的基础模型」**,不是又一个聊天大模型。这个诚实的定位,反而让它更容易被真正用起来。

    三、同一天的其他两条

  • Cohere Embed 5 转为正式可用(GA),接入 Cohere API、Model Vault、Microsoft Foundry 和 SageMaker;
  • Gemini 4 Argon 面向选定用户开放,并给出了 API 定价。
  • 把它们和 Kumo Tabular 放在一起,能看出一个共同点:**2026 年的模型市场,正在被「专用模型」填满**——嵌入、表格、决策、语音、视频,每一类都有专门的开源或商用模型,而不是全部塞给一个通用模型。

    四、为什么「专用」会赢

    原因很朴素:

  • 成本:专用模型参数小、推理便宜;
  • 效果:在一个窄领域里做到极致,比通用模型「样样通、样样松」更靠谱;
  • 可部署:小到能本地跑,数据不出门。
  • 通用大模型负责「理解世界」,专用模型负责「**把某件事做到 95 分**」。这两者不是竞争,而是分工。

    小结

    Kumo Tabular 提醒我们:**AI 的进步不只有「参数更大」这一种**。把一类长期依赖人工特征工程的脏活累活,变成一个开箱即用的模型,本身就是巨大的价值。对做数据的人来说,这可能是 9 月最值得试的一款。