资讯

小米发布并开源结构化数据大模型Xiaomi-TabLDM:一个模型、全任务通用

驱动之家·2026/9/5 02:10:00🔗 原文

📋总体概括

小米9月5日发布并开源表格结构化数据基础大模型Xiaomi-TabLDM,主打一次预训练后无需针对各数据集重新训练、调参或模型集成,即可直接完成分类与回归任务,挑战XGBoost、LightGBM长期主导的「一表一模型」传统范式。技术上采用全合成表格数据预训练,架构引入双流Feature Group、Attention Residual和稀疏MoE,并支持Test-Time Scaling提升精度,瞄准金融、医疗、制造、物流等表格数据密集行业,试图把大模型通用范式延伸到结构化数据领域。

关键信息

  • 小米发布并开源通用表格数据大模型Xiaomi-TabLDM,单模型可跨数据集直接用于分类与回归任务
  • 针对XGBoost、LightGBM时代每份新表格都需重新训练调参的「一表一模型」痛点,降低部署维护成本
  • 预训练完全依靠合成表格数据完成,覆盖多样数据规模、变量类型与函数关系
  • 架构采用双流Feature Group、轻量级Attention Residual与稀疏MoE,扩大容量同时控制计算量
  • 支持Test-Time Scaling,在不改动模型参数前提下通过增加推理算力提升预测准确度

🔥犀利点评

用大模型范式打表格数据,方向并不新鲜但确实卡在痛点上——企业里最值钱的恰恰是CSV和数据库表,而不是文本。小米敢全靠合成数据预训练算是聪明,绕开了客户数据隐私的死结。但真正的考验在效果:XGBoost这类传统工具调好参后的精度天花板极低却极难撼动,工业界对精度一个点的差距都斤斤计较。开源只是入场券,能不能在真实业务榜单上正面击败梯度提升树,才是这场豪赌的生死线。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文