小米发布并开源结构化数据大模型Xiaomi-TabLDM:一个模型、全任务通用
最新9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,该模型主打一次预训练之后,无需针对每一份数据集重新训练、调参或者模型集成,就可以直接完成分类、回归预测任务,把大模型范式延伸到金融、医疗、制造、物流广泛存在的表格结构化数据场景。
长期以来表格数据处理大多依靠XGBoost、LightGBM这类传统机器学习工具,每拿到一份新业务表格,就要重新完成训练调参,多套模型维护带来沉重部署成本,Xiaomi-TabLDM目标就是打破“一表一模型”的行业现状,实现单模型跨数据集直接使用。

模型技术路线围绕大规模合成数据预训练、高效模型Scaling、Test-Time Scaling三大方向展开,整套预训练全部依靠合成表格数据完成,覆盖多样的数据规模、变量类型与函数关系,扩大任务分布覆盖。
架构层面引入双流Feature Group、轻量级Attention Residual以及稀疏MoE专家混合机制,在扩大模型容量的同时,避免计算量同步暴涨,同时支持在不改动模型参数的前提下,依靠增加推理阶段计算资源,进一步拉高预测结果准确度。

在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准测试当中,Xiaomi-TabLDM整体进入第一梯队。
回归任务表现尤为亮眼,拿下TALENT二分类第一、OpenML-CTR23回归榜单第一,BCCO总体第二、TabArena回归任务第二,多项指标超过TabPFN-3、AutoGluon1.5 extreme等主流基线方案,同时兼顾预测性能与推理效率,在TabArena回归任务上取得1900 Elo得分,每1000样本验证耗时仅3.12秒。

工业真实场景测试进一步验证模型价值,材料性能预测场景无需微调,预测精度提升130%,减少九成无效试模测试;零件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测平均误差降低54%。
遇到工况发生变化,仅补充三十条左右新样本作为上下文,模型平均误差就可以下降62%,对比传统算法需要两百家样本才能接近同等效果,小样本快速适配优势突出。


《小米发布并开源结构化数据大模型Xiaomi-TabLDM:一个模型、全任务通用》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
中国版SpaceX!阿里入局千帆星座:正式登记为恒信卫星股东
快科技9月5日消息,近日,上海垣信卫星科技完成工商变更,杭州阿里创业投资成为新增股东,阿里巴巴正式入局低轨巨型星座“千帆星座”,上汽集团金控同步入股。垣信卫星是千帆星座的... -
OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题
快科技9月5日消息,近日,OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,官方将其定义为全球智能水平最高、对齐效果最优的生成式AI模型。其训练工作在美国德州Stargate超算基地完成,动用... -
日本电机巨头尼得科被认定大规模造假:社长鞠躬致歉 但没召回计划
快科技9月5日消息,据日本媒体报道,日本电机行业巨头尼得科Nidec近期正式对外公布了旗下产品质量问题专项调查委员会的最终报告。调查委员会在核查中最终认定,公司内部累计存在844起擅自变更... -
小米发布并开源结构化数据大模型Xiaomi-TabLDM:一个模型、全任务通用
快科技9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,该模型主打一次预训练之后,无需针对每一份数据集重新训练、调参或者模型集成,就可以直接完成分类、回归预测任务,把大模... -
岚图梦想家9开启预售 42.99万-52.99万
9月5日,岚图梦想家9正式开启预售,预售价42.99万至52.99万,推出Ultra、Ultra+和礼尊版三个版型,涵盖插混和纯电共五个配置,同步释放至高价值5万元购车权益。三电方面,全系配备800V高压平台,...








