上海 AI Lab & 上交大提出全新预训练任务,开源首个 8.9B 隐空间大模型 NCP-ArchPreview
2 小时前

上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队,提出了全新的预训练任务——下一个概念预测(NCP),并推出了全球首个规模达8.9B的离散隐空间基座模型NCP-ArchPreview。该模型基于5.73T的Dolma-3语料库进行预训练,仅使用了51.3%的Token预算,就达到了与OLMo-3-7B相同的最终预训练Loss水平,等效收敛速度提升了1.95倍,计算帕累托效率系统性提升了1.74倍。在下游任务的综合表现上,NCP-ArchPreview领先2.45分,其中GSM8K数学推理任务提升了近6分。NCP-ArchPreview采用三段式隐空间概念处理流水线,通过乘积量化构建了超大离散概念表征空间,并利用可微下一个概念预测、因果防泄漏反馈机制和分层残差路由,实现了显式未来概念建模。此外,该模型还具有额外优势:仅需微调17M隐空间参数,即可超越LoRA且无遗忘现象,同时训练吞吐量提升、显存占用降低。将NCP-ArchPreview的概念表征注入草稿模型,可使推测解码的平均接受长度提升4.17%,在代码任务上提升7.59%。团队还在技术报告中分享了踩坑经验与解决方案,构建了千亿级代理指标筛选机制,并开源了包括全程阶段性Checkpoint、评测框架等在内的全部资产。该模型打破了逐词预测的范式,转向隐空间概念预测,显著提升了训练效率,为模型微调、推理加速等开辟了新方向。