2026年6月18日,阿里ATH-Token Foundry联合中国人民大学高瓴人工智能学院宣布开源LOGOS(Language Of Generative Objects in Science),这是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS通过共享词表将蛋白质、小分子、材料等异构对象编码为统一离散Token序列,构建了涵盖7类模态、总计44.87B tokens的预训练语料库。该模型在六大科学任务中,以纯序列建模范式一致性地匹配或超越了领域专用方法,展现了极高的参数效率,如LOGOS-1B仅用1/56参数量便超越了微软NatureLM。LOGOS还解决了预训练与下游任务间的目标偏差问题,无需复杂微调即可激活生成能力。目前,LOGOS的模型权重、推理代码及技术报告已全面开源。
