菲尔兹奖得主陶哲轩代表非营利组织SAIR Foundation发布开放数学AI计划,把训练数据、评测方法、许可三件套的决定权交给科学社区,而非任何一家大型AI公司。
菲尔兹奖得主、加州大学洛杉矶分校教授陶哲轩,9月18日代表2025年与多位科学家和投资人共同创立的非营利组织SAIR Foundation,正式启动“开放数学模型计划”,并向公众开放合作意向征集。
SAIR Foundation的定位是支持AI在数学与科学中的负责任使用,独立于任何大型AI公司。此次发布可以理解为一份“科学社区如何拥有自己AI工具”的草案,数学是被选中的第一个试点学科。
数学的运行方式天然适合“社区拥有”这套逻辑。数学进步依赖可被他人审视与延续的发现,一条证明要能被独立检查,一个结论要能被独立复现。AI进入数学研究之后,数学界希望继续握住的,正是这种“可检视、可复现”的话语权。
把这套话语权落到AI工具上,需要四样东西同时被社区掌握:训练数据来源、评测方法、模型许可、训练方法公开。SAIR Foundation在9月18日的公告中,把承诺拆成了四件套:开放许可的权重与代码、公开训练方法、可复现评测、可追溯的训练数据来源。许可方面,计划采用Apache 2.0、MIT、CC BY 4.0等开放许可证,贡献者的权属与署名从项目伊始就被约定。
首阶段的目标被刻意收得很窄:陶哲轩在公告中把模型用途限定在数学家的日常研究工作:理解论证、核对文献、探索示例、编写代码,以及形式化证明。这些是研究流程里最具体、最容易被评估、也最不会“替数学家做主”的环节。SAIR先要把工具铺在研究者手边,再谈更大胆的能力。
资金与算力是“社区拥有”逻辑最脆弱的一环。SAIR Foundation近期获得了XTX Markets对下一轮SAIR竞赛的资助,具体金额与算力伙伴名单尚未披露。量子位对公告的译介提到,基金会将“算力由战略产业伙伴提供,但研究独立性由基金会保留”作为基本边界。这条边界能否在持续高算力成本下保持,目前还没有公开答案。
基础学科的运行逻辑各不相同,但“训练数据由谁提供、评测由谁设计、成果以何种许可发布”这三件套,对物理学、生物学、考古学都同样适用。SAIR Foundation此次在数学上做的尝试,如果跑通,会成为其他学科社区可以照搬或反向借鉴的模板;如果跑不通,也会留下一份写明边界与教训的记录。
陶哲轩与SAIR Foundation在公告结尾承诺,短期内会公布合作伙伴名单,并说明该计划如何融入SAIR现有的播客、活动与竞赛体系。合作意向征集分四类开放:资金、算力、专业经验、社区建设。读者接下来可以盯住的第一项硬指标,是那份合作伙伴名单何时落地,以及名单里出现的是算力供应商、独立实验室,还是再次回到某家大型AI公司。