介绍/公告
陶哲轩宣布 SAIR 首届竞赛——数学蒸馏挑战赛 (Mathematics Distillation Challenge)
Terence Tao Announces the 1st SAIR competition - Mathematics Distillation Challenge
介绍/公告🎤 陶哲轩 (Terence Tao)⏱ 2:13👁 NA
▶ 在 YouTube 观看
陶哲轩代表 SAIR 基金会发布首届竞赛——「数学蒸馏挑战赛」,邀请参赛者撰写一页「小抄」(cheat sheet),把 2200 万道代数判断题的解题知识提炼出来,用以大幅提升弱模型的准确率。
核心要点
- SAIR (科学与AI研究基金会) 推出首届竞赛,主题为「蒸馏挑战」(Distillation Challenge)。
- 竞赛核心理念:数学不只关乎答案,更关乎得到答案的过程与可被人理解的解题方法。
- 题库为 2200 万道代数领域的「是/否」(yes-no) 判断题,前沿模型准确率约 95%,而弱模型(开源模型)只有约 50%(接近随机猜测)。
- 任务是为弱模型提供一份提示词/「小抄」,把准确率从 50% 尽可能提升,并据此评分。
- 参赛者可在官网 playground 上用测试集反复试验不同小抄,竞赛于 4 月底结束后用私有题库做最终评测。
- 陶哲轩期待选手能把整个代数领域的知识浓缩到一张 A4 纸上,并以「愿最好的家庭教师胜出」收尾。
分章详解
开场与竞赛发布
- 陶哲轩代表 SAIR 基金会,在一个周五正式宣布该基金会的首届竞赛。
- 竞赛被命名为「蒸馏挑战」(Distillation Challenge)。
竞赛背后的理念:过程胜于答案
- 陶哲轩强调,数学不仅仅是「解题」(problem-solving),人们想要的不只是问题的答案。
- 即便一个强大的 AI 能直接给出答案,人们往往想要更多——想学会自己如何解决问题。
- 因此竞赛的目标是把「如何解题」的能力提炼、传递出来。
题库与模型表现的差距
- 团队收集了 2200 万道代数领域的「是/否」判断题,这些题目都在当前前沿模型的能力范围之内。
- 典型情况下,前沿模型(frontier model)能以约 95% 的准确率正确回答是或否。
- 而弱模型(如开源模型)只能达到约 50%,即不比随机猜测更好。
挑战任务:撰写「小抄」
- 参赛者需要为弱模型提供一份提示词,或者说一份「小抄」(cheat sheet)。
- 评分依据是这份小抄能把弱模型的准确率从 50% 提升到多高。
- 陶哲轩用比喻形容目标:把全部代数知识浓缩到一张 A4 纸大小的纸上。
竞赛流程与时间安排
- 未来约一个月里,参赛者可在官网的 playground 上测试不同小抄,观察它们在测试题集上的表现。
- 竞赛在 4 月底结束;届时团队会取选手的最终提交,用一套私有(未公开)题库进行评测。
- 评测衡量的是这些小抄对本地(local)弱模型性能的实际提升幅度。
结语与期待
- 陶哲轩表示非常期待看到选手们设计出哪些巧妙(ingenious)的小抄。
- 他以「愿最好的家庭教师胜出」(may the best tutor win) 这句话作结,呼应了「教会弱模型解题」的竞赛主旨。
关键引述
“数学不只是关于解题。我们要的不只是问题的答案,还想理解得到这些答案的过程。(Math is not just about problem-solving. We don't just want the answers to problems. We want to also understand the process of arriving at these problems.)”— 陶哲轩 (Terence Tao)
“就算一个炫酷的 AI 能给你答案,我们往往想要更多——我们想学会自己如何解决问题。(Just because a fancy AI can give you the answer, often we want more. We want to learn how we can solve the problem ourselves.)”— 陶哲轩 (Terence Tao)
“我很期待看到你们如何把整个代数的知识浓缩进一张 A4 纸里。(I look forward to seeing how you can condense all the knowledge of algebra into one A4 size sheet of paper.)”— 陶哲轩 (Terence Tao)
“愿最好的家庭教师胜出。(May the best tutor win.)”— 陶哲轩 (Terence Tao)
术语 / 人物
SAIR (Science and AI Research Foundation) — 科学与AI研究基金会,由陶哲轩等人联合创立,汇聚诺贝尔奖、图灵奖、菲尔兹奖得主,致力于用 AI 推动科学发现,并让 AI 扎根于科学。
蒸馏挑战 (Distillation Challenge) — 本次竞赛名称。「蒸馏」指把大规模已知结果(2200 万道题)压缩成一份简短、人类可读的「小抄」,从而把解题能力迁移给弱模型。
小抄 (Cheat Sheet) — 参赛者提交的提示词或知识提要,作为给弱模型的辅助材料,用以提升其判断准确率。
前沿模型 / 弱模型 (Frontier model / Weak model) — 前沿模型指当前最强的 AI 模型(准确率约 95%);弱模型指开源等能力较弱的模型(准确率约 50%,接近随机)。
等式理论 / 泛代数 (Equational Theories / Universal Algebra) — 题库所属领域。竞赛中的 2200 万道判断题源自陶哲轩主导的等式理论项目(ETP),判断某个等式蕴含关系是否成立。
背景补充
陶哲轩 (Terence Tao) 是加州大学洛杉矶分校 (UCLA) 数学教授、2006 年菲尔兹奖得主,被誉为当代最杰出的数学家之一。他是 SAIR (科学与AI研究基金会) 的联合创始人之一,该基金会聚集多位诺贝尔奖、图灵奖、菲尔兹奖得主,旨在用 AI 加速科学发现。本次挑战的题库来自其主导的「等式理论项目」(Equational Theory Project),灵感部分来自 Honda、Murakami 与 Zhang 的论文;该竞赛由陶哲轩与 Damek Davis 等人共同发起,后续还衍生出模算术、逆 Galois 问题等多届挑战。
适合谁看
适合关注 AI 与数学结合的研究者、机器学习与提示工程从业者、对开源模型能力提升感兴趣的开发者,以及希望参与社区式数学协作的数学爱好者。