竞赛/平台指南
模运算挑战赛:SAIR Playground 使用指南
Modular Arithmetic Challenge: SAIR Playground Guide
竞赛/平台指南🎤 SAIR 官方旁白(SAIR narrator,未具名)⏱ 2:13👁 NA
▶ 在 YouTube 观看
一段操作教程,逐步演示如何在 SAIR 模运算挑战赛(Modular Arithmetic Challenge)的 Playground 页面提交并评估你的模型。
核心要点
- 本视频是 SAIR 模运算挑战赛 Playground 的官方操作指南,目标是教你如何提交模型并查看评估结果。
- 提交前需要先拥有 SAIR 账号,并准备好模型的 Hugging Face 仓库与具体提交版本。
- 评估会锁定到一个 40 位字符的 commit SHA,确保结果对应固定版本而非随时变化的最新版。
- 私有仓库或需授权的模型文件需填写 Hugging Face access token,公开仓库则可留空。
- 评估完成后应重点关注 frontier tier、整体准确率(overall accuracy)以及各 tier 的表现。
- 正式提交进入官方排名前,仓库必须设为公开,因为只有公开仓库才有参赛资格。
分章详解
开场与前置条件
- 欢迎进入 SAIR 模运算挑战赛 Playground,本视频演示如何用它来评估你的模运算挑战模型。
- 开始前请确保已拥有一个 SAIR 账号。
- 随后打开 Modular Arithmetic Challenge Playground 页面,这里用于录入本次评估的模型信息。
步骤一至三:填写模型来源与访问凭证
- 步骤一:在 Hugging Face repository 字段填入你的模型仓库。
- 步骤二:在 commit SHA 字段填入完整的 40 位字符提交哈希;评估将锁定到该特定提交,而不会使用可能随时间变化的最新版本。
- 步骤三:若仓库为私有或模型文件需要授权访问,需在 access token 字段填入 Hugging Face token;公开仓库可将该字段留空。
步骤四至五:备注与评估集选择
- 步骤四(可选):在 submission note 中添加备注,例如模型版本、训练配置或实验名称。
- 步骤五:选择一个评估集(evaluation set),不同评估集的案例数(case counts)与 tier 覆盖范围可能不同。
- 页面右侧面板会展示所选评估集的详细信息。
提交评估
- 确认所填信息无误后,点击 submit 开始评估。
查看与分析评估结果
- 评估完成后,重点关注 frontier tier、整体准确率(overall accuracy)以及每个 tier 的表现。
- 若需排查错误,可打开 inspect cases,并使用 failures only 仅查看失败的案例。
开发测试与正式提交的注意事项
- 在开发与测试阶段,可以使用私有仓库配合 access token 进行评估。
- 正式提交之前,必须将仓库设为公开,因为只有公开仓库才有资格进入官方排名。
- 以上即模运算挑战赛 Playground 的完整流程,欢迎提交模型并参与挑战。
关键引述
“评估将锁定到这一特定提交,而不会使用可能随时间变化的最新版本。(The evaluation will be locked to this specific commit instead of using a latest version that may change over time.)”— SAIR 官方旁白
“正式提交之前,请将仓库设为公开,因为只有公开仓库才有资格进入官方排名。(Before your official submission, please make the repository public because only public repositories are eligible for the official ranking.)”— SAIR 官方旁白
“若需排查错误,打开 inspect cases 并使用 failures only 来查看失败的案例。(If you need to inspect errors, open inspect cases and use failures only to view failed cases.)”— SAIR 官方旁白
术语 / 人物
Modular Arithmetic Challenge(模运算挑战赛) — SAIR 基金会举办的第二个数学挑战赛,旨在考察神经网络执行简单模运算的效率。
Playground — 挑战赛官方提供的在线评估页面,用于录入模型信息、提交并查看评估结果。
commit SHA — 完整 40 位字符的 Git 提交哈希;用于将评估锁定到模型的特定版本,保证结果可复现。
Hugging Face access token — 访问私有仓库或受限模型文件所需的授权令牌,公开仓库无需填写。
frontier tier / tier — 评估结果中的分层指标;frontier tier 与各 tier 表现及整体准确率是评估的关注重点。
SAIR — 科学与 AI 研究基金会(The Foundation for Science and AI Research),由 Terence Tao 等联合创立,致力于以 AI 加速科学发现。
背景补充
SAIR(科学与 AI 研究基金会)由 Terence Tao 等联合创立,宗旨是用 AI 加速科学发现、并以科学方法评估与治理 AI。模运算挑战赛(Modular Arithmetic Challenge)是 SAIR 推出的第二个数学挑战赛,由 Tao 与 Alberto Alfarano、François Charton、Yongzheng Jia、Kristin Lauter、Cathy Li、Emily Wenger 等人共同发起,主题是考察神经网络执行简单模运算的效率。挑战赛托管于 SAIR 自有的竞赛平台(competition.sair.foundation),参赛者通过 Hugging Face 仓库提交模型进行评估。
适合谁看
适合准备参加 SAIR 模运算挑战赛的参赛者,以及希望了解如何在该 Playground 上通过 Hugging Face 仓库提交与评估模型的研究者与开发者。