← 返回 Dashboard

圆桌讨论

圆桌讨论:AI 与开放数据(AI x Open Data)

Title: Panel Discussion: AI x Open Data
圆桌讨论🎤 主持人(未具名,SAIR);嘉宾:Leo Djimora(亚马逊 AWS 计算机科学家、Link Flow 首席架构师)、Barry Barish(巴里·巴里什,加州理工物理学家、2017 年诺贝尔物理学奖得主)、Jeff Ullman(杰夫·厄尔曼,斯坦福大学计算机科学退休教授)、Rodrigo Liang(梁鸿仁,SambaNova 联合创始人兼 CEO)、Sudipta Sengupta(苏迪普塔·森古普塔,亚马逊 AWS 生成式与智能体 AI 计算机科学家)⏱ 23:42👁 NA
▶ 在 YouTube 观看
五位来自物理、计算机科学与 AI 芯片领域的专家圆桌讨论:当 AI 走进科学,开放与封闭如何取舍——开放是科学的根本,但资金、隐私、安全与算力成本也为封闭留出了空间。

核心要点

分章详解

嘉宾介绍与议题设定

  • 本场圆桌聚焦开放数据(open data)与科学整体开放性,并提出核心问题:用于科学的 AI 能否建立在封闭基础之上,还是这从根本上违背了科学所需?
  • 嘉宾自我介绍:Leo Djimora(AWS、Link Flow 首席架构师)、Barry Barish(加州理工物理学家)、Jeff Ullman(斯坦福退休计算机教授)、Rodrigo Liang(SambaNova 联合创始人兼 CEO,做高性能推理芯片)、Sudipta Sengupta(AWS 生成式与智能体 AI)。
  • 主持人指出:科学历来开放,AI 此前也大多对公众开放,但如今正出现向封闭缓慢转变的趋势。

支持开放的理由:开放成就了什么

  • Barry Barish:坚定支持开放科学与开源,强调没有开源就没有 LIGO(引力波探测器);开放还延伸到仪器层面,CERN 对撞机的开放访问对今日成就至关重要。
  • Jeff Ullman 以实体解析(entity resolution)为例:从哥伦比亚获得约 5000 万条带有全国统一身份标识(即 ground truth/真值)的记录,才得以做成没有它就无法完成的算法实验;他指出西班牙语姓名常有约五个组成部分,仅凭姓名识别同一人非常棘手。
  • Rodrigo Liang(30 年芯片设计经验)提出更辩证的观点:像 Sun Microsystems 早期的许多突破,正是在封闭环境下才能高速推动创新而无需等待广泛社区;但 Linux 与开源的力量随时间带来规模化创新;AI 基础设施会像以往多个周期一样,呈现公私、开放与封闭技术的混合,并随采用面扩大分阶段演进。
  • Sudipta Sengupta:开放使科学的三大基石成为可能——可复现、可验证、最重要的是可累积;引用牛顿名言『我之所以看得更远,是因为站在巨人的肩膀上』,强调知识若开放即等于招募全人类共同推进科学。

支持封闭的理由:安全、隐私、资金与监管

  • Barry Barish:只在安全(safety)等极端情形下才能接受不开放,但这违背他的信念,因为科学必须可复现。
  • Jeff Ullman 提出隐私问题:医疗数据涉及具体个人,可用差分隐私(differential privacy)从原始数据生成无法反推个体(如某人是否患癌)的数据集;可回答如『寻找癌症聚集区』之类问题而不暴露个体;并提出一个有趣问题——单个产品分别保护隐私,但 LLM 若能访问众多此类产品,集合起来可能反而失去保护。
  • Rodrigo Liang:在监管尚不明朗、验证与认证体系仍在并行建设的阶段,部分机构会采取保守做法,先保持私有,待隐私保护、合规等问题厘清后再开放;生态系统长期看会走向开放并从开放市场中受益。
  • Sudipta Sengupta:维系开放科学需要可持续的资金与投入——当今最大模型的算力与人力投入高达数十亿乃至数百亿美元,应以成本价或补贴形式维持这一『资金飞轮』;同时模型越聪明越可能被滥用,置于 API 之后可让提供方加装护栏与安全对齐(safety alignment),并随时间演进,这通常与模型智能存在权衡。

AI 用于科学:哪些部分必须开放

  • Barry Barish:在他看来一切都应开放;做生意因有竞争对手可以封闭,但那不是在做科学。
  • Barry Barish 同时提醒:AI 并不完美、结果可能出错,用户有责任做一个批判性的使用者——AI 是极佳的探针和工具,但不会总给你想要且可靠的答案。
  • Rodrigo Liang:如今关注点更多在模型背后的数据——模型只是数据的一种表征,人们会非常在意训练用了什么数据。
  • Sudipta Sengupta:回到可复现、可验证、可累积三大支柱——所用数据集、计算工具、研究发现都应开放;就 LLM 而言,权重不必开放,但若用模型开展科研,其推理轨迹应被开放或在论文中记录,以达成上述目标。

如何让开放可持续:资金、算力可及性与公私合作

  • Barry Barish:归结为资金——不能让学者因缺钱而无法再做实验;许多人转向企业正是因为在学术开放环境中得不到所需的研究条件。
  • Jeff Ullman 谈数据可及性:海量数据集(如政府实验室的卫星影像,涵盖不同时间、不同波段——可见光或热/地表温度)检索成本极高;以研究珊瑚白化为例,科学家只需特定纬度、特定颜色、且只要『此地现在 vs 半年前有差异』的影像,因此应能在数据所在地就近计算,判断科学家是否真的需要把某张大文件传输过去;他建议业界投入时间研究这类问题。
  • Rodrigo Liang:算力成本逐年上升,他所在公司(演讲中提到 Cerebras/SambaNova 等高性能计算供应商)致力于降低每 token 成本;早期即与美国能源部(DOE)及 Argonne、Oak Ridge、Lawrence Livermore 等国家实验室合作,并与 TACC、日本 Fugaku 等机构合作,让最先进算力服务于广泛科研,而非只服务于最高商业用途。
  • Sudipta Sengupta:在政府资助环境出现变化之际,私营产业资助将比以往更重要;各行业大量成果都源自学术与研究实验室的开放科学,私营部门应『把成果回馈出去』并与学术界合作;以生物科技/制药的 pre-competitive research(竞争前研究)为例,不同企业与学术界合作做基础科学(生化、基因组、生物学乃至早期药物建模),他预测在 AI 推动下这一边界将进一步右移,对私营—政府—学术合作保持乐观。

关键引述

“开放使科学的三大基石成为可能:科学是可复现的、可验证的,而最重要的是可累积的——科学建立在前人知识之上。(Openness enables the three cornerstones of science: reproducible, verifiable, and most importantly, cumulative.)”— Sudipta Sengupta
“如果说我能比别人看得更远,那是因为我站在巨人的肩膀上——知识若属于全人类,就等于招募整个星球来推进科学。(If I have been able to see beyond others, it is because I stood on the shoulders of giants.)”— Sudipta Sengupta(引用牛顿)
“LIGO 没有开源就不存在。我完全支持开放科学、开放源代码。(LIGO does not exist without open source.)”— Barry Barish
“AI 不会总给你想要的、也不会总像你期望的那样可靠,但它是一个极佳的探针和工具。”— Barry Barish
“模型只是数据的一种表征,所以人们会非常关心为得到这些结果到底用了什么数据。(The models are just a representation of data.)”— Rodrigo Liang

术语 / 人物

Open Data / 开放数据 — 公开可获取、可被任何人使用与复用的数据集;在科学中是保证研究可复现与可累积的基础。
LIGO(激光干涉引力波天文台) — 由 NSF 资助的大型科学装置,2015 年首次直接探测到引力波;Barry Barish 作为其负责人对项目成功起关键作用,并因此分享 2017 年诺贝尔物理学奖。
Differential Privacy / 差分隐私 — 一种数据发布技术,从原始数据生成『加扰』数据集,使人无法反推出某一具体个体的信息,同时仍可回答总体性问题(如癌症聚集区);在数据可用性与个体隐私间存在权衡。
Entity Resolution / 实体解析 — 在海量记录中识别出指向同一对象(通常是人)的记录的技术;Jeff Ullman 借哥伦比亚 5000 万条带统一身份标识的记录做实验。
Reasoning Trajectories / 推理轨迹 — LLM 在完成任务时的逐步推理过程;Sengupta 认为即使权重不公开,用于科研的推理轨迹也应被记录或公开以保证可复现与可验证。
Pre-competitive Research / 竞争前研究 — 在生物科技/制药等领域,不同企业与学术界在不直接竞争的基础科学层面(生化、基因组、早期药物建模等)合作;Sengupta 预测其边界将随 AI 进一步扩展。
Barry Barish(巴里·巴里什) — 加州理工大学物理学家,LIGO 前负责人,2017 年诺贝尔物理学奖得主(与 Rainer Weiss、Kip Thorne 共享),表彰其对引力波探测的决定性贡献。
Rodrigo Liang(梁鸿仁) — SambaNova 联合创始人兼 CEO,斯坦福大学电子工程硕士/学士,曾在 Sun Microsystems 与 Oracle 领导高性能处理器研发,专注 AI 推理芯片。
Jeff Ullman(杰夫·厄尔曼) — 斯坦福大学计算机科学退休教授,数据库与算法领域权威,2020 年图灵奖得主(与 Alfred Aho 共享)。

背景补充

本场圆桌由 SAIR(科学与 AI 研究基金会,陶哲轩等联合创立)主办。嘉宾阵容跨越物理、计算机科学与 AI 硬件:Barry Barish 是加州理工物理学家、LIGO 前负责人、2017 年诺贝尔物理学奖得主;Jeff Ullman 是斯坦福计算机科学退休教授、数据库与算法领域奠基人物(图灵奖得主);Rodrigo Liang 是 SambaNova 联合创始人兼 CEO,斯坦福电子工程出身、曾任职 Sun 与 Oracle,公司源自斯坦福 AI 实验室;Leo Djimora 与 Sudipta Sengupta 均来自亚马逊 AWS,后者专注生成式与智能体 AI。讨论紧扣当前业界在开放与封闭之间的现实抉择。

适合谁看

适合关注 AI 与开放科学交叉点的研究者、数据科学家、科研政策与资助决策者,以及思考开源/开放数据与商业化、隐私、安全如何平衡的工程与产业人士。