9月10日,在2026Inclusion·外滩大会主论坛上,普林斯顿大学人工智能创新中心主任王梦迪教授提出一个问题:AI距离自主发现新科学还有多远?
她的判断是,今天的大模型已经掌握了大量人类知识,但在真正的科学发现上仍然存在明显局限:大模型更擅长找到“最可能”的答案,而真正的新发现,往往藏在概率分布的长尾里。

王梦迪团队近期与普林斯顿大学社会学教授谢宇合作,用ChatGPT、Claude等大模型进行“模拟人生”实验。例如,让模型模拟一个1930年出生的英国人,自主生成自己此后的人生轨迹。
实验发现,在结婚年龄、职业、性别等多个问题上,大模型倾向于高估最常见的情况,却明显低估少数情况和长尾分布。
大模型会学到一个概率分布里最大似然的那一点,但对于长尾的知识可能会低估、甚至忽略。”王梦迪说。
她认为,这也解释了为什么大模型在数学、Coding等领域进展迅速,却尚未在物理、化学、生物等基础科学领域产生同等规模的原创发现。
区别在于,数学和Coding拥有相对明确的“验证器”。Coding可以通过编译器和Unit Test验证结果,数学则可以借助Lean等形式化证明系统进行验证。模型可以不断尝试、获得反馈、修正答案,再进入下一轮训练。但在现实科学研究中,验证远没有这么容易。
“Ideas are cheap。你要给我看代码,或者给我看实验。”王梦迪表示。科学研究往往涉及复杂的实验设备、人的判断以及跨团队协作,很多实验甚至无法稳定复现。信息越来越多,并不意味着真正有效的新信息同步增加,反而可能降低科研过程中的“信噪比”。
在她看来,AI走向自主科学发现的关键,并不是让模型再多知道一些,而是让现实世界变得越来越可验证。
王梦迪团队正在尝试建立这样的一个基础设施。在量子材料研究中,他们搭建了自动化实验平台,将原本需要科研人员数月完成的石墨烯实验流程进行自动化,并将实验设备和能力封装成API,让其他科研机构能够调用和复现实验;同时,他们还在探索面向科研实验室的智能操作系统LabOS,让多模态AI能够通过智能眼镜感知实验环境、辅助科研人员操作,并进一步连接软件、AI模型、机器人和真实实验设备。
王梦迪认为,真正决定AI能否成为“发现者”的,不只是模型有多大,而在于是否存在一套能够连接假设、验证、追溯和重复的基础设施。只有当物理世界中的实验过程能够被系统记录、持续验证、反复复现,AI才可能真正把训练中学到的“似然性”,转化为对“可能性”的探索。
2026Inclusion·外滩大会于9月9日至12日在上海举行,大会以“共创AI新经济”为主题,探讨AI如何推动更可持续的经济增长和更广泛的社会价值。
相关文章
最新文章
外滩大会圆桌对话上,作家刘震云与港大教授马毅从文学和科技视角探讨AI对创造、教育、就业及人际关系的影响。二人态度乐观:刘震云称AI绝非洪水猛兽;马毅认为关键不在用不用AI,而在人类如何重塑自身价值与定位。
谷歌DeepMind与Google Research发布WeatherNext 3,针对AI气象模型分辨率粗、无法刻画局部地形,以及初始化依赖滞后约6小时NWP两大问题。该模型直接以气象站实测数据训练,不再依赖再分析网格,并采用实时全球静止卫星拼图作为输入,每小时重新初始化,提升预报分辨率和时效性。
马斯克22岁女儿薇薇安·威尔逊出任西班牙品牌Desigual 2026秋季代言人,广告主题“天生叛逆”。片中她戏谑挑战AI,给造型参考特斯拉人形机器人的DESI 84下达离谱指令:当高尔夫球座、当宠物遛、命令割草,还有床上互动桥段。
9月3日美东时间上午9点23分左右,ChatGPT、Claude、Grok、谷歌Gemini、微软Copilot等海外主流AI服务集体宕机,持续约3小时40分钟,给海外用户办公与技术调用造成困扰。与海外集体掉线形成鲜明对比,国内AI大模型同一时间未出现类似故障。
智能戒指厂商Oura提交IPO申请,截至6月30日过去9个月营收12亿美元,高于去年同期6.97亿;预计2024年营收约5亿、2025年约10亿、2026年近20亿。过去一年售出约360万枚戒指,付费会员约500万,留存率约85%,售价350至400美元。
9月8日,DeepSeek V4.1-Flash开启中间版本内测,采用全新模型结构,原生支持多模态,综合能力更强、速度更快、调用成本更低。开发者保持base_url不变,将模型名设为deepseek-v4.1-flash-expires-on-0910即可调用,计费与V4-Flash一致。外部反馈暂未披露。
谷歌DeepMind与谷歌研究院联合发布全球天气AI模型WeatherNext3,突破传统气象AI在局部地形分辨率和初始化延迟上的瓶颈,直接接入实时静止卫星拼图实现每小时初始化,并以原始气象站观测数据训练,全方位提升预报精度。其核心架构沿用WeatherNext2的概率型功能生成网络(FGN)网格T。
阿里旗下AI办公产品“千问办公”上线满月,用户数突破3000万,企业用户占比超半数,显示企业级AI应用爆发。过去30天累计更新120个版本,日均迭代4次,新增功能上千项,国际版同步上线。技术上开源企业上下文基础设施MyContext,可整合分散在IM、文档、审批、邮件等系统中的信息。
未发布的GPT Image 2.5引发科技圈关注,版本号从猜测的2.1跃升至2.5,彰显迭代速度与技术野心。该模型被疑为LMArena匿名模型luna-lisa-alpha,多项生图能力全面飞跃,生成速度较前代更快,画面表现亦有显著提升。
美国头部AI服务集体宕机约3小时40分。ChatGPT、Claude、Grok出现异常,谷歌Gemini、微软Copilot也收到大量中断报告。故障于美东时间9月3日上午9点23分左右集中爆发,Claude系列模型率先报错,峰值时OpenAI收到超3.7万份故障报告。
微软CEO纳德拉宣布为Microsoft 365 Copilot推出AI功能Project Opal,定位为可控安全环境中的智能体,可规划执行复杂长周期任务,从快速问答拓展至委派型工作与长期自动化,用户下达任务后可持续运行数小时。
OpenAI宣布ChatGPT语音模式升级:用户语音交互时可自选模型与推理深度,Pro用户可调用GPT-5.6Sol或GPT-6Astra。当对话涉及网络搜索或复杂逻辑推理时,系统会自动切换至用户指定模型处理,提升语音场景的灵活性与能力。
欧洲AI企业Mistral AI完成30亿欧元D轮融资,刷新欧洲科技公司最大股权融资纪录,成立三年估值突破210亿欧元。资金将用于扩建模型训练与推理算力,加速下一代核心技术研发。
Suno发布迄今最大升级的v6模型家族,系与华纳、BMG、Believe等合作开发的首个系列。新模型更快、更富表现力、音质更高,并赋予创作者精准控制力,旧版将逐步退役。v6包含三大模型矩阵,满足不同创作需求。
2026年外滩大会在上海开幕,主题为“共创AI新经济”。大会聚焦AI从“生成”到“执行”的关键跃迁,设“智能跃迁、经济重构、人本未来”三大板块,包含1场主论坛和40多场见解论坛,邀请600余位嘉宾,包括诺贝尔经济学奖得主托马斯·萨金特、菲利普·阿吉翁等。
DeepSeek将快速、专家、识图三模式合并为统一智能模式,无需手动切换,可自动判断查询复杂度、识别图片并激活视觉能力,按任务难度调配处理。此前多模态模型V4-Flash-Vision-Exp已上线API,支持三种调用格式;V4.1 Flash性能全面超越V4 Pro。
OpenAI宣布保罗·克里斯蒂亚诺加入其基金会董事会。他曾负责OpenAI对齐研究,后任美国国家标准与技术研究院AI标准与创新中心安全负责人。他公开谈及AI超级智能时代风险,并将兼任其他职务。
9月10日,张宏江在2026外滩大会主论坛表示,AI新经济将变革企业组织形态。企业未来核心竞争力在于将IP、Know-how、用户关系和产品能力转化为模型,并使其产生涌现效应;此前他还重点阐述智能体群。
普林斯顿大学教授王梦迪在外滩大会指出,大模型虽掌握大量人类知识,但距自主科学发现仍有明显局限:更擅长给出“最可能”答案,而真正新发现往往藏在概率分布长尾中。她正与谢宇教授合作,探索AI迈向新科学发现的路径。
Marvis Windows新版下调最低配置至4核8GB,降低使用门槛,并新增任务通知,便于掌握执行进度。作为系统级个人AI助手,它可搜索电脑文件与图片,并按人像、内容主题、节日地点等维度提供AI图片、AI文档库等特色能力。
9月10日,2026 Inclusion·外滩大会以“共创AI新经济”开幕。诺贝尔经济学奖得主菲利普·阿吉翁围绕“创造性破坏”与AI革命分享称,AI有望在未来十年使生产率增速每年额外提高约1.08个百分点,潜在影响或超IT革命;但技术潜力能否转化为持续增长,取决于竞争政策、教育体系和劳动力市场制度能否同步跟上。
深度求索发布轻量级多模态模型DeepSeek V4.1Flash,为系列最小尺寸。其采用552B参数MoE架构,创新引入Causal-Encoder-Decoder结构,具备原生视觉理解能力,旨在提升能力上限、推理速度与吞吐量,并具备向更大模型扩展潜力。
财跃星辰与上海交大安泰团队联合开源金融推理大模型Alpha-R1。该模型以8B参数为基座,采用独创语义门控推理与两阶段强化学习训练框架,在金融推理样本外评测中大幅领先通用大模型与传统方法,主要面向资产配置等金融投研场景。
深度求索发布DeepSeek V4.1 Flash,为全新结构系列最小模型,具备原生多模态视觉理解。新结构旨在提升能力上限、推理速度与吞吐,并可扩展至更大参数。该模型为552B参数MoE,采用Causal-Encoder-Decoder不对称结构:输入激活仅8B,输出激活16B,HBM需求降至1/4,显著降低成本。
最新网站