OpenAI发布最强模型o1:博士物理92.8分,IOI金牌水平

  梦晨衡宇发自凹非寺

  量子位公众号 QbitAI

  来了来了!刚刚,OpenAI 新模型无预警上新:o1 系列,可以进行通用复杂推理,每次回答要花费更长时间思考。在解决博士水平的物理问题时,GPT-4o 还是“不及格”59.5 分,o1 一跃来到“优秀档”,直接干到 92. 8 分!没错,传说中的「草莓」,终于来与大家见面了!

  CEO 奥特曼称它是一种新范式的开始:可以进行通用复杂推理的人工智能。具体来说,o1 系列是 OpenAI 首个经过强化学习训练的模型,在输出回答之前,会在产生一个很长的思维链,以此增强模型的能力。换句话说,内部思维链越长,o1 思考得越久,模型在推理任务上的表现就越好。

  o1 有多强呢?CEO 奥特曼直给了答案:

  在刚刚结束的 2024 IOI 信息学奥赛题目中,o1 的微调版本在每题尝试 50 次条件下取得了 213 分,属于人类选手中前 49% 的成绩。

  如果允许它每道题尝试 10000 次,就能获得 362.14 分,高于金牌选手门槛,可获得金牌。

  另外它还在竞争性编程问题(Codeforces) 中排名前 89%,在美国数学奥林匹克(AIME) 预选赛题目中跻身美国前 500 名学生之列。

  与 GPT-4o 相比,o1 在数理化生、英语法律经济等各种科目都有不同成绩改进。

  汇总官方发布的各种消息来看,这次突然发布的 o1 系列又分为三个型号:

  o1,新的大模型天花板,过于强大目前不方便对外公开。

  o1-preiview,o1 的早期版本,可以立即提供给 ChatGPT 付费用户和 API 用户。

  o1-mini,速度更快、性价比更高,适用于需要推理和无需广泛世界知识的任务。

  不少 OpenAI 员工都分别用“系统1”和“系统2”思考来科普 o1 系列与之前模型的区别。

  连长期休假中的总裁 Brockman 都“诈尸”回归了。

  思维链提示方法的原作者 Jason Wei 表示,这一次不是纯粹通过提示来完成思维链,而是使用强化学习训练模型以更好地执行链式思考。

  在深度学习的历史中,人们一直试图扩展训练阶段的计算,但思维链是自适应计算的一种形式,现在也可以在推理时扩展。

新模型做了很多类似人类的事情,比如将棘手的步骤分解为更简单的步骤、识别和纠正错误以及尝试不同的方法。

  游戏已被完全重新定义。

  o1:AI 能力新天花板

  通过训练,o1 模型学会完善自己的思维过程,尝试不同的策略,并认识到自己的错误。

  不过作为早期模型,它尚不具备 ChatGPT 的许多有用功能,例如联网搜索以及上传文件和图像。

  但对于复杂的推理任务来说,这是一个重大进步,OpenAI 称代表了人工智能的最高水平。

  鉴于此,他们决定将计数器重置,并将该系列模型命名为 OpenAI o1。

  随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1 的性能持续提高,新的 Scaling Law 诞生了。

  不过这种方法的 Scaling 受到的限制与普通预训练有很大不同,OpenAI 正在继续研究它们。

  o1 思考起来是什么样子?可以从官网示例中的编写 Bash 脚本的编程任务一窥究竟。

  首先作为对比,GPT-4o 会直接就开始写代码,遗憾得到错误结果。

  而 o1-preiview 会先用自己的理解复述一遍要求,然后开始拆解要求,明确最终目标。

  接下来它会给自己定义任务、分析限制条件、列出需要用到的方法。

  进一步把任务拆解成明确的数个小步骤。

  最后才动手编写代码,并保证一次性得到正确结果。

  OpenAI 表示,o1 系列可以帮医疗保健研究人员来注释细胞测序数据,帮助物理学家可以生成量子光学所需的复杂数学公式,所有领域的开发人员可以使用 o1 来构建和执行多步骤工作流程。

  而且不是说说而已,OpenAI 已经邀请相关的人类专家学者试用了一波。

  马克思普朗克研究所的量子物理学者 Mario Krenn,展示了 GPT-4o 不能回答但 o1-preview 正确完成计算的复杂量子物理问题。

  除了考试和学术基准之外,团队还评估了人们对 o1-preview 与 GPT-4o 在开放问题上的偏好。

  在数据分析、编码和数学等推理密集型类别中,o1-preview 明显优于 gpt-4o。

  然而 o1-preview 在某些自然语言任务上并不是首选,这表明它并不适合所有场景。

  OpenAI 科学家 Noam Brown 分享了更详细的个人测试结果。

  在上个月的 ACL 会议上有一个所有当时大模型都无法解决的逻辑难题。o1-preview 能够做对,o1 满血版几乎每次尝试都能做对。

  目前 o1 花费在思考上的时间是几秒到十几秒,但 OpenAI 未来的改进方向不是缩短,反而是努力增加这个时间,

目标是让未来的版本思考几个小时、几天甚至几周。

  推理成本会更高,但你会为一种新的抗癌药物付多少钱?为了电池的突破、黎曼猜想的证明又付多少?

  人工智能可以不仅仅是聊天机器人

  谁可以访问 o1?

  根据 OpenAI 官方说法,ChatGPT Plus 和 Team 用户最早可在几个小时内可以体验到 o1 系列模型。

  在发布时,o1-preview 限制为每周 30 条消息,o1-mini 每周 50 条。

  API 访问权限将首先给 Tier 5 级用户,也就是已经在 OpenAI API 上花费超过 1000 美元的人。

  OpenAI 正在努力提高这些速率,并使 ChatGPT 能够针对给定的提示自动选择合适的模型。

  快打开 ChatGPT 看看你是不是第一波吃草莓的人吧。

  https://openai.com/o1/

  https://x.com/polynoamial/status/1834280155730043108