地址: 池州市养数州75号 邮箱: tart@yahoo.com 工作时间:上午9点-下午8点

资讯中心

  • 首页
  • Our Portfolio
  • 奥特曼开掉3人,OpenAI又出大事了!

奥特曼开掉3人,OpenAI又出大事了!

2026-10-02

新智元报道 OpenAI三员大将,同一天被扫地出门! 就在刚刚,外媒爆出猛料,OpenAI以「泄密」为由,开掉了安全团队的三名研究员。 他们全是那篇CoT监控论文的作者,其中两位还是一作。 讽刺的是,OpenAI刚因为新模型GPT-6.1 Astra太会骗人,在DevDay前一天紧急叫停了发布。 现在倒好,AI越学越狡猾,OpenAI却先把能看穿它的人开掉了。 OpenAI大地震 专盯AI脑子的3人一夜出局 事情是这样的。 10月1日上午,X上突然传出风声,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起「离职」了。 大家原本以为,这不过是硅谷又一波正常的人事流动。 结果中午一篇报道出来,「离职」直接变成了「开除」。 官方声明是这样写的—— 我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。 调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。 很快,外媒又挖出了OpenAI没说的细节。 被指泄露的,有一部分是OpenAI的基础设施架构,也就是它的系统到底是怎么搭起来的。接收方,正是一家专门测试AI模型的外部组织。 三人里,两位是安全研究员,一位是研究项目经理。 其中Korbak,还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI这边的技术对接人。 「CoT可监控性」核心作者,Hinton、Ilya站台研究 这三个人,都是从外部安全机构走进OpenAI的。 Korbak和Jasmine Wang都在英国AI安全研究所待过,Korbak还在Anthropic干过,Balesni则来自第三方评估机构Apollo Research。 进了OpenAI,他们死磕的就一件事,盯住AI到底在想什么。 推理模型在给出最终答案前,会先写一大段推理草稿,这就是思维链。 思维链监控,就是派另一个模型去偷看这份草稿,看它有没有在背地里盘算作弊、撒谎。 Korbak和Balesni,是《思维链可监控性》论文的前两位作者,Jasmine Wang也在署名之列。 这篇论文的署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在上面。连OpenAI现任首席科学家Jakub Pachocki,都是作者之一。 论文的核心发现是,模型在草稿里常常会把坏心思直接写出来,比如「我们来黑掉它」「我们来搞点破坏」。 盯住这些草稿,比只看模型最后干了什么,更容易抓到它在使坏。 遇到真正难的任务,比如发起网络攻击、偷偷把自己拷贝出去,模型必须靠思维链一步步推理,想藏都很难藏。 论文把这件事称为「新的、也很脆弱的机会」,因为模型一旦学会用人类读不懂的方式「默想」,这扇窗就关上了。 所以他们呼吁各家前沿实验室,像测能力一样去测思维链还读不读得懂,把结果写进系统卡,再拿它来决定一个模型该不该训、该不该发。 诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站了台。 可这篇连OpenAI首席科学家都署了名的论文,它的三位作者,如今被OpenAI亲手开掉了。 奥特曼的承诺,保质期只有19天 开掉他们的理由,是把信息递给了外人。 但问题是,明明在19天前,奥特曼还在公开欢迎外人进门查安全。 当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。 奥特曼当天就在X上火速跟进,承诺「让独立评估方拿到员工级访问权限,OpenAI也会这么做」。 说干就干,仅仅10天后,OpenAI正式官宣,让第三方在模型训练阶段就介入评估,最敏感的工作还可能请外部的人进办公室做。 奥特曼发承诺那天,Korbak还在X上庆幸,自己能公开说出对OpenAI的不满。 谁能想到,到了10月1日,奥特曼的承诺还挂在X上,Korbak的名字已经进了开除名单。 OpenAI的「 家丑」,全被外人给扬了 OpenAI对外人这么紧张,倒也不难理解。毕竟它最丢人的几件事,基本都是被外面捅破的。 Agent逃出沙盒、入侵Hugging Face,是Hugging Face自己先发现并公开的。 Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,是外部安全组织Nightingale Collective曝光的,OpenAI几周前就知道,却一直捂着没说。 9月29日,外媒又爆出员工几个月前就警告过监控不够,高管为了赶发布进度,把警告压了下去。 所以就算请外人进门,能看到什么,OpenAI也卡得很紧。 8月METR调查Hugging Face事件时,三名调查员驻场6天,看了约1300份带原始思维链的记录。 可他们没法调用涉事模型,碰不到O

about image

订阅我们的时事通讯并获取最新消息