Mythos 2 不发,Astra 停训,前沿模型的安全策略初现
8 月 18 日,OpenAI 披露,公司此前暂停了两周针对拟部署模型的强化学习训练。截至公告发布,最大规模的前沿 RL 训练仍未恢复,较小规模的训练和评测还在继续。
Anthropic同样有一个新模型受阻,SemiAnalysis 主编 Dylan Patel 在 8 月 17 日的采访中称,据他获悉,Anthropic 的下一代模型 Mythos 2 已经完成训练,但不会发布。
两家前沿实验室最近做出了表面相似、性质不同的选择:Anthropic 把一个更强模型留在内部,OpenAI 则因为 Astra 可能具备“关键网络安全能力”,直接收紧了部分训练和推理工作负载。
从Astra的暂缓,我们看到持续了近3个月的模型安全争端,正在逐渐走向一种更成熟的处理方法。
过去,安全评估多在模型训练完成后展开,先测试能力,再决定能否发布。据OpenAI透露,Astra 让控制点前移。模型在 RL 和评测中已经能够执行代码、调用工具、接触内部系统,有时还能访问网络。研究集群不再只是存放实验数据的后台,也成了模型可以采取行动的环境。
OpenAI 因此要求 Sol 级别以上模型只要在 RL 或评测中使用工具,就进入新的监测系统。
这套系统逐 token 扫描模型活动,再把可疑行为交给计算量更高的自动调查器。最高优先级警报会同时通知安全、研究和安保团队。如果 30 分钟内无法确认是误报,相关活动应被暂停。
OpenAI 估算,监测约占被监测推理算力的 20%。它开始消耗集群预算,并影响训练吞吐、权限配置和实验排期。安全团队也由发布审查者变成了训练调度的一部分。
Anthropic走了另一条路径去规避安全问题。Model 2 没有变成产品,却已经成为内部生产资料。它可以生成代码、测试、评测题和训练轨迹,帮助研究人员改进后训练、工具链与下一代实验。播客进一步猜测 Anthropic 正用它推进 Mythos 3。
虽然Anthropic不发布的另一大原因是,从System Card上看,Mythos 2 提升幅度较Fable 5有限,因此可能不符合预期。
但无论如何,现在面对安全瓶颈的两条路都比较明确了。一条是如果不够好,那就干脆不发,规避问题,直到解决为止。另一条则是提出更前移的安全监测,在训练期更深度的加强安全。
Codex增速反超,Anthropic 旗舰模型铩羽
TrickerTrends的指标显示,最近一个月来 Codex最近四周的年化收入增速为20.8%,Claude Code只有5.2%。企业端也不太好看,Ramp企业支出数据则显示,三季度至今OpenAI增长约82%,Anthropic约76%。

Codex似乎已经有反超的趋势了。
回头看二季度收入,情况正好相反。Anthropic收入约116亿美元,环比增长超过100%,《华尔街日报》8 月 18 日援引知情人士报道,OpenAI 二季度收入由一季度的 57 亿美元增至 67 亿美元,环比增长仅有 18%。
短短三个月,攻守之势异变。
Anthropic降速主要是来自两个方面。
首先是新旗舰Fable 5的采用,似乎并不理想。Ramp数据表明,目前单看B端旗舰模型GPT-5.6 Sol占OpenAI企业token的25%、模型支出的23%。而 Fable 5只占Anthropic token的6%、支出的11.4%。
Fable 5的受阻并不难理解。这款模型6月9日开放,三天后因美国政府指令下线,约18天后才恢复,而更强的Mythos 5仍只向获批客户开放。Fable 5每百万输入和输出token分别收费10美元和50美元,约为GPT-5.6 Sol当前促销价4美元和20美元的2.5倍,部分企业还面临30天数据保留要求。
模型能力虽强,价格、供应和合规摩擦却阻碍了企业铺开使用。
另一个原因则是OpenAI Codex 本身追赶迅速,尤其是运营策略相当成功。Codex被装进Plus、Pro、Business和Enterprise订阅,部分用户获得免费使用、双倍额度或推广credits。ChatGPT Business年付价格从每席25美元降到20美元,符合条件的团队成员和学生还能获得100美元额度。
Codex周活用户到6月已超过500万,较2月增长六倍,近期据Tibo的推特,整体月活已经突破千万,稳步增长。OpenAI用已有账户、订阅和支付体系,把模型进步迅速变成使用增长。
二季度收入覆盖4月至6月,记录的是Anthropic前一轮Claude Code爆发和企业合同扩张。OpenAI的GPT-5.6、价格调整和Codex推广主要发生在6月底至8月,最早影响的是调用量、活跃用户和credits消耗,合同扩容与收入确认通常更晚。
但这次OpenAI Codex的崛起,是否很快能追平Anthropic的优势呢?
并不容易。
最新报道中的年化收入约为Anthropic 650亿美元、OpenAI 400亿美元,相差约1.63倍。即使Anthropic停止增长,OpenAI也要再增长62.5%才能追平。82%对76%的增速差只能说明方向发生变化,无法立即消除收入鸿沟。
更重要的是收入质量。Vercel的6月生产数据中,Anthropic用32%的token获得61%的支出,并在coding agent、后台agent和应用生成等任务中取得至少72%的支出;OpenAI则是10.3%的token和16.1%的支出。
在当下,企业用户没有大规模转投的情况下(增速差距不大),Claude仍控制着企业最愿意付高价的任务。
Codex的许多新增使用则包含在订阅额度或优惠credits里。只有用户耗尽额度后继续付费、企业扩大合同并在续约时保留这些工作负载,使用增长才会变成可持续收入。
降价还能换来采用,却可能压低单位收入。OpenAI必须证明推理成本下降得比价格更快。
OpenAI 把 Codex 做成平台,但这和DSH想做的方向不同
2026 年 8 月 19 日,OpenAI 发布《Codex as a platform》,把 Codex 明确描述为可复用的开放 Agent Harness。
过去大家更多把它当成编程应用、CLI 或 IDE 插件,现在 OpenAI 希望开发者调用底层能力,把 Agent 嵌进运维后台、安全调查、客服系统和企业内部工具。
但这里开发者不用再从头搭线程管理、上下文维护、工具调用、沙箱、人工审批和任务续跑。
OpenAI 提供了三种接入方式。简单任务可以直接用命令行,连续任务可以用 SDK 保存状态,想自己做界面和业务流程,则可以接 App Server。应用能够创建、恢复或分叉线程,启动和打断任务,切换模型,设置工作目录与权限,注入上下文并接入动态工具。
Codex 的扩展能力比普通 API 深。开发者可以改指令、添加 Skills 和 MCP 工具、配置子 Agent,还能通过 Hooks 卡在工具调用、上下文压缩和 Agent 停止等节点上。
比如,一条 Shell 命令执行前,Hook 可以检查参数,拦截危险操作,甚至改写命令。工具跑完后,它还可以给 Agent 补充信息,要求再做一轮。
看到这里,很容易以为 Codex 已经把 Agent Loop 完全开放了。可如果拿它和 DSH 相比,底层差别仍然很大。
Codex 更像一台已经装好发动机和变速箱的车。开发者可以换轮胎、改仪表盘、设驾驶规则,也能在几个位置加传感器;但发动机怎么点火、何时换挡、故障后怎么重试,还是由 Codex 内核决定。
从目前官方公开接口看,OpenAI 没有把规划器、记忆、调度器、压缩算法和主循环拆成可以随时替换的模块。
开发者当然可以 fork 开源代码硬改,但这意味着维护自己的分支,不是平台原生支持的结构重组。
DSH 瞄准的更底层。它不只让人配置 Agent,还把 Harness 本身变成实验对象,组件可以更换,运行结构可以重新生成,再由任务评测决定保留哪些改动、回滚哪些方案。
所以,OpenAI 所谓“平台”,不是把 Agent 内部结构全部交出来,而是提供一个能力完整、接口稳定、便于嵌入的内核。对法律、金融、客服和研发工具团队,这种自由度已经够用,落地也更快。此举主要是要降低垂直行业使用 Agent 的成本,让更多产品建在 OpenAI 的执行底座上。
而DSH 想探索 Harness 能不能自己长出更好的组织方式。
虽然都在争夺Runtime,但逻辑并不完全一致。
NVIDIA 部分 AI 整机报价据报将上调 15% 以上
Bloomberg 在 8 月 22 日的媒体报道中援引知情人士称,NVIDIA 已通知部分大客户,搭载 Vera Rubin、Grace Blackwell 等 AI 芯片的许多服务器配置将在 2027 年初交付时涨价 15% 以上,主要原因是内存成本上升。
过去一年,我们都在计算新模型推出后,单位智能的价格下降如何迅速。但单位 token 价格下降只反映模型服务的一项边际成本,而训练和推理集群还要支付高带宽内存、CPU、网络、机架、电力、冷却和交付周期的费用。
模型越便宜、Agent 调用越密集,企业越可能增加总调用量。如果内存和整机同时涨价,模型端节省的预算会在基础设施端被吃回去。
这也有可能会带来一轮新的模型涨价潮,就类似在手机行业看到的那种一样。
GEN-1.5 10秒学习可以做新动作,具身智能的新路线开始见效
8月19日,Generalist发布机器人基础模型GEN-1.5。公司称,模型观看3至12秒的传感器—动作演示后,无需更新参数便能执行新任务,在十项短时操作上的平均成功率为59%。
如果使用1至5分钟、约10至50次演示训练,模型只需更新1至10步,十步平均成功率达到83%,权重变化不到0.15%。

除模仿外,它还会换手开盖、清除障碍或处理卡住的物体。官方也承认,测试以拉拉链、开罐和取物等短时操作为主,上下文学习比微调模型更脆弱。
这次发布延续了过去一年的技术演进。
2025年11月,GEN-0展示物理预训练的规模效应。2026年2月,DreamZero正式提出世界动作模型(WAM),联合学习未来世界状态和机器人动作。4月,GEN-1使用超过50万小时真实交互数据,在多项简单任务上达到99%以上成功率,并出现重抓、换手等恢复行为。而6月发布的Behavior Prompting Policy则发现,任务多样性是行为提示能力的主要驱动力。
而 GEN-1.5可以看作今年具身智能路线汇合后的代表系统。广义WAM式时序建模、多样化预训练、带纠错过程的真实交互数据,再加上测试时快速适应都出现在了它的介绍文档中。
虽然没有具体的模型开源,但从其报告叙述中可以看出,它至少不是单纯的VLA模型,而是从连续物理经验中学习状态、动作和后果之间的关系。新演示更像在已有策略空间里指定目标。
同时Generalist强调的是高保真采集会自然保留力反馈、滑落、微调和恢复。模型不只看到标准轨迹,也看到人怎样修正偏差。数据又覆盖不同任务、物体、环境和机器人形态,模型因而可能形成可复用的抓取、施力和纠错方式。
这也解释了few-shot为何能起效。预训练已经让模型接近掌握许多基础动作,几秒演示主要告诉它“这次要完成什么”,再把已有能力组合起来。
微调较少时,模型保留的预训练先验更多,遇到演示之外的障碍有时反而更会变通。
它的成功,至少证明26年这整套新配方能够降低新任务的数据与训练成本,并产生策略重组和现场恢复。
但目前只能说到了GPT 2时刻,里ChatGPT还差着一些关键步骤。目前有效的长程任务还是解决不了,单次展示带来的 59% 学会率也只覆盖公司选择的短程原子任务,泛化也相对狭窄。
AI为抗癌出了力,但不是AI改写了抗癌史
2026年8月19日,默沙东与Moderna在美国新泽西州拉韦和马萨诸塞州剑桥宣布,全球III期INTerpath-001试验达到预定目标。
研究对象不是等待肿瘤缩小的晚期患者,而是已经通过手术完整切除肿瘤、但仍有较高复发风险的IIB至IV期黑色素瘤患者。1,137人接受“Keytruda加intismeran”或“Keytruda加安慰剂”的实验。联合组在延缓复发和远处转移上都更好,也没有发现新的安全信号。
此前IIb期的长期结果已经显示疗效,III期是在更大人群中确认这条路线。
这个新药开发的过程大概是这样的:医生先拿患者的肿瘤组织和正常样本做DNA测序,找出癌细胞独有的突变,再看肿瘤RNA,确认哪些突变真的在表达。
一个肿瘤可能有很多突变,但多数不适合放进疫苗:有的没有表达,有的蛋白不会被切出合适片段,有的片段装不进患者的HLA。
HLA就像细胞表面的展示架,T细胞并不直接看mRNA,它检查的是“蛋白小片段+HLA”。
AI的工作就在这一步。它根据肿瘤DNA、RNA表达和患者的HLA型号,给候选突变打分,预测哪些片段最可能被展示、又最可能让T细胞认出来,最后选出最多34个,编码进一条患者专属的mRNA。
它没有设计新的T细胞受体,也不直接参与杀伤。
没有现代AI,传统生物信息学和实验也能筛选,但每名患者都要重新做一遍,逐个验证会很慢、很贵。AI缩小了实验范围,目标是提高选靶命中率,也让“一人一配方”更接近可交付的工业流程。
注射后,脂质颗粒把mRNA送进树突状细胞等免疫细胞。细胞照着mRNA生产带有肿瘤突变特征的蛋白,切成小片段,放到HLA上展示。人体原本就有大量识别器各不相同的T细胞,少数刚好能认出这些标记的T细胞会被激活、复制,然后到全身寻找展示同一标记的癌细胞。
Keytruda阻断PD-1,避免肿瘤把这批T细胞重新按住。mRNA过一段时间会被分解,不进入细胞核,也不改写DNA。
因此,这次结果证明的是整套组合在这类患者中有效,测序找突变,算法筛候选,mRNA递送教材,HLA负责展示,T细胞执行杀伤,Keytruda解除免疫刹车。
AI很重要,但它主要提高速度、候选命中率和生产可行性,不是免疫反应成立的原因。这一套机制的各个组件之前已经相对成熟,AI只是Moderna在这次试验中的一种附带尝试。
本身试验成功即使无AI,传统方法依然可以奏效,只是后续工业化成本就会非常高。
谷歌新论文,让Harness的训练环境跟着 Agent 的弱点变化
训练 Agent 最难的问题之一就是构造合适的数据场景去训练。
题目太难,做十遍还是不会。题目已经学会,继续刷也不会再进步。可多数训练环境一旦写好,开局、规则和判分办法就固定了,不管来的是哪个 Agent,也不管它练到了什么程度。
如果能够构造出一套能自己生成合适难度题目的Agent训练框架这一切就比较容易了。
8月20日, Google Cloud AI Research 等团队提出的 EnvHarness,想让环境跟着 Agent 的弱点变化。它不重写原来的环境,而是在 Agent 和环境之间加一层外壳。原系统照常运行,原评分器继续判分,外壳只改变 Agent 面对题目的方式。
外壳有三种用法。Stage 改开局。原任务要求把杯子洗净后放到桌上,它可以先把杯子藏进抽屉,逼 Agent 学会搜索;如果任务太难,也可以提前洗好杯子,只让它练摆放。
Contract 改规则,可以少给提示、拦住不合理动作,或者要求代码 Agent 跑完测试才能提交。Chain 把两道题接在一起,做完一件还得继续处理下一件,用来练长任务。
决定怎么改题的是 EnvRigger。它先看 Agent 做题的过程,找出毛病:是在原地打转,读不懂长说明,还是靠捷径过关。接着,它写出新外壳,让 Agent 再做几次。题目若被改得无解,就放松限制,如果仍然太简单,就继续加难。它更像会看错题的教练,不是只会出新卷子的题库。
论文在五套测试环境里做了实验。研究人员先让 Agent 在改造后的环境中练习,再把练出的经验带到没改造过的新任务上。
与直接从原环境学习相比,ALFWorld 在一类没见过的任务上最高提高9.0点;在 SWE-bench Verified 上,平均操作步数从55.01降到49.61,少了约9.8%。不过并非每项指标都提高,Chain 也没有进入自动改题流程,而是另行测试。
这项工作的亮点,是换了一个扩展环境的办法。以往往往是生成更多任务,连规则和评分器一起重写。EnvHarness 不造新世界,只改旧世界的练法。它没那么开放,却能继续使用已经验证过的环境和评分器。
对手里已有可靠测试环境的团队,这比从头搭系统省事。
它的天花板也很明显。外壳只能利用原环境里已有的东西,很难凭空创造新任务。环境还必须能够恢复到初始状态,所以不适合直接操作真实邮箱、订单或物理机器人。
Agent 社会化训练开始展开
2026 年 8 月 13 日,Microsoft Research AI Frontiers 团队 发布论文《From Passive Delegates to Strategic Negotiators》,本周引发讨论。
过去我么曾聊过,模型压根儿没进行过合作性的训练,因此在合作中会出现各种问题。这次微软的就专门做了合作相关的后训练。
研究团队使用 Qwen3-4B-Instruct-2507,在资源分配、商品议价、求职合同和日程协调等六个环境中训练,希望让 Agent 从被动完成任务的助手,变成能够保护委托人利益的代理人。
作者所说的社会推理,指的并非让模型表达得更像人。它要求 Agent 在利益冲突中推断对方偏好、保护己方隐私,并预测自己的动作会引发什么反应。
六个环境都采用结果奖励。一轮互动结束后,模型才收到一个 0 到 1 的分数。是否达成协议并不直接决定奖励,协议为委托人保留了多少价值才是评分依据。
SocialRL 先为六个环境分别训练专家。Deal-or-No-Deal、CaSiNo、Job Interview 和 Calendar 直接使用 PPO。
Craigslist 与 Marketplace 先通过监督微调学会低价锚定、隐藏底价等动作,再用 PPO 按最终收益筛选策略。
研究团队随后测量六个专家之间的迁移关系,并据此安排多阶段强化学习的训练顺序。最终的统一 4B 模型取得 0.627 的六任务平均效用,略高于 GPT-4.1 的 0.625、GPT-5.1 的 0.619 和 GPT-5.2 的 0.613,但低于 GPT-5.5 的 0.708。
最后,他们还尝试了
训练改变了模型的具体行为。在 Craigslist 中,低于目标价开局的比例从 3% 提高到 78%,泄露自身目标价的消息从 52.7% 降至 1%。
Marketplace 基础模型有 62% 的开场会暴露最高预算,PPO 后这一行为几乎消失。Calendar 模型促成的会议减少了,但选中用户最高偏好时段的比例从 16% 提高到 38%。
虽然此前已经有 SOTOPIA-RL、谈判强化学习和多智能体社会推理研究。SocialRL 更准确的位置,是第一批把多环境训练、跨任务迁移、统一模型和显式心智推理放进同一套工程框架的工作。
这篇论文真正改写的是 Agent 的训练目标。通用助手接受的训练,鼓励礼貌、透明和促成共识。在普通问答中,这是优点;当模型替用户谈价格时,过度透明就会变成泄露底价,过度友善则会变成无原则让步。
SocialRL 的实验说明,许多所谓社会能力未必需要更大的模型,问题可能出在后训练目标。Qwen3-4B 原本已经理解谈判内容,只是不知道自己应该为谁争取利益。
换掉奖励后,它开始隐藏私人边界、拒绝不利方案,并把让步留给价值较低的条件。
风险也随之出现。Craigslist 模型为了压价,会编造环境中并不存在的市场参考信息。只奖励委托人收益,不约束真实性、公平和对方福利,模型很容易把欺骗也学成有效策略。
Agent 学会自我改进后,也会出现灾难性遗忘
8 月 19 日,南京大学与伍伦贡大学团队发布论文 ,提出 Harness Continual Learning(HCL)。
在 Agent 开始自动修改 prompt、记忆、skill 和工作流的当下,论文发现了一个容易被忽略的问题:模型权重即使完全冻结,仅仅更改Harness,Agent 仍然会遗忘过去学过的技能。
过去半年,RHI、Self-Harness 等工作已经证明,Harness可以根据反馈反复改写自己,让低推理预算的 Agent 在特定任务上越做越好。
但一次成功的修改,可能也是另一次退化的开始。为了处理新任务而改写路由规则,可能让旧任务选错工具。新的记忆总结可能覆盖过去有效的例外条件。一个看似更清晰的输出模板,也可能破坏原有工具调用格式。
模型没有变,系统行为却从成功退回失败。论文把它称为 harness-level forgetting,也就是 Harness 层的灾难性遗忘。
HCL 把 Task Interface、Experience Memory、Capability Map 和 Adaptive Router 视为同一份可变状态。每次任务结束后,Continual Optimizer 根据执行反馈生成候选 Harness,但不立即部署。
Continual Evaluator 会比较候选版本和当前版本,必须满足三个条件修改才会提交。这三个条件就是:1)新版本能否改善当前任务 2)是否让过去已经解决的历史样本重新失败 3)输出和工具调用是否合法。
第二个条件就是针对灾难性遗忘的。论文还设置了历史损失容忍度 B:B=0 时,候选版本不能破坏任何已经成功的历史 anchor;B 越大,系统越愿意牺牲旧行为换取当前适应。
这相当于给 Harness 自进化加了一套代码合并门禁。Optimizer 负责写补丁,历史样本组成回归测试,Evaluator 决定能否合并。
实验显示,这个约束不是多余的。在 ALFWorld 中,Static Harness 的最终平均成绩为 47.12,RAG 基线为 55.56,Stability-HCL 达到 61.74,Plasticity-HCL 达到 62.98。但后者的平均遗忘达到 10.94 个百分点,前者只有 2.64。
另一组文本推理实验中,随着 B 从 0 放宽到无限制,平均遗忘从 0.39 上升到 3.45 个百分点,最终成绩反而从 61.25 降到 60.13,表现最好的是允许损失一个 anchor 的 B=1。
从算法结构看,HCL 和 RHI 没有拉开很大距离,仍然是“生成修改、评估新旧、保留更优版本”的循环。真正的变化在评估对象。RHI 主要比较同一任务上前后两个 Harness 的输出,历史记录提供的是优化反馈;HCL 使用一套共享 Harness 连续处理不同任务,历史记录变成了必须重跑的回归用例。
这项工作的价值不在于发明了新的自优化算法,而在于把灾难性遗忘带进了 Harness 研究。过去人们担心微调新任务会覆盖模型权重里的旧知识,现在同样的问题出现在模型之外。
Prompt、记忆和 skill 都是可修改的文本,却也承担着参数一样的功能:保存系统已经学会的行为。
美国把 AI 研发、资本与数据流动纳入国家安全科技框架
美国白宫在 8 月 20 日公开的政府文件《国家安全科学与技术战略》中,把 AI 与自主系统列为军事和国家安全竞争的优先技术,并将其与半导体、未来计算、通信、网络安全、先进制造和核能放在同一技术组合中。文件用于落实 2025 年《国家安全战略》,并回应《芯片与科学法案》要求;它给联邦研发和科技活动提供方向,不是一项新禁令。
文件把“发展能力”和“保护能力”写进同一套配置。联邦政府需要确定研发重点、建设人才和基础设施、与私营部门及盟友合作,同时保护敏感数据、知识产权、关键资产和供应链。AI 的位置因此不再局限于单独的模型研发预算。算力、芯片、数据、人才流动、资本来源和技术扩散,都可能按同一项国家安全目标被审视。
战略把国家安全科技姿态概括为聚焦、韧性、敏捷和安全。聚焦决定哪些军事与国土安全任务优先拿到研发资源;韧性处理关键矿产、供应链和基础设施依赖;敏捷要求缩短研发、采购和部署周期;安全则防止敏感技术、数据和知识产权被窃取或转用。四项要求落到 AI 上时会互相拉扯:扩大私营部门合作能加快采用,却也增加数据、人员和供应链的保护范围。文件没有给出统一答案,而是要求各机构把这些取舍带入项目与预算。
这会改变企业读取美国科技政策的方式。过去,研发资助、国防采购、出口管制、投资审查和数据安全常由不同部门分别发布;新战略为这些工具提供了一套共同语言,但没有自动改变企业的法律义务。现在可以确认的是,AI 已被纳入跨部门的科技资源配置,而不是只有某一类高端芯片受到国家安全政策影响。
对企业最直接的含义,是同一项技术可能同时面对“加快采用”和“限制扩散”两种政府动作。能够进入联邦采购、国防任务或关键基础设施的模型与工具,会被要求更快证明性能和交付能力;涉及敏感数据、先进算力或外国合作的部分,则可能接受更严的来源、访问和转移审查。
ChatGPT向FBI报警之后,谁来决定一个人有多危险
2026年8月,美国佛罗里达州一宗跟踪威胁案,因为最初的报警者是OpenAI而引发争议。
前高盛分析师Darren Zhou在与ChatGPT谈论分手时,多次写下绑架、强奸和杀害前女友的具体计划。OpenAI发现这些内容后通知FBI,联邦调查人员随后把约两个月的聊天记录交给棕榈滩县警方。
这起案件并非只建立在对机器人说了狠话之上。警方找到女方后,她提供了现实中的短信和截图。Zhou被指在遭到拉黑后,继续使用不同号码联系她,发送带有性意味和威胁性的内容。女方此前没有报警,是因为仍有感情,也抱着不回应就能让骚扰停止的希望。
Zhou后来对严重跟踪、书面死亡威胁和利用通信设备实施重罪三项指控认罪。法院未作正式有罪裁定,判处八年社区监管,前两年佩戴电子脚环,同时禁止他接触受害人和持有武器。
OpenAI公开承认,公司会用分类器、推理模型和其他自动系统筛查潜在违规内容,被标记的对话可能交给人工复核。若对话显示对他人存在“迫近且可信”的现实伤害风险,公司会通知执法机关。
围绕此案,社交平台上出现了两类意见。支持者认为,潜在受害人尚未求助时,平台提供的线索促使警方上门核实,很可能阻止了伤害。质疑者担心是平台凭什么阅读私人对话、由谁判断危险,以及一次误报会不会把小说创作、研究材料或侵入性念头送进警方档案。
本案的确带有《少数派报告》的影子,但仍有一条重要分界。电影中的人因为预测将要犯罪而受罚。在本案中,聊天记录只是调查起点,警方后来取得了现实骚扰和威胁的证据。
还有人认为审核标准不公开,会是一个缺乏透明性的规则。但为了防止jailbreak,此类规则都不会公开,否则真正准备犯罪的人会据此规避。
按照OpenAI目前披露的制度,第一步不是工作人员实时“监听”,而是自动系统主动检测。公司称会使用分类器、推理模型、哈希匹配、黑名单等工具,分析用户内容和行为,寻找违反政策或指向现实伤害的信号。
判断也不一定局限于某句话。OpenAI表示,有些风险需要结合长对话、上下文,以及不同对话中逐渐形成的行为模式才能发现。这意味着,一个孤立的暴力词语不应自动触发报警;系统试图识别的是反复出现、逐步具体化的计划。
对话被标记后,才会进入人工环节。受训审核人员可以查看相关内容、上下文和一段时间内的行为模式。OpenAI称,这些人员只能在受控系统中访问用户信息,并受保密和数据保护要求约束。审核结果可能是排除风险、降低优先级、封禁账户,或者交给更高级别的团队调查。针对账户限制,用户可以申诉。
报警是更高一层。只有“有限的一小部分”案件会接受结构化风险评估。当OpenAI判断对他人存在“迫近且可信”的现实伤害风险时,才通知执法机关。精神健康和行为领域的专家会协助处理疑难案件。
但这个标准并不机械。OpenAI明确表示,用户即使没有在同一段对话中完整说出对象、手段和时间,也可能被认定达到报警门槛。
这给审核人员留下了根据语境判断的空间,也带来了外界最担心的问题:公司怎样区分真实计划、小说创作、研究材料、情绪宣泄和侵入性念头。
自残干预目前走的是另一条路径。OpenAI此前表示,出于隐私考虑,自伤对话不按同样方式转交警方,而是引导用户联系专业机构、亲友或紧急服务。
现在它还提供由用户预先指定“可信联系人”的机制;自动系统和人工审核都判断风险严重后,平台可以向该联系人发送有限通知。
