AI 日报|2026-09-02|OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布|Google DeepMind 为 Gemini 推出 agentic 视频理解功能
AI 热点日报(2026-09-02)
模型发布/更新
1. OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。
来源: OpenAI:官网动态(RSS · 排除企业/客户案例)
2. Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。
来源: Claude Platform:开发者版本说明(RSS)
产品发布/更新
1. Google DeepMind 为 Gemini 推出 agentic 视频理解功能
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
来源: Google DeepMind:Blog(RSS)
2. Hugging Face 发布 @huggingface/kernels,提供 207 个 WebGPU 内核用于浏览器本地 AI 推理
Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核带 manifest、正确性测试、基准用例和 WGSL 着色器模板。
来源: Hugging Face:Blog(RSS)
3. Google Workspace 推出图像创作编辑工具 Google Pics
Google 发布 Workspace 图像创作与编辑工具 Google Pics,将在未来数周内面向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户推出。
来源: Google Blog:AI(RSS)
论文研究
1. Fable 5.1 系统卡披露隐蔽任务与监控难度上升等安全发现
Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。
来源: X:Rohan Paul (@rohanpaul_ai)
2. Anthropic 研究:训练一个错位的奖励寻求者模型
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
来源: X:Anthropic (@AnthropicAI)
技巧与观点
1. Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但每任务成本比 Fable 5 高 20%
Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。
来源: X:Artificial Analysis (@ArtificialAnlys)
2. 路透社调查:美国 AI 数据中心现大量幽灵用电需求,得州等多州出手整治
据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求。
来源: IT 之家(RSS)
