AI 日报|2026-09-03|Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型|Claude 在 Cowork 和 Claude Code 中支持后台操作电脑

1 条回复
12 次浏览

AI 热点日报(2026-09-03)

模型发布/更新

1. Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
来源: Google DeepMind:Blog(RSS)

2. Meta 发布 Muse Spark 1.3,智能体与科学推理能力提升

Meta 发布 Muse Spark 1.3,是五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
来源: X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)

3. Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿

通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。
来源: X:通义千问 / Qwen (@Alibaba_Qwen)

产品发布/更新

1. Claude 在 Cowork 和 Claude Code 中支持后台操作电脑

Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
来源: X:Claude (@claudeai)

2. Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
来源: Cursor Blog

3. 美团 LongCat-2.0 上线 Cline 免费试用

来源: X:美团 LongCat (@Meituan_LongCat)

4. UU 远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

UU 远程于 9 月 2 日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
来源: 公众号:数字生命卡兹克

行业动态

1. Nvidia 接近以 129 亿美元收购 Hugging Face

Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议,时间与细节仍可能变动。该价格约为 Hugging Face 2023 年融资轮 45 亿美元估值的 2.9 倍,按年化收入约 1.5 亿美元计算相当于 86 倍,Nvidia 还谈及在交易中加入 10 亿美元的员工留任方案。
来源: X:Rohan Paul (@rohanpaul_ai)

2. OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼,被指协助教唆

OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。
来源: The Verge:AI(RSS)

技巧与观点

1. 美国司法部就 OpenAI 版权诉讼提交意见书支持训练属于合理使用

美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称模型训练具有非凡转换性,并以国家安全为由警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书属建议性质、不约束法院,仍将数据获取方式与具体输出是否复制受保护段落作为独立问题留给法院逐案判断。
来源: X:Rohan Paul (@rohanpaul_ai)

2. 什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
来源: Google AI:DEV 作者专属(RSS)

3. Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
来源: Google AI:DEV 作者专属(RSS)

4. Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。
来源: Claude:Blog(网页)

5. GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
来源: GitHub Blog

6. Google 总结 AI Agents Challenge 中最强提交背后的 4 个工程模式

Google 复盘 AI Agents Challenge 赛事,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。
来源: Google Developers Blog(RSS)

发表一个评论

R保持