AI 日报|2026-08-12|NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务|Runway Seedance 2.5 上线,支持 50 角色参考
AI 热点日报(2026-08-12)
模型发布/更新
1. NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
来源: NVIDIA Blog(RSS)
2. SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。
来源: LMSYS:Blog(Chatbot Arena 团队)
3. Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
来源: 公众号:蚂蚁百灵(Ling)
产品发布/更新
1. Runway Seedance 2.5 上线,支持 50 角色参考
完整阵容,完整曲目,一次生成一个。 Seedance 2.5 已在 Runway 上线,支持 50 个独特角色参考,以及最长 30 秒、与音乐同步的片段。点击下方链接即可开始使用。
来源: X:Runway (@runwayml)
2. Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移
Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驱动的 AI 辅助代码转换,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。
来源: Google Cloud:Databases(RSS)
3. ZCode 全面升级:Goal、Subagents、Remote Control 与闲时任务四大功能上线
ZCode 针对 GLM 深度优化,今日上线 Goal、Subagents、Remote Control 与闲时任务四大功能。在 Z.ai Code Bench 测试中,GLM-5.2 搭配 ZCode 较搭配 Claude Code 任务整体通过率高 2.39%;ZCode 缓存命中率超 98%,叠加 1.5 倍限时额度加成后,GLM Coding Plan 整体使用量接近常规额度的 1.8 倍。
来源: 公众号:智谱(GLM)
4. ChatGPT 桌面端支持导入其他智能体工作数据
你现在可以将其他智能体的工作内容与 ChatGPT Work 和 Codex 保持同步。 可导入项目、聊天记录、技能和插件,查看导入历史,并可在设置中选择开启自动更新。 现已在 ChatGPT 桌面应用中提供。
来源: X:OpenAI Developers (@OpenAIDevs)
5. Databricks 开源 Metals v2:面向数百万行代码库的 Java 和 Scala 语言服务器
Databricks 开源 Metals v2,这是其面向数百万行代码库的 Java 和 Scala 语言服务器。Metals v2 专为智能体驱动的开发场景设计,旨在提升大规模代码库中的编辑与导航性能。目前 Databricks 的大部分代码已由智能体编写,该工具服务于工程师仍需要手动介入的环节。
来源: Databricks:Blog(RSS)
行业动态
1. 研究人员发现可读取 ChatGPT 等模型加密推理过程的 API 漏洞
Alexander Panfilov 团队发现 OpenAI、Anthropic、Google 等主要 AI 提供商 API 存在漏洞,可读取推理模型的加密思考过程。扫描约 7000 条公开会话发现 62 个 API 密钥、33 个邮箱和 33 个密码。通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理;解码 10000 条推理轨迹的 API 成本约 720 美元。
来源: The Decoder:AI News(RSS)
2. 消息称 Anthropic 最快今年 9 月上市,向投资者淡化 AI 模型竞争等挑战
Anthropic 正与潜在投资者接触,为可能成为史上规模最大的 IPO 做准备,计划今年 9 月或 10 月初正式上市。公司估值高达 9,650 亿美元,年化收入已超 470 亿美元,并淡化来自中国 AI 企业的竞争影响。Anthropic 还计划拓展 AI 在医疗和生物学领域的应用,但尚未公布具体 IPO 定价方案。
来源: IT 之家(RSS)
3. Gemini 月活破 10 亿,成谷歌增长最快产品
每月已有超过 10 亿人使用 @Geminiapp 激发新想法、完成工作。这是我们有史以来增长最快的产品,也是第 14 个达到 10 亿用户里程碑的产品。 感谢 @JoshWoodward 和整个 Gemini 团队,也感谢每一位与我们同行的伙伴——未来还有更多精彩!
来源: X:Sundar Pichai (@sundarpichai)
4. 消息称英伟达开发万亿参数开源 AI 模型 Nemotron 4,目标挑战全球顶级
英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,规模最大的模型预计至少拥有 1 万亿个参数,旨在与全球最先进的开源模型竞争。英伟达尚未确定发布日期,最终训练也未完成,员工认为该模型最早可能在今年秋末准备就绪。此举意在通过开放模型生态扩大 AI 应用范围,并推动市场对其 GPU 算力的需求。
来源: IT 之家(RSS)
5. NVIDIA 为何需要新供电架构以扩展 AI 算力性能
NVIDIA 主张以 800 VDC 直流配电替代传统交流多次转换,以降低损耗、支撑 AI 算力扩展。NVIDIA 与 Google、Microsoft 通过 OCP 联合制定该架构,已发布白皮书及 LVDC 固态变压器规范 v0.3,超 80 家设备商正据此开发产品。
来源: NVIDIA Blog(RSS)
6. 英伟达循环融资达到新高度,黄仁勋是否过度出牌?
英伟达股价在相关消息公布后小幅下滑,收盘报 217.55 美元,盘前略有回升。金融记者 Holger Zschaepitz 和曾预测安然倒闭的 Jim Chanos 均对英伟达的循环融资做法表示担忧。此外,英伟达将发布真正开源(非仅开放权重)的 Nemotron 模型新版本,这可能最终削弱其合作伙伴 OpenAI 和 Anthropic 的地位。
来源: Gary Marcus:The Road to AI We Can Trust(RSS)
7. Electric 加入 Databricks,将 WASM Postgres 引入 AI 智能体沙箱
Databricks 宣布 Electric 团队加入,将 WASM Postgres 引入 AI 智能体沙箱。该技术让智能体在隔离环境中运行本地数据库,支持实时数据同步与离线操作,提升构建可靠、可验证智能体应用的效率。Electric 的加入将强化 Databricks 在智能体基础设施领域的布局。
来源: Databricks:Blog(RSS)
论文研究
1. Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11–16 倍的 LLM 推理加速
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
来源: Hacker News 热门(buzzing.cc 中文翻译)
2. 统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
来源: LMSYS:Blog(Chatbot Arena 团队)
3. AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
来源: Google Blog:AI(RSS)
技巧与观点
1. OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
来源: The Verge:AI(RSS)
2. 用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
来源: MarkTechPost(RSS)
3. 将 GitHub Copilot 置于中间人(MitM)代理之后后,我学到了什么
作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。
来源: Hacker News 热门(buzzing.cc 中文翻译)
4. 编写智能体时,哪种编程语言最合适?
针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
来源: Hacker News 热门(buzzing.cc 中文翻译)
5. 微信小微 AI 帮写与 AI 点评内测:朋友圈最后一点人味正在消失
微信基于小微推出朋友圈 AI 帮写与 AI 点评内测功能,前者可根据图片和已写文字生成 3 条朋友圈文案,后者可长按文字生成评价或快捷评论。作者认为这两个功能将 AI 置于社交核心位置,可能鼓励 AI 内容、破坏朋友圈自 2012 年确立的“记录美好生活”基调。公众号端小微还常驻首位,自动总结常看公众号文章,作者担忧这会反向影响创作者内容生产。
来源: 公众号:数字生命卡兹克
6. Ryan Greenblatt:人类级 AI 或于 2032 年前通过递归自我改进催生失控超级智能
Dwarkesh Patel 与 Redwood Research 首席科学家 Ryan Greenblatt 探讨递归自我改进(RSI)的可能性:一旦 AI 达到人类顶级专家水平,可能在一年内实现相当于 4-5 年的 AI 进展,Ryan 的中位预期是 2031 年自动化 AI 研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为 AI 联手接管世界等风险。
来源: Dwarkesh Patel:Podcast & Blog(RSS)
7. 每个类别都有赢家:AI 时代 SaaS 龙头的估值溢价
SaaS 估值整体承压,但每个细分赛道都跑出了 AI 龙头:CrowdStrike 以 34.4x 前瞻收入领跑安全(中位数 3.9x),Cloudflare 32.6x 对 17.5x,Shopify 11.3x 对 1.4x。
来源: Tomer Tunguz 博客(VC 分析)
8. Can you trust what AI tells you?
来源: