ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级
ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。
搜索
过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。
2026年7月16日,东京。 英伟达CEO黄仁勋拍了一个大大的马屁:"日本发明了现代制造业。现在,它正在建设将驱动下一次工业革命的AI工厂。"不过效果很明显,日本被彻底忽悠瘸了,在同一天,市场估算投资额接近3.4万亿日元的项目落地(约1408亿元人民币)。
今日,OpenAI宣布下调GPT-5.6系列模型API价格。其中,GPT-5.6 Luna价格下调80%,GPT-5.6 Terra价格下调20%,GPT-5.6 Sol则新增Fast模式,在保持模型能力不变的情况下,最高可实现2.5倍推理速度。
2026 年 4 月起,一位专营稀有书和低流通量图书的美国书商遇到了怪事:他店里的生意向来不算火爆,一周卖出二十本已经算不错,但最近,订单突然像洪水一样涌来,每周能卖几百本。最费解的是,买家只列出一份用国际标准书号(ISBN)索引的书籍清单,却从不询问品相,也不砍价。
ChatGPT 语音功能上线有段时间了,不知道大家的使用体验如何。
7月几天之内,中国大模型行业接连出现了两个超过2万亿参数的模型。
模型越来越多,入口却不一定越来越好用。
三智一体不断演进,开启具身智能新未来。
就是上个月我开源的让Claude Code和Codex搭配使用的Skill搭子的1.4版,当时的定位是把Claude Code出计划然后直接在当前对话调用Codex,不需要复制黏贴,由Fable5自己写交接文档自己从CodeX那读取输出。
据英国《金融时报》7 月 29 日报道,谷歌 DeepMind 已经重组了曾打造诺贝尔奖级成果 AlphaFold 的核心团队:不再保留独立的 AlphaFold 团队,而是将相关研究人员分流至多个战略项目。这一调整被视为 DeepMind 将重心进一步转向 Gemini 大模型和 AI Agent 的重要信号。