EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。
搜索
北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。
智谱创始人唐杰发文披露RSI最新进展,称由GLM-5.3驱动的Infra Agent在超过10万卡国产芯片集群上不到两周内完成GLM-5.3 Flash生产级推理服务搭建,将端到端吞吐提升至初始基线的3倍,表明RSI最小闭环已经形成但距离递归自我改进仍很遥远。
Kimi发布编程工具Kimi Code桌面版,原生适配macOS和Windows,内置Kimi K3模型并支持第三方API接入及Computer Use功能,提供99至699元三档订阅套餐,实测体验流畅。
就在十天前,一部AI短片,在整个AI圈炸了。AI超创DiDi_OK的《网站》,在2026年威尼斯Reply AI Film Festival上拿了双料大奖。76个国家、3100多部作品里杀出来,评委阵容里坐着奥斯卡得主和《狮子王》联合导演。
AI存储进入全流程竞争。
只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。
刚刚,Anthropic首次自曝绝密底牌:3万个AI正在研发下一代自己,正在疯狂自我进化。
智谱首席科学家唐杰发布 GLM-5.3-Flash 推理系统优化成果,模型仅用两周在超 10 万颗国产 AI 加速器集群上完成生产部署,端到端吞吐提升 3.2 倍,并由 GLM-5.3 驱动的 Infra Agent 参与瓶颈分析与代码修改,标志着智谱首个 RSI(递归自我改进)早期形态的落地。
用户在Code Arena的battle模式中发现疑似Gemini 4 Pro新检查点(内部代号argon)伪装为gemini-3.8-flash进行盲测,据爆料其支持256K最大输出和2M上下文窗口,原定9月发布的Gemini 4 Pro已因预训练问题推迟至10月。
Manus从Meta分拆独立后即将完成约33亿元人民币的首轮融资,估值较此前20亿美元翻倍至约268亿元人民币,融资完成后有望成为中国估值最高的通用AI智能体公司。