AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

清华团队再探 On-Policy Distillation:数据撑死,算法饿死

把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么?

来自主题: AI技术研报
10088 点击    2026-09-16 10:06
ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

真实家庭任务往往从「不完整的信息」开始:机器人不知道目标在哪里,用户也未必能一次说清自己想要什么。面对「帮我从餐桌上拿点零食」这样的模糊指令,机器人不仅要主动寻找候选物体,还要在发现面包和多个甜甜圈后进一步询问用户,确认究竟该拿哪一个。

来自主题: AI技术研报
6420 点击    2026-09-15 13:36
3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

3B模型成功率94.5%!Token级奖励打开长链路智能体训练新思路

多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。

来自主题: AI技术研报
8558 点击    2026-09-15 13:35
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI)。

来自主题: AI技术研报
10276 点击    2026-09-14 15:30
告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

大语言模型智能体正越来越多地进入长期陪伴聊天这类场景 —— 不再答完一个问题就走,而是和用户处成一段长久的关系。

来自主题: AI技术研报
8303 点击    2026-09-14 15:04
视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。

来自主题: AI技术研报
6825 点击    2026-09-14 15:03
vLLM-Omni 上的 MiniMax H3:从系统级优化到基于 FastVideo FastH3 的实时服务

vLLM-Omni 上的 MiniMax H3:从系统级优化到基于 FastVideo FastH3 的实时服务

vLLM-Omni 上的 MiniMax H3:从系统级优化到基于 FastVideo FastH3 的实时服务

MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。

来自主题: AI技术研报
7133 点击    2026-09-14 09:47