竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500
竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
搜索
大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
MrFlow(Multi-Resolution Flow Matching)就用这样的三阶段,在Qwen-Image等模型上把端到端生成时间从49.32s压到4.77s,实际加速10.35x。文章发布当日即登上Hugging Face Daily Papers;发布三天内,GitHub已收获200+stars;目前也已登上Hugging Face Trending Papers。
据外媒TechCrunch 7月5日报道,截至今年6月底,美国已有83家获得风险投资支持的初创企业成功跻身独角兽阵营,其中与AI相关企业就有51家,半年累计融资金额超过520亿美元(约合人民币3532亿元)。
浪潮信息宣布,元脑SD200超节点AI服务器率先完成主流领先开源大模型Kimi K2.6、DeepSeek V4、GLM 5.2、MiniMax M3等的高性能优化,并在Kimi K2.6万亿参数大模型上实现Token生成时间快达4.77ms,为Agent场景应用的高效运行提供强大算力支撑。
2023 年大模型刚火的时候,浏览器被认为是 AI 时代最值得抢的入口,用AI颠覆Chrome是大家都能看到的百亿创业项目。实在是这个入口太大了。全球互联网用户已经是 60 亿量级,Chrome 一个产品就是三十亿级用户;Safari 靠 iPhone、iPad 和 Mac 占住十亿级设备入口,Edge 背后是 Windows 和微软账号体系。
Broadcom 周一表示,将在一项扩展协议中为 Apple 提供定制芯片,该协议将持续至 2031 年。两家公司已签署一项新的多年期协议,博通将开发定制 ASIC 芯片,即专用集成电路(application-specific integrated circuit)。
今天,据路透社报道,三位知情人士透露,DeepSeek正在自研AI推理芯片,以减少对英伟达以及华为芯片的依赖。知情人士称,DeepSeek自研芯片的工作大约在一年前启动,其研发仍处于早期阶段。目前,DeepSeek正在接触外部合作伙伴,并与芯片设计企业、晶圆代工厂以及存储企业展开讨论。
昨天,腾讯混元 Hy3 正式版上线,小程序更新了「成长计划」:小程序开发者的可以获得 10 亿的文本 Token,和 10 万张生图额度→ 10 亿 token 按官方 API 价折算,约 1000~4000 块
今天,Synthetic Sciences直接发布一款OpenScience的开源替代项目。团队表示,Open Science比 Claude Science 更好用,且完全开源。Open Science支持30个可用的数据库,超250个研究skills。这些数据和技能,让Open Science具备实验假设、消融实验、结果溯源、论文撰写等全套科研能力。
GitHub上有个项目叫 Project N.O.M.A.D,33k Star,3k Fork。作者 Chris Sherwood 是个搞网络设备的 YouTuber,Crosstalk Solutions 频道有 38 万多订阅。这项目说白了就是把维基百科、本地 AI、离线地图、离线教育平台全塞进 Docker 里,断网也能用。