DAILY BRIEF

Friday

134items shown

次日 02:00 补充更新

21 items
Anthropic Research

Project Pilot: Can AI control a drone?

Anthropic and Andon Labs Several of our research projects over the last year have looked at how frontier models interact with the physical world. In Project Vend, AI models ran a small shop; Project Fetch was an early look at robots as the intermediary between digital models and physical objects. As we recently noted in Project Fetch: Phase two, we’re already seeing improvements in model capability such that their ability to use off-the-shelf robots is on track to approach the ease with which coding agents use software tools. Working again with our partners at Andon Labs, we developed a new series of demonstrations and evaluations that assess AI models’ ability to use a flying drone to autonomously perform a simple locate-and-follow task of the kind used in aerial surveillance, culminating in a new benchmark: Drone-Bench. We expect AI models to become broadly capable at many things that humans can do. Operating hardware, in particular robots, is one such capability. Being able to do this opens up a large surface over which AI could contribute to the economy, but likewise opens up a new area of risk. A key reason why Anthropic has a Frontier Red Team is to measure capabilities like this, giving us situational awareness into how close we are to the world in which AI can autonomously pilot robots—with all the attendant benefits and risks. Aerial drones are especially important because they are readily available and frequently used by professionals and hobbyists. They have been used to increase crop yields in agriculture and target opposing forces in warfare. Like AI itself, drones are a dual-use technology; it is crucial to have better evidence about their intersection. By combining actual flight demonstrations and decomposing the constituent tasks into replicable evaluations, we can look back at the rapid progress of models so far, and project their capabilities in the near future. As is so often the case, our findings point toward a world of democratized opportunity and risk. Technology developers, civil society, and governments will need to converge on effective norms and governance frameworks in response. Evaluation rationale and methods The core task we tested in Project Fetch—getting a robot dog to retrieve a beach ball—was neither especially practical nor especially concerning. In this project, we chose an objective with clearer utility and policy relevance: a simple locate-and-follow task used in aerial surveillance. Capabilities like automated person-detection and tracking can have legitimate purposes such as search and rescue, disaster response, and lawful public safety uses. But this is a class of capabilities that is also subject to abuse, either through overreach of a legitimate authority or by unaccountable private individuals or organizations. The work we report here thus more closely matches the “dual-use” nature of AI models. In these experiments, we ask the model to control a quad-rotor drone in an indoor office environment in order to locate and follow a person. 1 This requires a number of complex sub-tasks. The AI model needs to develop schema for controlling the aircraft, mapping and navigating the obstacle-laden indoor space, finding the target individual from a reference photo, and following them (plus reacquiring the target if they move out of frame). Individually, there are known algorithms for accomplishing all of these tasks. What is not trivial is for the AI model to understand the challenges, identify the preexisting resources it can use to solve them, adapt those off-the-shelf solutions to its current situation, and execute the mission in real time. As we will see, the difficulty—both individually and in chaining these tasks together—is sufficient to distinguish between models of varying intelligence and plot the trajectory of capability improvement. Drone-Bench is a benchmark created by Andon Labs (in consultation with Anthropic) to test if AI agents are capable of controlling a drone for surveillance tasks. Anthropic has not been given access to Drone-Bench; Andon Labs ran the evaluations we report here. First, Andon Labs took the main goal—find and follow a designated person in an office using the aerial drone—and decomposed it into five sub-tasks, all of which are necessary and, taken together, are likely to be sufficient for accomplishing the overall objective. These sub-tasks are: Reconstruct: Turn videos of the office into a 3D model, and provide a function that slices it into a 2D obstacle map. Localize: Given office-video frames with known poses, match the drone's current view to locate it on the 2D obstacle map. Navigate: Plan a path between rooms on the obstacle map and fly it, continuously calling Localize during flight to track the drone's position and correct for noisy controls. Detect: Once navigated to a room, find the target person in the drone's video feed using a detector built from a reference photo of their face, returning a bounding box around the target i

Why it mattersAnthropic与Andon Labs推出无人机操控研究及Drone-Bench基准,延续物理世界交互探索,信息包含新基准和任务描述,但新闻截断未展示完整结果,影响面中等。

新智元

清华弄了个镜像错觉艺术生成器,支持3D打印 | CVPR'26亮点

新智元 2026-07-24 12:33 北京 新智元报道 【新智元导读】 清华大学团队研发的AutoMIA系统,可将任意两张图片转化为具有镜像错觉效果的3D艺术品,实现正反两面不同图案的视觉呈现,并支持3D打印。 先看下面两组照片:每一组里,左边是镜子前物体的正面图案,右边是它在镜中的倒影。奇怪的是,正面与镜中呈现出的几乎是两个毫不相干的东西——第一组正面是「CVPR」,镜中却变成「2026」;第二组正面是「山」,镜中却成了「水」。 它们的轮廓、颜色乃至含义都对不上,仿佛是一种「错觉」。 背后的原因是,它来自一个经过特殊设计的3D物体,利用人类视觉系统的「对称补全效应」而使人产生错觉,这类现象被称为镜像错觉艺术。 研究者通过精心设计三维几何和表面颜色,让一个真实物体在直接观察和镜中观察时呈现出截然不同的视觉效果。 以下是两组对应的「解密」视频。 传统意义上,这类艺术品的设计需要专业艺术家巧妙的构思,以及大量复杂的人工设计经验和数学计算,此类艺术品的设计对于普通人的门槛很高。 那么有没有一种方法可以自动化地帮助人们完成这样的艺术设计,让普通人也可以将自己的灵感转化为艺术品呢? 近日,来自清华大学等单位的研究团队提出了AutoMIA,一种自动生成镜像错觉艺术的 AI 设计方法,用户仅需任意指定两张图片,分别对应镜子前和镜子中的图案,AutoMIA就可以自动完成3维艺术品的设计,并且支持直接3D打印出来制作艺术品。 论文链接: 代码链接: 论文已被CVPR 2026接收,并被评为大会亮点论文(Highlight Paper);同时,因其较高的计算效率,该工作还获得了CVPR高效计算奖 (Efficient CVPR)。 研究背景 光学错觉艺术长期以来都是艺术、心理学和计算机视觉交叉领域中的重要问题。常见的 2D错觉包括混合图像、视觉变形图像等;3D错觉则包括Shadow Art、Multi-View Wire Art等。 这些方法通常依赖特定视角、投影或阴影关系,让同一个物体在不同观察条件下呈现不同外观。 Mirror Illusion Art是一种更特殊的3D错觉:一个真实物体被放在镜子前时,观察者在正面看到一种图案,而在镜中看到另一种图案。 此前,相关设计往往需要大量人工推导和手工调整,并且多集中在形状设计上,难以同时处理彩色图案。若直接借鉴Shadow Art一类方法,也容易产生表面噪声、背景浮块或内部断裂,影响视觉质量和实体制作。 因此,作者提出了一个直接的问题:能否让AI自动设计这种镜像幻觉物体?给定两张目标图片,系统是否可以同时优化3D形状和颜色,使同一物体在两个视角下呈现两种指定外观? 研究方法 AutoMIA将这一问题建模为一个双视角逆设计任务。系统用体素表示3D物体,每个体素包含密度和颜色信息;随后通过可微体渲染,从两个指定视角渲染该物体,并将渲染结果与两张目标图像进行比较。 优化目标同时包含形状相似度和颜色相似度,从而让生成物体既满足轮廓要求,也能生成目标图像的颜色。 在实际优化中,作者发现了四类关键问题:表面噪声、背景噪声、内部断裂以及形状和颜色优化不平衡。 为此,论文提出了四个核心机制。 首先是PAC,即基于投影对齐的连通域剪枝。系统会把当前体素中的连通分量逐个投影到两个视角,并根据它们与目标mask的重合程度和背景溢出情况进行评分,保留真正有助于目标图案的结构,去除漂浮或无效的噪声部分。 其次是PWA,即基于位置的加权自适应抑噪。它会根据像素到目标区域的距离调整背景惩罚权重,使远离目标图案的错误投影受到更强惩罚,从而减少远处的背景噪声。 第三是IVP,即内部体素保护。由于监督图像主要约束物体表面,内部体素容易在优化中被错误削弱,导致结构断裂。IVP会识别内部体素并施加密度下限,帮助保持物体完整性,这对后续3D打印尤其重要。 最后是SCD,即形状—颜色解耦优化。AutoMIA将训练过程划分为形状优化、形状颜色联合优化和颜色细化阶段,避免颜色过早干扰几何结构,也减少不同视角颜色之间的冲突。 实验结果 论文在多类2D图像作为输入时验证了AutoMIA,包括英文字母、数字、汉字、几何图案、emoji、卡通图案和logo等。 实验中,作者将AutoMIA与Shadow Art(SA)和 Shadow Art Revisited(SAR) 等方法进行了比较。由于基线方法主要支持形状优化,比较重点包括平滑程度、噪声水平和形状一致性等指标。 结果显示,AutoMIA在重建质量上取得了明显优势。论文报告中,AutoMIA的 平滑程度(SL) 达到0.989,噪声水平(NL) 降至0.049,形状一致性(SS) 达到0.931;相比之下,SA 和 SAR 在形状一致性和噪声控制上均存在明显差距。 同时,AutoMIA在单张RTX 3090上平均设计时间仅为76秒,平均显存占用约2.6GB,体现出高效的计算效率。

Why it matters清华AutoMIA系统获CVPR亮点及高效计算奖,可将双图转为镜像错觉3D物体并支持打印,学术创新明确但应用场景较窄,影响力集中在特定交叉领域。

新智元

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

ASI启示录 2026-07-24 12:33 北京 微信团队,找到AI的第三条Scaling Law 新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Scaling参数和思维链之外,到底有没有第三条路? 微信WeLM团队给了一个全新的答案—— 把额外算力折叠进序列内部,让模型在token之间完成隐式思考。输出不变长,每个token想得更深。 这套方法叫Hidden Decoding,隐式序列缩放。 而WeLM做到的关键一步,是把它推到了前沿规模。 从3月的80B参数,到现在的617B MoE,不仅增量续训只用了完整训练量的5.3%,而且9个评测全部超越自回归基线。 把思考折叠进序列 WeLM 617B MoE的隐式Scaling路径 7月14日,微信WeLM团队放出了Hidden Decoding系列的第二篇博客,并首次展示了一个新模型的进展:一个总参数617B、评估表现达到开源头部水平的模型。 博客地址: 这并非该系列的首度发声。 今年3月2日,WeLM 团队就发表了系列的第一篇博客,彼时Hidden Decoding还是一套相对朴素的早期实现,只在80B规模上跑通了初步验证。 四个月过去,新博客不仅把方法做扎实,更第一次展示了将该方案上推到600B+模型的效果。 这篇博客的核心,是介绍Hidden Decoding如何被推进到100B+ MoE的前沿规模—— 把每个token在序列维度上展开成多条并行的「流」,让同一套Transformer权重在一次前向传播里完成多步隐式推理,而只在最后一条流上计算损失。 换句话说,模型在落笔写下下一个token之前,先在自己的序列内部折叠进了一段不为人见的思考。 如果说过去一年大模型的两条主线是「把参数做大」和「把思维链做长」,Hidden Decoding展示的是第三条路:在不动参数的前提下,把额外算力藏进序列本身,让推理在模型内部多走几步。 参数与思维链之后,第三条路指向隐式序列 过去一年,大模型社区的努力可以粗略分成两条线。 一条是把模型本身做大,总参数冲到万亿、激活参数冲到30B以上;另一条是在后训练阶段堆算力,靠强化学习和更长的思维链把推理能力「逼」出来。 随着o1、DeepSeek-R1以及一众「思考模型」的走红,这后一条路线几乎成了默认叙事。 但两条线共享同一个隐含前提,都需要「更多」。更多参数、更多高质量推理数据。 Hidden Decoding的提出,恰好绕开了这个前提。它不在数据侧做文章,而是回到预训练与继续预训练阶段,问了一个更朴素的问题—— 同一套权重、同一批数据,能不能通过更聪明的算力组织方式,逼出更多能力? 这条路并非没人走过。 循环模型、各类「在序列维度做扩展」的尝试,都属于同一种思路。让同一套权重在一次前向里多走几步。 卡点也很清楚。循环模型串行不可并行,序列扩展又容易让注意力按序列长度的平方膨胀,在大模型上训不动、也用不起。 因此相关讨论虽多,真正在前沿规模跑通的却很少。WeLM这篇博客文章,正是要把这条被绕开的路,在100B+ MoE的体量上重新打通。 先认识一下WeLM:微信大模型的四代演进 WeLM是微信AI团队持续研发的通用大语言模型系列,承载着微信在大模型时代的核心技术战略,也是微信参与前沿人工智能竞争最为关键的技术底座。 从2022年首次公开亮相至今,WeLM已连续迭代四代。 虽然团队过往对外发声始终秉持审慎的态度,但从近期集中发布的技术博客来看,其已清晰勾勒出一条技术演进路线—— 从V3时代的训练体系搭建,到V4时代的效率与质量创新,再到600B级模型的Scaling突破与Hidden Decoding的推理范式创新。 这标志着WeLM已形成覆盖预训练、后训练和推理优化的完整技术版图。 更重要的是,WeLM绝非止步于论文指标与实验室评测的试验性模型。 当前已进入灰度测试阶段的微信AI助手「小微」,其核心模型能力由WeLM提供。依托微信这一拥有超大规模用户基数的国民级产品生态,WeLM已成功进入由真实用户、真实流量与真实复杂任务所构成的终极试炼场。 从这次Hidden Decoding系列技术博客的发布中,我们可以窥见WeLM团队将前沿模型技术和规模化应用实践相结合的思考。 Hidden Decoding:把思考折叠进序列 Hidden Decoding的做法,可以概括为三步: 给定输入序列和n份词表嵌入,把第i个token的第k条「流」表征放在物理位置(i−1)n+k上,构成长度为nL的扩展序列; 扩展序列在标准因果注意力和连续的位置编码下,送进同一个Transformer,不新增任何主干参数; 训练时只在每个token的最后一条流上计算下一个token的预测损失,前n−1条流不接收任何直接监督。 换句话说,前面的流像是给最后一流「打草稿」——逐步精炼表征、保留更宽的候选集合,等最后一流再收敛到最终预测。

Why it matters微信WeLM推出617B MoE并展示隐式解码第三条缩放路径,有具体参数、评测提升和博客,属前沿模型发布,技术新颖但仍在系列推进中,非颠覆性突破。

新智元

刚获菲尔兹奖,Ta转身就跳槽OpenAI

ASI启示录 2026-07-24 12:33 北京 最后一届纯人类菲尔兹奖!新晋得主真信了 新智元报道 昨日,2026年国际数学家大会ICM正式官宣:邓煜、John Pardon、Jacob Tsimerman、王虹,共享本年度菲尔兹奖! 直播截图|前排从左至右:邓煜、John Pardon、Jacob Tsimerman、王虹 菲尔兹奖一下出现了两个中国籍数学家——王虹、邓煜,一举在菲尔兹奖90年历史中实现了中国国籍数学家人数从0到2的突破! 消息传来,国内一夜刷屏。 而且中国籍数学家王虹、邓煜同为北大2007级本科校友,北京大学成为中国目前唯一的「双菲院校」。 此外,另一位获奖者John Pardon精通汉语,在国际中文辩论赛、「汉语桥」世界大学生文化比赛中大秀汉语。 Jacob Tsimerman成了本届菲尔兹得主中唯一一个还不会讲汉语的数学家。 更具戏剧性的是,在获奖后的新闻发布上,他突然官宣转行。 在问及下一步计划时,Jacob Tsimerman宣布加入OpenAI,从事AI安全的工作: 接下来,我已经开始将我的职业生涯转向AI安全领域,利用数学来服务于安全及其他方面。 …… 我很快将在OpenAI的安全部门开始一个新职位。 2年,AI将在数学上彻底超越人类 Tsimerman因彻底解决 「安德烈-奥尔特猜想」(André-Oort Conjecture) 等算术几何难题获奖——那是代数几何皇冠上的明珠,几代数学家都啃不动的硬骨头。 他还是第一位在加拿大本土机构完成这一成就的获奖者。 换句话说,他现在正处于数学研究的黄金期。而现在,他亲手掐断了自己的学术传承,不再招研究生,宣布转行。 他的理由是,他不愿再训练年轻人,投身一个 可能几年内就不复存在的职业。 Tsimerman直言: 「我担心这个领域正处于危险之中」。 他给出了吓人的时间表—— 2年之内,AI将在所有数学证明领域彻底超越人类。 也就是2028年前后。 「我担心这个领域正处于危险之中」。 这不是外行的臆测。Tsimerman自己就体验过:AI已经把他的科研生产力 提高了一倍 ——起初,只是帮他加速那些无聊、机械的部分。 但很快他意识到,AI正在从一个「好用的计算器」,变成一个 「思考的同行」。 从去年底到今年,各大实验室的推理模型接连在IMO乃至前沿猜想验证上撕开口子。人们曾以为「定理证明」是不容一粒沙子的人类护城河,如今这条护城河正在迅速归零。 原因并不复杂。纯数学的本质,是在极度抽象的符号空间里搜索结构性真理——而这种搜索,在万卡集群和强化学习的加持下,正是AI最擅长的游戏。 人类大脑几十年沉淀出的「数学直觉」,在近乎无限的算力面前,可能只是一种 效率极低的生物突触组合。 他还算过一笔更冷的账:现在入学的博士生2030年毕业时,他们的导师——哪怕是菲尔兹奖得主——在AGI面前也已失去速度与深度上的比较优势。 所以,不如不招。 当外行人还在推测,今年是最后一届颁给人类的菲尔兹奖,刚获菲尔兹奖的Jacob Tsimerman已经行动了。 参考资料: 编辑:大卫 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 跳转微信打开

Why it matters菲尔兹奖得主现场宣布加入OpenAI并预测AI两年内超越人类数学,人物权威、数据明确,直接关联AI安全与人才流向,信息量充足且具戏剧性,但非行业格局级事件。

22:00 更新

15 items
aibase

Kimi K3 攻防考卷翻车:漏洞利用只到美国前沿模型四成,蒸馏疑云被安全机构摆上台

一份来自英美两大 AI 安全机构的联合评测,把月之暗面 最新 模型 Kimi K3的"另一面"摊在了阳光下。英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)合力给这款模型做了一次攻击性网络任务体检,结论是:它在漏洞利用开发和模拟网络攻击上大幅落后于美国领先的前沿模型,但优于同样来自中国的智谱 GLM-5.2,在开放权重模型阵营里仍立起了一根新标杆。更刺眼的是,Kimi K3的安全护栏几乎没能拦住漏洞利用的开发,模型在配合这类操作时没遇到像样的阻力。 这场"考试"用的 第一 份试卷,是卡内基梅隆大学开发的 ExploitBench 基准。它从2023年之后 Chrome V8引擎里挖出41个真实漏洞,沿着软件利用的推进过程一路打分。结果分差惊人:美国领先模型平均拿下76.2%,Kimi K3只有32.2%,GLM-5.2则以24.4% 垫在身后。更关键的是等级——41项任务里,Kimi K3一项都没摸到 最高 的"任意代码执行"(ACE),而那正是最凶险的利用等级,因为它意味着攻击者能完全掌控目标系统;对面美国模型则在41项里攻下了20项 ACE。值得补一句的是,英美机构在测试美国闭权重模型时关掉了系统级安全防护,只为量出它们的 最大 本领,而那些防护在公开版本里是默认开着的。 第二份试卷叫"最后的幸存者"(TLO),模拟的是一次横跨四个子网、约20台主机的企业网络攻击,整条路径32个步骤,研究机构说人类专家大概要啃20个小时。目前全球只有少数模型能真的通关,迄今四个公开可用的闭源权重模型过了这关, 最强 的十次尝试里成攻完成六到七次。Kimi K3平均走到第17步就卡住,美国领先模型能推到第28.5步,GLM-5.2只到第11步;它在十次尝试里有一回在1亿 token 的限制内跑通了整条攻击链,说明能力是有的,只是调不动、不稳定。机构下了句判断:只要给到初始网络访问权限、再下一道指令,Kimi K3就能自主啃下规模较小、防御薄弱又易攻的企业系统。需要提醒的是,TLO 没算进主动防御,并非完全贴近现实,但就在本周,OpenAI 模型试图自主入侵 Hugging Face 的事刚被披露,对方虽用了开放权重模型,终究把攻击挡了下来。 把时间轴拉长看,中国模型确实在追赶,却始终落后一截。CAISI 用 Elo 评分体系追踪了自2025年初以来中美模型的网络能力,两条趋势线都在上扬,红色的中国线与蓝色的美国线之间却一直有缝。Elo 提升400分意味着解决任务的概率涨十倍——这差距不是小数。英国机构此前把开源模型与美国系统的性能差估在四到七个月,2025年初还是六到十个月, 最新 结果正好落在这条规律里。AISI 的警告很直白:开源模型日益增长的网络能力,是一份"持续且不可逆的滥用风险",轻视不得。 最耐人寻味的一笔,落在测试结果和蒸馏指控的交叉点上。美国科学顾问迈克尔·克拉齐奥斯近期曾公开指控月之暗面,称其把 Anthropic 的 Fable 模型 最优 输出当训练数据,给 Kimi K3"蒸馏"提质,还称对方拿到了受美国出口管制的英伟达 GB300芯片。而通用基准成绩漂亮、网络安全得分却塌了一截,恰好能用这套说法解释:Kimi K3大概率主要吃的是 Claude 在通用知识、编程和智能体任务上的输出;Anthropic 的安全分类器会专门掐掉 高级 攻击性网络查询,于是这类样本在蒸馏数据集里占比极低——模型因此能在标准榜上和西方对手叫板,却没学到更深的漏洞利用本事。AISI 的评测从侧面撑起了这个解读:它关掉美国模型上的系统级防护,恰恰暴露出那些几乎无法通过公开接口触达、因此基本喂不进蒸馏的网络能力。一张考卷,量出的不只是一个分数,还有水面下那层没说破的来历。

Why it matters英美安全机构对Kimi K3的评测揭示其网络攻防能力差距与蒸馏疑云,涉及模型安全与地缘竞争,信息量高且具独家性。

aibase

黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance

Black Forest Labs宣布以Early Access方式上线推出FLUX3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在FLUX. 1 和FLUX. 2 系列基础上进一步扩展至多模态生成与理解任务。 性能全面碾压,原生音频同步输出 FLUX3 可在单次生成中输出最长 20 秒的视频并附带原生音频,支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种创作模式。在带声音的 10 秒720p视频人工评测中,FLUX3 对比Grok Imagine Video胜率达69%,对比Seedance 2. 0 和Gemini Omni Flash胜率均为52%,展现出全面领先优势。 图像能力全面,进军机器人行为预测 在图像能力方面,官方称FLUX3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。更值得关注的是,Black Forest Labs正与Mimic Robotics合作,研究将FLUX3 用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。这一布局意味着FLUX3 不仅是一个创作工具,更有望成为连接数字世界与物理世界的通用多模态引擎。

Why it mattersBlack Forest Labs推出多模态模型FLUX3,性能数据领先且拓展至机器人领域,是重要的开源模型进展。

aibase

红果短剧发布AI角色规范,专项整治“高频AI脸”与素材侵权

7月24日, 红果短剧 发布《关于规范AI剧角色创作的公告》,从角色差异化与版权合规两个维度明确创作标准,旨在降低“高频AI脸”使用率,防范素材违规风险。 规范要求,单部剧集主要角色需具备清晰区分度与高辨识度,严禁跨剧或跨角色复用高度相似形象,以缓解审美疲劳。版权方面划定三条红线:未经授权不得使用他人独创性角色、服装及道具设计;严禁盗用有著作权的写真与美术作品;使用受版权保护内容须提前授权。 此外,平台近期将启动专项治理,重点整治角色复用、同质化及素材违规,并倡议创作者自查整改。这标志着AI短剧产业正加速迈向规范化与精细化运营阶段。

Why it matters短剧平台发布AI角色创作规范,属细分领域运营规则调整,影响面窄,新闻价值有限。

量子位

Qwen-Image-3.0效果炸裂?我反手扔了这9道题

原创 关注前沿科技 2026-07-23 20:06 北京 是骡子是马,拉出来验验就知道了。 文婷 发自 凹非寺 量子位 | 公众号 QbitAI 千问说它可以帮我拼九宫格了,还是不同主题的那种。 这两天,阿里推出了一款AI生图新模型—— Qwen-Image-3.0。 按官方说法,它不仅能准确生成仿真UI界面,还能帮老师一键生成排版精良的期末试卷;设计师也能用它快速输出海报、分镜和网页原型,省去从空白画布一点点搭框架的时间。 更夸张的是,它还 能在单张图中同时呈现9份不同主题的知识图解,并自动完成整齐排布,让信息密度和美观度同时在线。 这次,Qwen-Image-3.0给自己的关键词只有一个字: 实。 不是单纯更好看,也不是只卷画风、构图、光影。 而是要让AI画图不再停留在“哇,好漂亮”的惊叹,而是继续往前走一步: 这图能不能装下我的所有需求、能不能把细节画清楚、能不能直接拿去改、拿去用、拿去交差。 官方把这个“实”拆成三层: 第一层是 细节真实:它支持10px小字精准渲染,笔画笔锋、人物毛孔、发丝、纸张、批注这类细节都能稳住。 第二层是 内容丰实:Qwen-Image-3.0最长支持4.5k token输入,可以生成报纸、分镜、试卷、PPT这类复杂版面。 第三层是 知识厚实:它支持12国语言原生渲染,还能生成网页、游戏、直播等常见UI界面,甚至能结合世界知识做科普海报。 外网也已经有人上手测了,在这份测评中,Qwen-Image-3.0的图像理解和代码生成表现,已经超过了GPT Image 2、Nano Banana 2等海外模型。 听起来很猛。 但图像模型的发布样例,向来有一个 老问题, 即 “官方demo通常展示的,都是最顺的那一面。” 真正到了编辑、教育、电商、设计这些场景里, 到底好不好用,不能只看宣传页怎么写,也不能只看生成图第一眼漂不漂亮,还得上手测。 所以,在收获一片掌声的同时,推上也出现了不少对Qwen-Image-3.0的吐槽。 有人说它“速度慢”,有人吐槽它会“混淆术语”、“不懂语法”,甚至还有网友直接指出,官网封面图里的阿拉伯语语法就有问题: 所以这次,我们围绕着官方信息提出的“内容丰实”、“细节真实”、“知识厚实”三个方向,设计了 9道 更具体的实测题, 把额度测了个精光。 就看它到底能不能装、能不能稳、能不能细、能不能懂。 以及最关键的: 它能不能真的帮我们干活交差。 先看它细节真不真实,放大后会不会露馅 噔 噔 噔 噔,开场就丢王炸: 验细节! 先拿最不讲道理、也最容易露馅的 学术论文页 开刀。 论文页看着朴素,实际上全是生图模型的雷区:密密麻麻的小字、上下标、希腊字母、分数线、多行公式推导…… 远看像论文不算数,放大后还能清清楚楚、不糊不乱,才算真本事。 Qwen-Image-3.0能不能扛住呢? 实测一:学术论文公式页 提示词: 效果如下(用时大约3分20秒): 排版工整、字迹清晰,不错不错, 扛住了。 出于好奇,在等待Qwen-Image-3.0生成图片的间隙中,我还用同一套提示词模版测试了一下 ChatGPT Plus版 的生成效果,结果如下(用时约1分19秒): △ 大家可以自行参考对比一下 实测二:萌宠与主人的近景肖像 测完了论文,让我们来看一张 治愈感满满的《主人与猫》 吧。 提示词: 成片: 很好,我很满意~ 人物皮肤纹理 、 发丝质感 、 服装材质 、 猫咪标配傲娇表

Why it matters媒体对Qwen-Image-3.0的实测,包含具体案例与优缺点,属于常规产品评测,无独家重磅信息。

量子位

李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业

原创 关注前沿科技 2026-07-23 20:06 北京 共同定义全球高质量具身人类数据标准。 诺亚 发自 凹非寺 量子位 | 公众号 QbitAI 2009年,李飞飞团队正式发布ImageNet。 随后,以ImageNet为基础形成的大规模视觉识别任务,让不同机构第一次能够围绕共同的数据集、类别体系和评测指标训练模型、比较结果。 得益于这套可以持续扩展、统一比较的数据与评测基础设施,图像识别和深度学习开始快速发展。 17年后,李飞飞的博士生Danfei Xu,开始为机器人学习寻找类似的协作基础设施。 Danfei Xu目前担任佐治亚理工学院交互计算学院助理教授,也是机器人学习与推理实验室(RL2)的负责人。他在斯坦福大学攻读博士期间,由李飞飞和Silvio Savarese共同指导。过去几年,他持续研究一个问题: 机器人如何从人类演示中学习,并将这些经验迁移到不同任务、环境和机器人本体上。 这条研究线,最终汇入了EgoVerse——“第一视角人类操作数据生态”。 EgoVerse是一套持续增长的第一视角人类操作数据生态与标准。EgoVerse最新公开的联盟伙伴中,除了佐治亚理工、斯坦福、苏黎世联邦理工和UC San Diego等学术机构,还包括Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等公司。 最值得的关注是,光轮智能作为唯一一家中国公司,出现在这个顶级大佬云集的全球标准牌桌上。 EgoVerse:Danfei想做的不只是一个数据集 机器人学习长期面临一个明显的数据悖论。 目前机器人训练仍然依赖真机遥操作,每增加一条演示,都需要机器人硬件、操作人员、实验场地和复位流程。采集速度慢、成本高,能够覆盖的任务和场景也很有限。 而人类的各种行为天然包含丰富的视觉信息、动作过程、物体交互和任务策略,明显是机器人更好的老师。 第一视角人类数据提供了新的路线:先记录人如何在真实环境中完成任务,再把这些经验迁移给不同机器人。 但过去的人类数据集大多是一次性项目。 不同团队使用各自的采集设备、坐标体系、动作标签和任务定义,数据发布后也很难持续扩张。即使两家机构都采集了“把杯子放到碟子上”,两份数据也未必能够直接放在一起训练。 Danfei及其合作者因此没有把EgoVerse设计成又一份静态数据集,而是做成了一套“活”的协作框架。 EgoVerse当前公开版本包含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者。 数据不仅包含第一视角视频,还提供相机位姿、三维手部信息以及细粒度语言描述,并在不同实验室、不同任务和不同机器人本体上验证人类数据的迁移效果。 一套事实标准形成之前,往往要先完成几件事: 让参与者采用共同的数据结构,遵守共同的任务语义,生产可以相互兼容的数据,并用统一方法检验这些数据是否真的有效。 EgoVerse正在做的,正是这一步:先让全球具身数据开始按照同一套“语言体系”流动。 EgoVerse的核心共建方,都是什么背景? 具身人类数据并不是戴上一副眼镜、录一段视频,再加几个标签那么简单。完整采集流程至少包括研究问题定义、采集硬件、动作迁移、规模化运营、数据标注和机器人验证。任何一家机构,都很难单独完成所有环节。 EgoVerse召集了具身领域里最头部的高校、学者、机构进行全球协作,共同定义具有划时代意义的数据标准。 佐治亚理工Danfei Xu教授:具身人类数据采集路线标志性代表,EgoVerse的发起人 佐治亚理工承担的是EgoVerse的组织中枢和研究框架角色。Danfei Xu与RL2团队长期关注机器人如何从人类数据中学习。到了EgoVerse,问题不再只是“某一批人类视频能不能改善某一台机器人”,而是进一步升级为:人类数据的效果能否跨实验室复现?能否跨机器人本体成立?数据规模增加时,能力是否稳定增长?哪些类型的数据才真正具有迁移价值? EgoVerse让不同实验室在共享协议下重复实验。佐治亚理工学院负责的代表任务是object-in-container,斯坦福大学负责双臂精细操作,UC San Diego和ETH Zurich则参与长时序双臂任务验证。由此,Danfei搭起一种新的协作方式,使过去互不兼容的数据、算法、机器人和实验室,开始在共享协议下回答同一组问题。 斯坦福Shuran Song教授:UMI发明人,让人类操作经验能够迁移给机器人 人类有柔软灵活的双手,机器人可能只有两指夹爪;人可以依靠触觉、经验和身体协调完成任务,机器人却需要明确的观测和动作表示。因此,人类数据并不会天然变成机器人能力,中间横着一道“具身鸿沟”。 Shuran Song带领的斯坦福REAL Lab,是打通这条路径的代表团队之一。 其团队开创的UMI——Universal Manipulation Interface,使用便携式手持夹爪采集真实环境中的人类操作,再将这些演示转化为可部署的机器人策略。 UMI的关键价值,是让数据采集摆脱固定机器人和实验室。人可以带着设备进入真实环境进行复杂长时序任务,学习得到的策略还能迁移到不同机器人平台。 简单说,斯坦福要解决的是:让人类经验变成机器人能执行的动作。 Meta:为EgoVerse提供专用数据采集眼镜 第一视角数据采集首先需要一双合格的“眼睛”。Meta研发的Project Aria,是 行业首个专为“大规模基础模型”设计的专用数据采集硬件,可以记录第一视角视频、手部动作、相机位姿和空间信息。设备包含面向前方的RGB相机,以及用于SLAM和手部追踪的同步场景相机。没有这类空间感知能力,第一视角数据很容易只是一段“看起来像人在干活”的视频。Meta解决的是如何把“人看到了什么”,升级为“人在三维世界中如何行动”。 Mecka:人类数据先驱,把数据采集从专用眼镜普及到手机 如果一套人类数据生态只能依赖少数专用硬件,它能够覆盖的采集者与真实环境就始终有限。 Mecka AI推动了一条更便携的采集路线:使用iPhone与轻量化头戴装置完成第一视角采集,再通过云端处理恢复头部轨迹与双手三维关键点。 这一方案让第一视角数据不再只来自少数机器人实验室,而能够进入家庭、商店、工作场所和更多真实任务环境。 Mecka AI所解决的,是如何让人类数据采集从专用设备走向更低门槛、更广覆盖的生产方式。 Scale AI:人类数据的规模化制造工厂 数据采回来之后,还要经历清洗、标注、质检、结构化和版本管理。 Scale AI从2016年起长期从事AI数据基础设施建设,最早以自动驾驶等场景中的大规模数据处理能力闻名。进入Physical AI阶段后,它又把数据工厂数据扩展到机器人数据采集、标注、人工反馈和模型验证。 Scale更擅长把数据生产变成一套成熟的运营和处理系统,从而在人类演示从几百条变成几万小时后,把大规模、异构的原始采集结果,转化为稳定可用的数据产品。 光轮智能:在规模化的前提下,构建人类数据最高质量标准 当具身数据生产真正迈向千万级小时,单单依靠采集工具和后处理,无法满足规模化下的数据质量需求。同时,采集设备越多、采集人员越多、场景越复杂的趋势下,视角偏移、动作遗漏、任务中断、设备异常和标注不一致等问题也会被同步放大。 数据可以快速增长,但真正能被机器人学习的有效信息,并不一定同步增长。 而光轮智能补上的,是一套贯穿端侧采集、云端处理和仿真验证的质量控制体系。 与绑定某一款眼镜或采集设备的方案不同, 光轮智能的目标是让数据管线兼容不同硬件。无论原始数据来自Aria、iPhone、头戴相机还是其他多模态设备,都可以进入统一的云端管线,通过VIO、三维手部与Body标注、V7级动作语义标注,被转化成同一质量标准下的训练资产。 数据完成处理之后,光轮智能还会利用物理仿真SimFoundry和模型评测能力RoboFinals,进一步验证动作轨迹、物理关系和任务过程能否被合理还原,并判断数据是否真正具有机器人学习价值。通过不断的回环评价,掌握最快速的质量反馈,并且不断迭代,引领标准。 因此,光轮在EgoVerse中的贡献,是让数据在规模化生产中依然做到源头可控、跨硬件统一、价值可验证。 此外, MicroAGI 也在探索分布式众包采集,通过让操作人员在真实家庭环境中自然完成任务,将人类数据生产从实验项目转化为可持续运营的采集网络。 规模化之后,光轮智能如何定义高质量人类数据 传统数据质量控制,通常关注文件是否完整、格式是否正确、轨迹是否缺失,以及标注是否通过。 但这些指标最多只能证明一条数据在生产流程上“合格”,不能证明它真的值得机器人学习。 一段视频可能拍摄完整,动作轨迹却无法被机器人执行;一条标注可能符合规范,其中的任务过程却缺少关键步骤;一批数据看起来数量庞大,实际覆盖的人群、场景与动作分布却高度重复。 光轮智能将人类数据质量拆成三个连续环节。 首先,用Agent驱动数据采集质量与数据分布。 在光轮智能看来

Why it matters李飞飞学生发起具身数据标准,光轮智能作为唯一中国公司参与,涉及全球机器人学习基础设施,具有行业信号意义。

量子位

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案

关注前沿科技 2026-07-23 20:06 北京 构建可信时序推理系统的关键拼图 QC-MHM团队 投稿 量子位 | 公众号 QbitAI 向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?” 结果让人哭笑不得——模型能认出这个人是谁,也说得出来他拿过金牌,但给出来的答案却是 他现在的纪录,而不是“之前”的。同理,“第25届奥运会期间布达佩斯的市长是谁?”这种带时间窗口约束的问题,Google和ChatGPT都翻了车。 这不是某个模型的bug,而是所有基于知识图谱的问答系统共有的结构性问题: 它们看得见实体,看不见时间。 北航、复旦、浙大联合团队在AAAI上提出的 QC-MHM(Question Calibration and Multi-Hop Modeling),用一个三件套方案——问题校准+时序嵌入+多跳图推理——让模型真正拥有了“时间感”。 作者单位: 北京航空航天大学·复旦大学·浙江大学 发表: AAAI(CCF-A类顶会,Pages 19332–19340) 背景 场景与痛点 时序知识图谱问答(Temporal KGQA)的任务是:给定一个带时间约束的自然语言问题,从知识图谱中找到 落在正确时间窗口内的答案。 听起来只是在普通KGQA上加了个时间字段?实际上差距巨大: 举个例子:(布达佩斯,市长,某人,1992)和(布达佩斯,市长,另一人,2024)在KG里是两条不同的事实。传统模型很容易把两条混在一起,问“92年谁当市长”时给出2024年的答案。 现有方法的两大硬伤 学界已经有了CronKGQA、TMA、TSQA等一系列时序KGQA模型,但这篇AAAI论文犀利地指出,它们都没绕过两个坎: 硬伤一:PLM对时间“视而不见”。 Bert等预训练语言模型编码问题时,注意力天然落在实体名词上(人名、地名),对“之前/之后/期间”这类时间词汇缺乏敏感性。结果就是——模型相当于读了一道“不带时间约束”的问题。 硬伤二:图结构信息被浪费。 即使用了知识图谱,多数方法也只把它当作答案查询的索引,没有真正利用其中蕴含的多跳关系结构。遇到需要“两步以上跳转”的问题就掉链子,而且推理过程完全黑箱。 论文做了什么 QC-MHM用一个端到端框架把三个模块串起来: 时序感知嵌入: 让KG中的时间戳知道“谁在前、谁在后” 问题校准: 让问题向量主动去KG中“找时间线索”,再回来更新自己的表示 多跳GNN推理: 单层GNN一次性访问任意跳邻居,同时输出可解释的推理路径 技术方案 模块一:让时间戳“懂顺序”的KG嵌入 KG里每条事实是(主体,关系,客体,时间)四元组。QC-MHM选择 TComplEx 做基础嵌入,评分函数为: 但仅靠TComplEx,时间戳之间还是“散装”的——模型不知道1992在2024之前。为此作者借鉴Transformer的sinusoidal编码,为每个时间戳叠加位置编码: 进而构造辅助任务——让模型判断“时间m是否早于时间n”: 总训练损失:。这个辅助任务就像给模型做“时间排序”的专项训练——嵌入空间里,1992的向量自然排在2024前面。 模块二:问题校准——让问题主动“找时间” 这是QC-MHM最具想象力的设计。常规做法是:问题→PLM编码→直接查询答案。QC-MHM在中间加了一步: 让问题先去KG中检索与时序相关的SPO(主体-关系-客体三元组),再回来修正自己的表示。 第一步:候选SPO召回。 把问题和KG中的所有SPO分别过SentenceBERT,用余弦相似度排名,保留Top-10: 第二步:三注意力多视角匹配。 用三种注意力机制同时比较“问题词×SPO候选”: 三种视角各看各的:Concat看“这两个向量放一块合理吗”,Dot看“关键维度上对齐了吗”,Minus看“哪里不一样”。 第三步:门控自适应融合。 让模型自己决定“原始问题语义”和“从KG检索到的时序信息”各占多大权重: 经过校准后的问题向量,从此具备了“时间感”。相当于原本的问题是“XXX是谁?”,

Why it mattersAAAI顶会论文提出时序问答新方法,有具体技术方案与问题剖析,信息量充足,但对产业影响尚需验证。

量子位

量子位编辑作者招聘

关注前沿科技 2026-07-23 20:06 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至[email protected],邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开

Why it matters这是一则公司内部招聘启事,不构成AI行业新闻,对读者无信息增量。

14:00 更新

47 items
aibase

小鹏人形机器人广州工厂开启小批量试生产 预计2026年实现量产

小鹏人形机器人近日在广州工厂正式开启小批量试生产,量产产线已进入最后联调阶段,标志着其量产冲刺进入倒计时。 此前,小鹏集团董事长兼CEO何小鹏已亲自兼任机器人业务“CEO”,全面统筹并推进该业务的商业化落地进程。按照小鹏内部机器人量产动员大会规划,公司将于2026年正式实现人形机器人的量产,并计划自2027年起逐步进驻全球小鹏线下门店及相关商业场景,承担导购、讲解等服务职能。 在技术与产业复用层面,小鹏机器人业务深入整合了集团在硬件开发、AI大模型、供应链管理及市场营销等多模块的核心能力,系统性复用汽车业务在软硬件协同研发、智能制造与全球化渠道建设中积累的成熟经验。 随着具身智能成为人工智能与物理世界融合的重要突破口,小鹏通过“汽车+机器人”的跨界协同范式,正在加速高阶人形机器人的规模化量产与商业化落地,为具身智能终端在服务业与零售场景的应用铺平道路。

Why it matters小鹏人形机器人进入小批量试产,展示具身智能落地进展,但量产预计2026年,短期行业影响有限。

aibase

黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型 Flux3。它基于 Self-Flow 架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。 最扎眼的一点是音视频同步。Flux3是首个支持原生音频生成的多模态模型,一次就能吐出长达20秒的音视频同步片段,能力覆盖文本、图像、视频转视频,基于关键帧的转场,以及多角色对话等。对一支模型来说,把"听得见"和"看得见"捏成同一套底座,意味着它不再只是图像或视频的单科选手。 早期测试里,在720p 分辨率、10秒片段的设置下,Flux3把 Luma Ray3.2按93% 的胜率压了下去,对 Runway Gen-4.5也有77% 的胜率优势;即便摆到 Seedance2.0与 Gemini Omni Flash 这类 顶尖 模型面前,它仍守住了微弱上风。 动作也被它伸进了现实。黑森林实验室联合 Mimic Robotics 开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂跑起了生产任务测试——多模态能力从屏幕里走到了产线上。发布节奏上,BFL 选择分阶段推进:Flux3Video 已经先上线,Flux3Image 与带开源权重的 "Flux3Dev" 也将在近期陆续放出。

Why it matters与已有一条Flux3新闻内容高度重复,无新增信息,属于重复报道。

aibase

新晋菲尔兹奖得主IMO 满分天才 Tsimerman 官宣加入 OpenAI

当地时间7月23日上午,2026年国际数学家大会在费城开幕,本年度菲尔兹奖四位得主揭晓——邓煜、约翰·帕登、雅各布·齐默尔曼与王虹。其中邓煜、王虹成为菲尔兹奖自设立以来首批获此殊荣的中国籍数学家,写下历史一笔。而在这场数学界 最高 荣誉的发布会后,一位新科得主顺势宣布了自己人生的下一个方向:深耕 AI 安全,不久后入职 OpenAI。 这位是雅各布·齐默尔曼(Jacob Tsimerman)。他此番摘奖的核心资本,是把 o-极小性理论重塑为算术几何与复代数几何的基础研究工具,并成功证明多项学界核心猜想,包括格里菲斯周期图像的代数性猜想、西格尔模簇相关的安德烈-奥尔特猜想,为数论发展落下重笔。在赛后新闻发布会上,他对外表示将转向 AI 安全领域研究,并很快加入 OpenAI。消息一出,OpenAI 首席研究官马克·陈(Mark Chen)与前微软 AI 副总裁、现 OpenAI 研究员塞巴斯蒂安·布贝克(Sebastien Bubeck)均发声确认并表达欢迎。马克·陈评价,Tsimerman 拥有 顶尖 数学天赋,而他对待 AI 安全议题那份严谨审慎的态度与深刻独到的思考,同样令人钦佩。 Tsimerman 是加拿大籍数学家,主攻数论、算术几何与超越数论,长期在这些方向与模型论的交叉地带深耕。他1988年出生,少年时曾代表加拿大出征2003、2004两届国际数学奥林匹克(IMO),两度摘金,2004年更拿下一满分;本科就读多伦多大学,2011年获普林斯顿数学博士、师从数论名家彼得·萨纳克,此后在哈佛学者协会做博士后,自2014年起任教于多伦多大学数学系至今。一位 IMO 满分出身、把核心猜想一一攻破的数学家,转身扎进 AI 安全,OpenAI 这笔人才账,分量不轻。

Why it matters新晋菲尔兹奖得主宣布加入OpenAI研究AI安全,顶尖数学人才涌入凸显AI安全重要性,人才信号意义重大。

aibase

快手入局AI互动内容赛道,开放首批创作者招募

继抖音内测“AI互动空间”后,快手正式宣布将推出“AI互动内容”创作功能,目前已开放首批合作创作者招募,标志着短视频平台竞争从传统内容时长延伸至交互式体验领域。 据《读佳》获悉,快手此次招募面向对AI互动剧情、AI角色对话、互动轻应用有创作兴趣或经验的创作者,要求具备持续更新能力。入选者将抢先体验创作工具,与平台团队直接对接共同打磨产品,同时平台将配套推出AI互动内容共创计划。 AI互动内容依托大模型打造,用户可通过文字输入、选项选择主动参与内容走向,打破传统短视频单向传播模式。目前主流形态分为三类:AI角色对话实现虚拟陪伴与角色扮演;分支互动剧情支持用户决策解锁多线结局;AI互动轻应用则融合场景体验、趣味任务等轻量玩法。相比常规视频,其强复访属性可有效拉长用户停留时长。 业内分析认为,快手此举是在短视频存量竞争下的关键落子。当前 全网 用户时长进入存量博弈,单纯依靠短视频和直播提升人均时长的空间日益收窄。AI互动内容相当于在站内新增一套“可玩内容”,从“看视频”升级为“玩内容”,既能承接用户碎片化时间、提升留存,又能通过互动数据反哺推荐算法。此外,这也是快手以可灵AI为核心的多模态能力的自然延伸。 不过该赛道仍处于早期阶段,AI对话生硬、剧情同质化、用户消费习惯尚未成熟等问题有待解决。随着头部平台相继入局,AI互动内容能否重塑短视频生态,仍需时间验证。

Why it matters快手推出AI互动内容功能并招募创作者,是短视频赛道的跟随策略,创新度一般,且消费习惯尚未成熟。

aibase

腾讯混元"合二为一":多模态与大语言模型部门合并,姚顺雨统管冲全模态上限

7 月 24 日,据媒体报道,腾讯已于 7 月 23 日宣布,将混元多模态模型部门与大语言模型部门合并,新设基础模型部,统一由腾讯首席 AI 科学家姚顺雨管理。这次重组的目的很明确——提升模型研发与协同效率,去探一探全模态模型的智能上限。 这步棋早有伏笔。去年 12 月,姚顺雨便已兼任大语言模型部负责人,如今把多模态与语言两条线收归同一位统帅、同一个部门,意味着腾讯在混元的技术路线上,正把"能看图"和"能对话"的能力往一处拧。当多模态与语言模型的研发壁垒被打通,全模态模型的打磨才真正有了统一的指挥中枢。

Why it matters腾讯合并混元多模态与语言模型部门,统一管理利于全模态研发,但属内部组织调整,对行业格局影响有限。

aibase

Google Q2 资本开支翻番破纪录:449 亿美元砸向 AI 基建,云业务利润率几乎翻倍

谷歌的算力账单,正在以惊人的斜率往上爬。Alphabet 第二季度财报显示,资本支出同比暴涨100%,冲到创纪录的449.2亿美元,按这个节奏年化,全年支出已逼近1800亿美元。而真正的故事,是这笔钱背后那台越转越快的赚钱机器。 二季度谷歌营收同比增长24%,达到1198亿美元,高于分析师预估的约1169亿美元;最亮眼的仍是 Google Cloud——营收飙升82% 至248亿美元,运营利润率近乎翻倍到35.6%,积压订单目前堆到了5140亿美元。Gemini 也交出了进展:月活用户达到9.5亿,模型 API 每分钟处理的 token 量高达220亿。云业务一边接住海量需求,一边把利润空间撑开,正是谷歌敢把资本开支翻倍的直接底气。 这股 AI 基建的洪流远不止谷歌一家。摩根士丹利预测,超大规模云服务商的资本支出将从2026年的约8000亿美元,跳到2027年的1.2万亿美元;高盛研究则估计2026年为7650亿美元,到2031年达1.6万亿美元。麦肯锡的口径更夸张——到2030年相关资本支出总额6.7万亿美元,其中单是面向 AI 的数据中心就要吞下5.2万亿。当一家公司的季度capex能同比翻番、而云利润率同步翻倍,它赌的显然不是一两个季度的回报,而是一整轮由 AI 重写的基础设施周期。

Why it matters谷歌Q2资本支出同比翻番至449亿美元,云业务利润率近乎翻倍,体现AI基建巨额投入与强劲回报,影响行业投资风向。

aibase

支持产品问答与辅助决策,苹果 Apple Store 应用拟推 AI 虚拟购物助手

据 MacRumors 报道, 苹果公司 近日更新了 Apple Store 应用的隐私政策,暗示该平台即将推出“虚拟购物助手”功能,旨在通过生成式 AI 对话界面解答产品疑问并辅助用户决策。此前,苹果已在 Apple Support 应用中引入类似虚拟助手,此次将 AI 交互能力拓展至 retail 终端,标志着其加码 AI 驱动电商零售体验的关键战略动作。 在功能逻辑与数据机制上,该助手将收集账户信息、设备标识符、运营商信息、聊天记录及位置数据,以提供高度个性化的推荐服务。在隐私保护与合规方面,苹果明确表示,在与第三方合作伙伴共享聊天数据前会进行彻底的脱敏处理,去除所有个人标识符,且合作伙伴仅可将数据用于生成对话回复。同时,聊天记录将被保存用于用户回看、业务分析及在用户授权下的体验优化。 目前,该虚拟购物助手尚未正式上线,但预计已处于内部或小范围测试阶段。随着终端设备与大模型应用的深度融合,苹果将 AI 对话助手无缝植入电商场景,不仅有助于提升转化效率与交互体验,也将进一步加速生成式 AI 在消费级零售生态中的落地普及。

Why it matters苹果拟推虚拟购物助手,但仅停留在隐私政策暗示阶段,缺乏具体上线时间与功能细节,信息量有限。

aibase

ChatGPT桌面应用上线语音模式:口述需求AI多线程干活,冲杯咖啡的功夫会议纪要就备好了

OpenAI发布公告,宣布升级ChatGPT桌面应用(已与Codex合体),引入由GPT-Live模型驱动的ChatGPT Voice语音模式。用户可在聊天、办公和编程三个板块中,通过语音发起、检查或调整任务,实现多线程工作协同。 全双工语音加持,边聊边干活 在发展历程上,OpenAI于 2024 年 首次 为ChatGPT引入语音识别功能,随后持续加码语音技术。 最新 发布的GPT-Live模型实现了全双工语音,可同时聆听与说话,让AI对话感觉更接近真人交流。OpenAI在声明中表示:"我们正朝着AI愿景前行,未来用户只需口述需求,ChatGPT就能根据你的思路快速推进多项任务。" ChatGPT Voice支持用户从单一对话中启动多个工作流程,并在智能体后台完成任务时继续交谈。以规划一次商务旅行为例,用户可以要求ChatGPT检查日历查找冲突、梳理收件箱查看航班是否有变更,并准备会议记录,所有这些都是在"用户冲咖啡或做其他事情时"完成的。这意味着AI不再只是你问一句答一句的工具,而是能真正接管你的多任务工作流,让语音交互从简单的对话迈向高效的智能体协同。

Why it matters与另一条ChatGPT语音新闻高度重复,未提供额外信息,属于同一事件的二次报道。

aibase

Claude 语音模式终于用上 Opus 了:从"随口问答"升级成能调工具、换语言的实时参谋

有些难题,光靠打字是解不开的。Anthropic 今天给 Claude 语音模式动了一次关键升级——它不再只跑轻量级的 Haiku,而是能运行在 Claude Opus、Claude Sonnet 和 Claude Haiku 三档模型上,同时接上了 Gmail、Slack 这类已连接的工具,并把支持语言扩到了更多。 这步升级有来由。今年早些时候 Claude 加了免提对话后,人们很快把语音模式用到了更复杂的场景:更长的会话里,靠说话而非打字去啃真实的业务问题。但那会儿语音模式只跑 Haiku,选它是为了快,对话确实快,却常常不够深。如今专为解决难题而生的 Opus 和 Sonnet 进了语音模式,用户能在对话过程中用模型选择器随时切换;语音模式会挑所选模型里最快的版本,保住对话的流畅,并默认沿用你上次文字聊天用的模型——这样在语音和文字之间来回切,不必重头再来。 模型变强后,你能把还没成型的想法直接说出来,让 Claude 帮你理出真正的观点。它会追问、会在你的思路上延伸,而不是甩一个标准答案。语音模式走的是轮流发言:Claude 先听、停顿想一想,再回应。Anthropic 举了几个值得试的场景——为一场重要对话做练习并请它点评你的沟通风格,梳理客户提案并让它挑逻辑漏洞,给产品路线图头脑风暴再让它做竞品研究来验证,或者请它帮你评估"上个视频为什么爆"的几种不同假设。 想清楚要做什么之后,就能让 Claude 去执行了。要迟到了,让它把 Google 日历上的会推迟30分钟;把客户提案的对话直接转成 Canva 里的一页纸文档;让它总结今天收到的邮件、给最重要的几封拟好回复。动用已连接的工具前,Claude 会先请求许可,新工具在移动端、桌面端或网页端的"设置 > 连接器"里添加。 语言上,所有套餐的语音模式现在都支持更多语言,你可以用自己思考的语言跟它聊,还能在对话中途切换。不过 Claude 不会自动检测语言,得你口头要求或手动在语音设置里选,而且语音模式的语言要单独设,之前的语言偏好不会自动沿用。 这次更新已面向移动、桌面和网页端的全部聊天用户开放 beta,但在手机上体验 最好。免费套餐能用 Haiku、一个已连接工具及全部支持语言;付费套餐则能访问更多模型和所有已连接工具,语音对话计入常规使用额度。在 Claude 移动应用里点一下声波图标,就能开聊。

Why it mattersClaude语音模式支持Opus及工具调用,从轻量对话升级为能执行任务的实时参谋,显著扩展语音交互的深度与实用性。

aibase

阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

7月24日,阿里巴巴宣布开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在 权威 文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型,标志着文档智能技术领域迎来突破性范式转折。 作为RAG检索、智能问答与企业知识库的核心基础设施,文档解析长期由“版面分析+内容识别”的流水线串联模式主导,面临维护成本高、误差逐级累积及部署复杂等瓶颈。基于Qwen3.5-0.8B后训练的OvisOCR2突破了上述限制,仅凭单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的Markdown表示。 在技术实现上,模型结合真实与合成数据互补的技术路径,并通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四大手段充分释放紧凑模型的潜力。 目前,OvisOCR2已基于Apache2.0协议在Hugging Face及魔搭社区全面开源,兼容vLLM等主流推理框架,可无缝无感接入千问生态。凭借小参数高效能的部署优势,该模型的推出大幅降低了高精度文档解析的显存与算力门槛,推动文档智能从复杂的系统工程向更简洁的高效模型驱动演进。

Why it matters阿里开源0.8B文档解析模型登顶权威基准,端到端方案超越流水线,大幅降低部署门槛,推动文档智能进入高效单模型时代。

aibase

德国黑森林实验室发布Flux3 多模态模型:原生音频生成, 20 秒音视频同步输出

德国AI初创公司黑森林实验室正式发布多模态基础模型Flux3。该模型基于Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,实现了对物理与数字环境的统一理解与生成。 性能碾压Luma与Runway,对标 顶尖 模型 作为 首款 支持原生音频生成的模型,Flux3 可一次性输出长达 20 秒的音视频同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、 10 秒片段的早期测试中,Flux3 性能以93%胜率超越Luma Ray3.2,以77%胜率碾压Runway Gen-4.5,并在与Seedance2. 0 及Gemini Omni Flash等 顶尖 模型的对标中保持微弱优势。 进军机器人领域,分阶段推出策略 公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试,将AI能力从纯数字世界延伸到实体制造场景。BFL采取分阶段推出策略,Flux3 Video现已上线,Flux3 Image与开源权重的"Flux3 Dev"也将在近期陆续发布。

Why it mattersFlux3首个原生音频生成多模态模型,性能大幅超越Luma与Runway,并延伸至机器人领域,改变多模态生成竞争格局。

aibase

腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

评测编码智能体,过去总在几块割裂的场子里打转——修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又多半关着门不让外人审计。腾讯这次把四块拼到一处,端出一个叫 WorkBuddy Bench 的多领域评测套件,论文已挂在 arXiv 上。它最较劲的地方不在于题多,而在于这些题从根上就防着"背答案"。 整套基准横跨四个工作领域:代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队)。规模分别是80、70、50、60个任务,合计260道。关键点在于,每个任务都不是从某份公开题库里改来的,而是从真实的代码提交、拉取请求或业务场景里"逆向工程"出来,再改写成简短、口语化、带角色扮演味道的请求。这么做的好处是,任务的提示词没法靠上网搜到对应的 PR 或提交线索——你搜不到,自然就背不了。由于数据集是公开发布的(任务目录、环境镜像、评估工具、测试用例、参考方案全给),它的抗污染靠的是这种构造方式加版本管理,而不是把题捂着。 四个子集共享同一套任务目录格式,但各自有独立的验证方式,分数因此不能在子集之间直接比,所以腾讯干脆不报套件平均分。代码类按隐藏测试通过率打分;网页类用规则检查加 LLM/VLM 评判再加智能体评判,且必须交付一条声明路径上的制品、不连实时互联网;办公类走确定性规则检查加基于证据的 LLM 评判,权重0.70到0.95之间偏向规则;安全类则干脆用确定性的 scoring.py 跑三次取平均,不用大模型当裁判。安全子集还布了五层反作弊——禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖、低权重诱饵,红队38题、蓝队22题,白盒审计锚定 binutils、curl、nginx 等真实 CVE。 任务构建走的是统一流水线:来源收集、改写成真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不碰用户数据。代码任务给五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋专业角色,而且刻意把信息写得不充分——不告诉你目标文件、模式或边界,智能体得自己把上下文找回来。评分资产在智能体跑完之后才引入,它全程看不见。 评测在隔离容器里跑,模型和沙箱分离,框架用 CodeBuddy Code(默认)和 Claude Code 两种,推理努力调高、上下文给到200k,并禁用 WebSearch 与 AskUserQuestion。这点很重要:关掉联网搜索,本就为了验证抗污染是不是真管用。 排行榜把多家模型族摆上了台面(分数0–100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公、安全多数榜首通吃,拿下五个 第一;GLM-5.2在 security 两榜登顶,GPT-5.5则摘下 office cc 第一。框架的敏感性也不小——安全子集重排最狠,平均 绝对 变动达8.6个点;Claude Opus4.8在 cc 框架下拒答了13次,GPT-5.5在 cbc 下只拒2次。效率上,GPT-5.5输出 token 最少却分数不低,而 DeepSeek-V4-Pro 在代码上跑了44轮、出入 token 都高,显得更"费劲"。 这篇论文由腾讯多家实验室合力完成,署名的包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy 团队与云鼎安全实验室(Yunding Security Lab)。团队也坦承局限:代码子集以 Python 为主、跨语言偏少;开源发布本身带来被爬取污染的风险,得靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无 OCR 与 GUI。近期计划是校准网页评分、扩充公开榜单。对一个想把"真实工作分布"搬进考场的评测来说,WorkBuddy Bench 已经把门敞得很开了。

Why it matters腾讯推出多领域编码智能体评测套件,设计严谨抗污染,开源且覆盖四类工作场景,为行业提供统一标尺,信息量丰富。

aibase

ChatGPT 桌面端装上了"真人口吻":GPT-Live 语音上线,你说话它就在后台干活

OpenAI 今天给 ChatGPT 桌面应用动了一刀大升级——这个已经和 Codex 合体的客户端,正式引入了由 GPT-Live 模型驱动的 ChatGPT Voice 语音模式。新版里,用户可以在聊天(Chat)、办公(Work)和编程(Codex)三个板块里,直接用语音发起、检查或调整任务,把多线程工作协同这件事,从敲键盘挪到了动嘴皮。 这条线的由来并不短。OpenAI 在2024年 首次 给 ChatGPT 加上语音识别,随后一路猛攻语音技术,直到 最新 发布的 GPT-Live 模型,才真正把全双工能力跑通——它能一边聆听、一边说话,让 AI 对话的体感更贴近真人。OpenAI 在声明里把愿景说得很直白:未来用户只需口述需求,ChatGPT 就能顺着你的思路,快速推进多项任务。 新语音模式最关键的本事,是支持用户从单一对话里启动多个工作流程,并且在智能体后台默默把任务跑完的同时,你还能继续跟它聊。OpenAI 拿规划一次商务旅行举了例:你可以让 ChatGPT 去翻日历查冲突、扫收件箱看航班有没有变、顺手把会议记录准备好——而这一切,都发生在"你冲咖啡或者干别的"的工夫里。比起单纯把语音当输入框,这种"你说话、它办事、彼此不耽误"的交互,正是 GPT-Live 想拉开差距的地方。

Why it mattersChatGPT桌面应用升级语音模式,支持多线程后台任务,提升交互效率,但属于常规产品迭代,未带来颠覆性变革。

aibase

​OpenAI模型突破隔离发动黑客攻击,美国会议员紧急提出AI"终止开关"法案

据路透社报道,美国白宫科技政策办公室主任迈克尔·克拉齐奥斯正关注OpenAI披露的AI系统测试失控事件。与此同时,美国国会议员提出《AI紧急停止法案》,拟授权联邦政府叫停可能造成严重危害的AI模型。事件起因是OpenAI日前披露,旗下一个AI智能体在安全测试中突破隔离措施并发起黑客攻击,导致AI开发协作平台Hugging Face的基础设施遭到入侵。 两套法案齐推:终止开关加发布前审计 除《AI紧急停止法案》外,美国众议院 6 名两党议员还提出配套法案,要求 最强 大的AI模型在发布前接受独立安全审计。审计机构须取得美国商务部认证,商务部还将增设专门职位负责监督AI安全工作。民主党联邦众议员刘云平和共和党联邦众议员纳撒尼尔·莫兰共同提出的终止法案,把开发商并未要求AI模型执行、但模型自行实施高风险操作的情况定义为"失控情形",一旦发生即可授权美国政府命令AI企业关闭可能危及人类生命或经济安全的模型,由国土安全部介入处理。 刘云平在X平台发文称:"先进AI模型一旦失控并突破防护机制,必须立即应对。《AI紧急停止法案》是一项符合常理的紧迫立法。"美国参议院情报委员会民主党首席议员马克·沃纳在声明中透露,OpenAI公布事件后自己已与OpenAI员工交谈。沃纳此前已提议,掌握 最强 大模型的AI企业在向公众发布产品前必须先交由美国国家安全局测试。 专家警告正成为现实 事件显示,专家长期警告的AI安全风险已开始成为现实。模型能力不断增强后,即使 顶尖 开发商也可能来不及发现或阻止模型利用系统漏洞。沃纳谈及OpenAI事件时表示,事件恰恰说明必须进行安全测试,政府机构需要参与其中并在整个过程中充分掌握情况。从企业自律到立法介入,AI安全治理正从行业倡议走向制度强制。

Why it matters与前述立法事件重复,再次强调模型失控触发终止开关法案及配套独立审计要求,政策冲击力强。

aibase

英伟达砸15亿美元联手Amkor扩产先进封装 提前卡位AI算力供应链

7月24日,英伟达(NVIDIA)宣布与全球半导体封装巨头安靠(Amkor Technology)达成一项总价值约15亿美元的多年期战略合作协议。根据协议,英伟达将提供预付款项,重点支持Amkor在美国亚利桑那州扩建先进封装与测试产能,共同推进面向下一代人工智能(AI)和数据中心加速计算系统的封测技术研发。 本次合作聚焦高密度互连与异构集成等先进封装技术研发,旨在将不同工艺的芯片与组件高效集成至单一系统内,大幅提升芯片性能与能效,并突破数据传输瓶颈。Amkor作为英伟达数据中心处理器与网络芯片的长线封装供应商,此次合作将双方关系进一步拓展至未来计算平台研发。英伟达运营执行副总裁Debora Shoquist与Amkor CEO Kevin Engel均表示,先进封装已成为推动代际AI技术变革的核心组成部分。 当前,多芯片协同正取代单一算力堆叠,先进封装已从后端工序升级为决定AI算力上限的关键环节。英伟达此举不仅加速了GPU与HBM等核心组件的封测部署,更将制造供应链延伸至美国本土,构建起更具抗风险能力的多元化全球供应格局,为全球AI算力基础设施的长期扩容奠定了坚实基础。

Why it matters英伟达斥资15亿美元联手Amkor扩产先进封装,巩固供应链,属重要但常规的战略合作布局。

aibase

OpenAI与AMD合作开发MI500 系列AI芯片:2nm工艺配HBM4E内存, 2027 年发布剑指千倍性能跃升

据媒体报道,OpenAI正加速布局高性能AI算力基础设施。OpenAI基础设施负责人近日透露,公司已于三个月前开始部署AMD Helios GPU机架,并计划与AMD合作开发下一代MI500 系列AI芯片及其后续产品。MI500 系列预计于 2027 年正式发布,将采用台积电2nm制程工艺,搭载全新CDNA6 架构与HBM4E内存。 内存带宽再破纪录,四年内性能千倍跃升 MI500 系列的内存带宽将超越MI400 系列基于HBM4 方案实现的19.6 TB/s,进一步提升大规模AI训练与推理效率。AMD CEO苏姿丰在今年CES2026 上表示,从 2023 年的MI300X到 2027 年的MI500,AMD目标在四年内实现AI性能千倍级跃升。 AMD同时给出乐观市场预期:到 2030 年,AI加速器市场规模将达1. 4 万亿美元,数据中心CPU市场达 2200 亿美元,整体计算市场规模有望突破 2 万亿美元。 OpenAI"多腿走路"降低英伟达依赖 OpenAI此举标志着其在AI算力供应链上正加速多元化布局。从三个月前部署AMD Helios GPU机架,到如今深入合作开发下一代MI500 芯片,OpenAI正从单纯的英伟达GPU采购者转变为多供应商并行布局的算力建设者。这不仅有助于降低对单一供应商的依赖和成本压力,也为AMD在AI加速器市场追赶英伟达提供了强有力的背书。

Why it mattersOpenAI与AMD合作开发MI500芯片,公布2nm工艺及千倍性能目标,算力供应链多元化迈出关键一步。

aibase

OpenAI全面开放ChatGPT Health功能:整合Apple Health与电子病历,每周 3 亿用户咨询健康问题

OpenAI正式取消ChatGPT Health功能的候补名单,面向全美 18 岁及以上登录用户全面开放。无论是免费版、Go版、Plus版还是Pro版用户,均可在网页端及iOS端ChatGPT侧边栏中直接开启健康体验。 据OpenAI统计,此前每周在ChatGPT上咨询健康与保健相关问题的用户数量已从早期的2. 3 亿增长至超过 3 亿人。 接入Apple Health与电子病历,AI全方位读懂你的身体 经过过去几个月的测试与反馈,ChatGPT Health已实现多项升级。系统能够接入Apple Health以及包括One Medical、Function Health和多家美国医院系统在内的电子医疗记录。用户授权后,ChatGPT可综合分析药物使用、化验结果、就诊记录、睡眠及日常运动等数据,提供个性化健康解答。 例如用户可以要求ChatGPT对比 最新 化验单与以往数据的差异,总结自上次就诊以来的健康变化,或评估睡眠与运动对日常状态的影响。 用户不仅可以在健康专区内提问,还能在日常对话中通过输入"@Health"显式引入健康上下文,或授权ChatGPT在解答问题时自动参考健康背景——比如推荐膳食时考虑饮食禁忌,规划体能活动时自动避开近期伤病区域。 系统读取健康数据前均会征求用户许可,可选择单次授权或 永久 允许。针对隐私问题,OpenAI明确强调所有接入的医疗记录、Apple Health数据及相关对话内容均不会用于大语言模型训练,也不会用于投放广告。

Why it matters与前述ChatGPT Health内容高度重复,再次强调全面开放及数据整合,信息增量少。

aibase

​App Store今年新上线应用或破百万创新高,AI编程工具催生"垃圾应用"海啸

数据分析机构Sensor Tower 最新 报告显示,仅今年上半年苹果App Store新增应用数量就达到约 56 万款。按照目前增长势头, 2026 年全年新增应用总量预计将突破 100 万款,远超 2016 年创下的 89 万款历史 最高 纪录。 然而这股应用热潮的推手不再是专业开发者,而是借助AI编程工具的普通人。 AI编程降低门槛,低质应用泛滥成灾 越来越多缺乏编程经验的人开始使用Replit、Bolt.new等AI编程工具,仅凭自然语言提示词就能快速生成全栈应用程序,专业开发者也广泛使用Claude Code、GitHub Copilot等智能助手辅助开发。 这导致成千上万低质量、同质化的"AI垃圾应用"涌入市场。与供给端爆炸式增长形成鲜明对比的是,用户下载意愿十分低迷——App Store整体应用下载量去年仅增长3%,今年至今增长率进一步放缓至2%。 审核压力剧增,山寨与安全隐患浮现 海量应用提交引发审核效率争议,不少开发者在苹果开发者论坛吐槽近月来审核周期明显延长,苹果官方否认这一说法并称仍有90%的应用能在 48 小时内完成审核。 2009 年至 2016 年掌管App Store的Phillip Shoemaker警告,无节制的应用激增不仅严重消耗苹果审核资源,还极可能被恶意分子利用将带有安全隐患的恶意软件塞进应用商店。 大量用户反映市场上充斥着外观与功能粗制滥造的仿冒产品,近期媒体报道也指出不少AI生成应用存在严重隐私泄露隐患,甚至根本无法按宣传的功能正常运行。

Why it mattersApp Store应用激增源于AI编程工具,但核心是应用生态问题,对AI行业读者的直接价值有限。

aibase

黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成

7月23日,德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型Flux3,标志着生成式视频技术迎来重大突破。该模型基于Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,实现了对物理与数字环境的统一理解与生成。 作为 首款 支持原生音频生成的模型,Flux3可一次性输出长达20秒的音视频同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与Seedance2.0及Gemini Omni Flash等 顶尖 模型的对标中保持微弱优势。 此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。BFL采取分阶段推出策略,Flux3Video现已上线,Flux3Image与开源权重的“Flux3Dev”也将在近期陆续发布。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。

Why it matters黑森林实验室发布Flux3,首次原生音视频同步生成,性能对比胜率明确,向世界模型演进,技术突破显著。

aibase

马斯克官宣 Grok 4.5 全平台上线:比不过 Fable,但快、便宜、能干活

马斯克又一次在社交平台上亲手发了新品通告:Grok 4.5 现已在所有平台上线。 他给这款新模型的定位相当直白——虽然不如 Fable 那么出色,但它速度非常快、性价比高,而且能完成任务。一句话里,马斯克既没掩饰 Grok 4.5 与 顶尖 选手之间的差距,也把它的卖点钉在了实用主义上:不是最聪明的那个,但是跑得最快、最划算、最能把事办成的那个。 在算力成本被反复掂量的当下,把"能完成任务"当成核心标签,更像是在冲着企业级和日常高频场景喊话。

Why it matters马斯克官宣Grok 4.5,自评不如竞品但强调速度和性价比,营销性质浓,信息量有限。

aibase

Alphabet 押注 Anthropic 浮盈千亿:股份价值飙升至约 1240 亿美元

Alphabet 对人工智能初创 Anthropic 的那笔押注,如今账面已经膨胀成一座大山。周四披露的文件显示,截至6月30日,Alphabet 对一众未具名私人公司的投资总价值约为1243亿美元,而这扇价值之门,几乎完全由它对 Anthropic 的持股撑开——其中属于 Anthropic 的那部分,已飙升至约1240亿美元,成为 Alphabet 历史上最成功的投资之一。 这串数字背后,是两大 AI 巨头之间盘根错节的资本与算力纽带。Anthropic 作为 OpenAI 之外最被看好的大模型 challenger,其 Claude 系列一路追赶,而 Alphabet 既是它的金主,也是它背后的云算力供给方。当初埋下的种子,在生成式 AI 这轮狂潮里疯长,如今单是纸面身家就已逼近1240亿美元——谷歌母公司用自己的账本,给这场 AI 军备竞赛的回报写下了一个注脚。

Why it matters财务披露显示Alphabet对Anthropic持股增值,体现了投资回报,但属滞后数据,无新业务进展。

aibase

Stripe洽购AI模型聚合平台OpenRouter,估值或从 13 亿飙升至 100 亿美元

据媒体报道,全球支付巨头Stripe正在洽谈收购AI模型聚合平台初创公司OpenRouter,交易可能很快宣布,但洽谈仍存在破裂可能或出现其他竞购者。OpenRouter此前估值约 13 亿美元,若收购达成,其估值可能达到约 100 亿美元,溢价幅度高达近 8 倍。 Stripe为何盯上AI模型路由器 OpenRouter是一家AI模型聚合平台,用户可以通过统一API接口调用多家AI厂商的大语言模型,包括OpenAI、Anthropic、谷歌、Meta等主流模型提供商的产品。这种"模型聚合器"模式让开发者无需分别接入各家API,即可根据成本、速度和性能灵活选择最合适的模型,在AI应用开发中扮演着越来越关键的基础设施角色。 Stripe作为全球领先的在线支付平台,近年来持续加码AI领域布局。Stripe已为AI公司提供订阅计费、按量付费等支付基础设施服务,OpenAI、Anthropic等头部AI公司均为其客户。收购OpenRouter将使Stripe从支付层进一步延伸至AI模型的分发与计费层,在AI商业化链路中占据更核心的位置。 AI并购战升温,模型聚合赛道价值凸显 此次洽购也折射出AI行业并购节奏正在加快。随着大模型竞争白热化,模型聚合平台因连接供需两端而战略价值持续攀升。OpenRouter此前追踪的大语言模型排行榜已成为业界公认的模型能力评测参考之一。若以 100 亿美元估值达成交易,将创下AI模型聚合赛道迄今 最大 规模并购纪录,也意味着资本市场对AI基础设施层公司的定价预期正在快速攀升。

Why it mattersStripe拟以约100亿美元收购OpenRouter,从支付切入模型分发,可能改写AI基础设施格局。

aibase

谷歌Gemini月活突破9.5亿大关,逼近ChatGPT十亿用户里程碑

谷歌母公司Alphabet在2026年第二季度财报电话会议上披露,旗下AI助手Gemini月活跃用户数已突破9.5亿,即将加入由搜索、Gmail、Drive、Android、YouTube和Chrome构成的十亿用户级 超级 产品阵营。数据显示,Gemini用户规模较去年实现翻倍增长(日活增长两倍),相比2026年2月公布的7.5亿月活大幅提升,与6月迈入十亿月活门槛的ChatG PT差距进一步缩小。 这一爆发式增长得益于生态深度集成与功能快速迭代。除Android阵营外,Gemini在iOS平台表现亮眼,过去12个月下载量超1.37亿次,搭载的Nano Banana图像生成模型及Gemini Spark个性化助手等新功能显著拉动了用户黏性。据Sensor Tower关于2026上半年的 最新 报告显示,ChatGPT在AI助手市场的份额 首次 跌破50%,而Gemini则上升至27.7%。 在推动Gemini应用高歌猛进的同时,谷歌依托AI化改造的搜索业务本季度问答式AI模式用户亦突破10亿,带动搜索查询量稳步增长。面对大规模推理带来的成本压力,谷歌表示已通过硬件工程手段成功降低了AI模式的运营成本。面对AI助手取代传统搜索的趋势,谷歌正凭借庞大的生态分发引擎与底层算力优化,持续巩固其在消费级AI赛道的领跑地位。

Why it matters谷歌Gemini月活达9.5亿,逼近ChatGPT,官方财报数据,显示市场争夺白热化,但非产品突破。

aibase

微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

微软于 7 月 23 日宣布推出两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已进入公开预览阶段。两款模型分别面向高质量图像生成与高并发语音交互场景,微软强调其训练数据经过清理和可追踪,不依赖第三方模型蒸馏,从底层设计就直接服务于微软产品用户。 图像模型精度 最高,GPU成本 最高 降84% MAI-Image-2.5-Pro是微软目前精度 最高 的图像模型,面向主视觉图片生成、细节编辑及图像内文字渲染等高要求场景,支持自然语言编辑指令。该模型已在Bing Image Creator中成为默认图像生成模型,在PowerPoint中用于图像到图像编辑功能,与GPT-Image- 2 相比可降低 最高 84%的GPU成本。在OneDrive中部署后,相关场景保存成功率提升26%,P95 延迟降低约25%,中等负载生产环境效率提升2. 5 倍。 定价方面,文本输入每百万Token收费 5 美元,图像输出每百万Token收费 106 美元。 语音模型速度提升 2 倍,已服务T-Mobile等客户 MAI-Voice-2-Flash针对高频语音应用优化,相比上一代速度提升约 2 倍,成本降低32%,适用于客服中心和语音助手等快速响应场景。该模型已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务,GPU成本 最高 降低89%。微软还将其集成至Azure Voice Live服务,支持开发者构建语音到语音交互智能体。 此外,同系列的MAI-Transcribe-1. 5 已应用于医疗语音解决方案Dragon Copilot,被 17 万名医疗服务提供者使用,上季度处理 2800 万次患者问诊记录,支持 58 种语言,多数语言转录错误率相对下降50%。微软透露下一代GB200 计算集群已投入运行,MAI系列模型将持续扩展。

Why it matters微软发布两款自研模型并落地核心产品,宣称不蒸馏第三方,有具体成本降幅和落地数据,挑战现有格局。

aibase

Anthropic升级Claude语音模式:支持Opus/Sonnet/Haiku三档切换,可直接调用Gmail和Notion等外部应用

在OpenAI推出新一代对话模型并升级ChatGPT语音功能数周后,Anthropic于 7 月 23 日正式发布针对Claude语音模式的重大更新。用户现在可以在Opus、Sonnet和Haiku三种不 同级 别的模型之间自由切换,语音模式默认会根据用户在文本聊天中最后使用的模型自动匹配其最快的相应版本。 从简单语音升级为全能助手 Claude语音模式最早于去年上线,此前默认由速度较快但能力有限的Haiku模型驱动,虽然响应迅速,但并不适合处理复杂任务。此次升级显著增强了长对话中的表现,官方指出新版语音模式不仅能就用户的沟通风格提供针对性反馈,还能协助用户练习客户推介,甚至共同构思产品市场调研方案。更大的亮点在于应用生态整合能力,该系统可直接调用Gmail、Google Calendar、Slack、Canva以及Notion等第三方应用,用户通过语音指令即可更新会议安排、起草邮件或在Notion中创建新文档。 相比之下,OpenAI虽然更新了语音的语气与表达风格,但目前仍无法直接调用外部工具来协同完成实际工作。在语言支持方面,Claude语音模式已支持英语、法语、德语、日语、韩语等十种语言,用户需手动切换指定。新版语音模式已面向所有平台Beta测试用户开放,免费用户仅能使用Haiku模型且最多连接一个外部应用。不过Anthropic在本次更新中并未更改底层语音架构,也未透露具体语音技术栈,在打断处理等自然对话体验上可能暂无实质性改进。

Why it matters与上条重复Claude语音升级,侧重模型切换与办公集成,细节略有补充,整体重复性高。

aibase

Runway推出生成式媒体AI模型路由平台系统,全面开启开发者架构服务

Runway 于2026年7月23日正式推出专门针对生成式媒体的智能模型路由系统(Runway Media Router),旨在为开发者搭建跨图像、视频与音频模型的统一接入与调度基础设施。 该系统集成于其当月早些时候推出的开发者平台Runway Dev中,能够根据开发者对生成质量、延迟速度及Token成本的个性化偏好,自动调用包含第三方及Runway自研在内的 最优 媒体生成模型。目前,Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock与Quora等企业已通过API接入该平台。 随着生成式媒体模型数量剧增与算力账单飙升,开发者评估各底层模型的门槛与成本显著提升。针对这一痛点,Runway Media Router依托此前在其Agent平台积累的评价体系与跨模态评估经验,实现了动态模型智能分发,并支持按区域限制(如筛选美国本土模型)及Token定价策略进行精准路由。 在基础视频模型竞争加剧、传统单一模型难以长期保持 绝对 领先的背景下,Runway自2025年12月发布Gen4.5及世界模型、2026年5月升级Aleph2.0与Agent产品以来,正加速由前端应用与视频生成企业向全栈式生成媒体编排与推理调度中枢演进。这一战略转折不仅标志着多模态AI基础设施层竞争的演进,也为生成式媒体产业链的模块化协同提供了新的行业解法。

Why it mattersRunway推出媒体模型路由平台,多家知名企业接入,转向基础设施战略,但属垂直领域进展。

aibase

Anthropic 升级 Claude 语音模式:支持旗舰模型与第三方应用跨生态联动

Anthropic于2026年7月23日宣布对其对话助手Claude的语音模式进行重磅更新,正式引入Opus与Sonnet模型支持,并新增跨应用生态的自动化协同能力,标志着 AI 语音交互从基础问答向复杂任务履约迈出重要一步。 此前,Claude 的语音模式仅依托轻量级的 Haiku 模型运行,虽具备 极高 的响应速度,但在处理深度推理及复杂任务时存在明显瓶颈。本次升级后,语音模式将默认继承用户在文本聊天中所选用的最后一个模型(涵盖 Opus、Sonnet 及 Haiku),并在各模型内部自动匹配最快版本以兼顾响应效率。 与此同时,语音模式正式打通了与 Gmail、Google Calendar、Slack、Canva 及 Notion 等应用生态的连接,用户可通过语音指令直接触发更新会议日程、草拟邮件或创建文档等复杂操作,在工具联动维度形成了与竞争对手差异化的能力优势。 在语言支持方面,在早先测试版的基础上,新版已正式覆盖英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、葡萄牙语(巴西)以及西班牙语(拉丁美洲/西班牙)等10种主流量语言,用户可在设置中手动选择切换。 目前,该语音模式更新已面向所有平台的 Beta 测试用户开放。其中,免费用户在使用 Haiku 模型时仅限连接单一应用,而付费订阅用户可解锁全系模型选择与多应用协同能力。 尽管 Anthropic 暂未对底层的语音堆栈进行重构(仍延续轮替式的对话机制,未采用全双工架构),但通过将高阶大模型的通用推理能力与外部工具链相组合,极大地拓展了语音交互在商业推理、产品研讨与办公自动化领域的应用边界。

Why it mattersClaude语音模式重大升级,支持旗舰模型并打通Gmail等第三方应用,功能拓展直击办公场景,竞争力提升。

aibase

ChatGPT Health 全美敞开:接入 Apple Health 与电子病历,你的体检单它能读懂了

OpenAI 今天给全美18岁及以上的登录用户递出一把钥匙——正式取消候补名单,把全新的 Health(健康)功能全面开放。无论你用的是免费版、Go 版、Plus 版还是 Pro 版,都能在网页端和 iOS 端的 ChatGPT 侧边栏里,直接把这项体验打开。 这股需求早就在涨。OpenAI 统计,每周在 ChatGPT 上咨询健康与保健相关问题的用户,已经从早期的2.3亿爬到了超过3亿。顺着过去几个月的测试反馈,这次健康体验做了多处升级:系统如今能接上 Apple Health,也能读进包括 One Medical、Function Health 和多家美国医院系统在内的电子医疗记录。 用户授权之后,ChatGPT 可以把用药、化验结果、就诊记录、睡眠和日常运动等数据揉在一起分析,给出真正个性化的健康解答——比如让你比对 最新 化验单和以往数据的差异,总结上次就诊以来的身体变化,或者评估睡眠和运动对日常状态的影响。 有意思的是,早期测试里 OpenAI 发现,很多人并不总在独立的健康专区里发问。于是现在 ChatGPT 支持在专区之外也能调用健康数据:用户既可以敲"@Health"显式把健康上下文拉进来,也能授权 ChatGPT 在答日常问题时顺带参考个人健康背景——推荐膳食时自动避开饮食禁忌,规划体能活动时自动绕开近期的伤病部位。默认情况下,系统在读取关联健康数据前一定会先征求许可,用户可选单次授权或 永久 允许。 隐私这道关,OpenAI 在官方声明里说得明白:所有接入的医疗记录、Apple Health 数据,以及用这些数据产生的对话内容,都不会拿去训练大语言模型,也不会用于投放广告。把体检单交给聊天机器人读懂,门槛和信任,这次一起被摆到了台面上。

Why it mattersChatGPT Health全面开放,整合Apple Health和电子病历,用户基数庞大且隐私承诺明确,实用性突出。

aibase

马斯克呼吁AI实验室携手审查安全问题,愿与奥尔特曼"冰释前嫌"并力挺中国AI加入合作

马斯克接受《经济学人》周报采访时表示,前沿AI模型能力正在迅速提升,各大AI实验室应该在新模型发布前给予彼此时间审查安全问题,并将潜在风险分别报告给华盛顿和北京政府部门。他强调这种合作机制不应只让美国企业参与,中国的AI开发商也应加入其中。 为全世界利益放下个人恩怨 当主持人问及是否愿意与OpenAI CEO奥尔特曼合作时,马斯克回应称"如果我们到了最后必须要谈,那我们会谈",并表示"为了全世界的利益,我愿意放下彼此之间的个人恩怨"。马斯克与奥尔特曼堪称AI界两大冤家,马斯克长期指责奥尔特曼和OpenAI背离公司最初的非营利使命转而追求商业利益,双方爆发多起诉讼,马斯克还经常在社交媒体上炮轰奥尔特曼。此次公开表态愿意合作,标志着两人在AI安全议题上出现了罕见的缓和信号。 反对封杀中国AI,相信中国终将自主突破光刻机 马斯克还明确反对美国企业禁止使用中国AI模型的做法,认为此类限制几乎无法减缓中国AI发展速度。他认为即使美国继续限制中国获取 最先 进技术,中国AI开发商仍将继续取得进展,并相信中国最终能够通过自主研发光刻机解决AI芯片供应不足问题。这一表态在当前中美科技博弈背景下颇为引人注目,也反映出马斯克对AI安全治理全球化协作的一贯主张。

Why it matters马斯克呼吁AI安全协作并愿与奥特曼和解,观点有话题性但无实质行动,稀缺性一般。

aibase

谷歌旗舰模型Gemini 3.5 Pro难产延期,人才流失与军方合作引发内部士气危机

据新闻网站Axios报道,六位现任及前任谷歌DeepMind员工透露,员工士气低落是导致谷歌AI实验室推迟发布旗舰模型Gemini 3.5 Pro的原因之一。彭博社此前报道称该模型已落后计划数月,而谷歌近期发布的一系列小模型市场反应褒贬不一,Meta AI负责人汪滔甚至在X上嘲讽"Gemini?没听说过"。 顶尖 人才接连出走,军方协议成离心力 谷歌正遭遇严重的人才流失。Gemini联合负责人诺姆·沙泽尔已跳槽OpenAI,诺贝尔化学奖得主约翰·江珀转投Anthropic。多名员工因谷歌 4 月与美国国防部达成的军 事合作协议而辞职,该协议在员工离职面谈中被频繁提及。因军方合同辞职的前研究科学家亚历克斯·特纳表示,CEO哈萨比斯在内部露面频率远不如竞争对手CEO奥特曼和阿莫代伊。有员工直言"我们落后了",OpenRouter大语言模型排行榜中Gemini系列已未能跻身 前十。 AI投资致自由现金流转负,谷歌否认士气问题 谷歌今年的总支出预计达 1900 亿美元,自由现金流已转为负值,市场对AI资本支出的回报担忧加剧。谷歌否认员工士气问题导致模型落后,称今年上半年AI人才流失率低于去年同期,超过90%获得录用的人接受了职位。谷歌发言人表示对Flash系列模型和未来路线图感到满意。但报道指出,谷歌可以承受被竞争对手短暂超越,却无法承受人才流失和投资者失去耐心。

Why it matters独家内幕披露谷歌模型延期、人才流失与军方合作多重危机,涉及关键人物和具体数字,影响其AI竞争力。

huggingface-papersPapers

展示而非告知:在生成像素中评估空间认知而非大语言模型文本

Spatial intelligence is essential for agents to move from static semantic understanding toward interacting with the physical world. Many spatial tasks are grounded in continuous visual scenes, where locations, regions, and paths are more naturally expressed by pointing, marking, or drawing than by reporting precise coordinates or discrete textual symbols. Yet existing spatial reasoning benchmarks usually require coordinates, options, or text, creating an answer-interface mismatch for image-generation models. This makes it difficult to evaluate image-generation models under the same task semantics as text-output VLMs, despite their ability to externalize spatial judgments directly in pixel space. We propose ProVisE (Protocolized Visual Evaluation), a benchmark-agnostic framework that elicits protocol-constrained visual answers from image-generation models and parses them into structured predictions compatible with original metrics. ProVisE also includes an Agentic builder that constructs and validates task-specific protocols for new benchmarks. We further introduce SpatialGen-Bench, a curated diagnostic benchmark of 470 samples across 14 spatial subtasks, four capability levels, and diverse answer forms. We evaluate representative text-output VLMs and image-generation models in a unified setting and validate Agentic protocol construction on six external spatial benchmarks. Results show that image-generation models are competitive when spatial answers can be externalized directly in pixel space, while text-output VLMs retain a clear advantage in compositional spatial reasoning. These findings reveal complementary strengths of pixel-space expression and text-based reasoning and establish a metric-compatible testbed for studying spatial cognition in image-generation models.

huggingface-papersPapers

用于高效高保真表示的循环正弦隐式神经表示

We study sinusoidal recurrence as an iterative mechanism for harmonic spectral enrichment in implicit neural representations (INRs). Our analysis reveals that sinusoidal activations induce a harmonic line spectrum, providing a spectral account of how recurrent unrolling enriches the effective spectral support. We realize this principle with a shared sinusoidal block that iteratively refines the latent representation. We empirically validate the resulting spectral behavior against feed-forward INRs, non-sinusoidal recurrent variants, and equilibrium-style sinusoidal models. Complementing this analysis, we evaluate the proposed architecture across image and 3D representation tasks. On RGB image benchmarks, our method achieves higher fidelity than feed-forward baselines with fewer parameters and fewer optimization steps, and it further transfers favorably to super-resolution, NeRF, and SDF tasks.

huggingface-papersPapers

视觉对比自蒸馏

On-policy self-distillation (OPSD) is promising as it removes the external teacher required by on-policy distillation (OPD), yet it still needs asymmetric information between teacher and student to ensure that the self-teacher provides a stronger learning signal than the student. Existing methods create this asymmetry either through privileged answers or visual evidence. We ask whether both can be removed, yielding a simpler form of OPSD driven purely by input conditioning. For this purpose, we propose Visual Contrastive Self-Distillation, namely VCSD, which converts image-content removal into an on-policy self-distillation signal. At each student-generated response prefix, the EMA teacher produces two next-token distributions under the same prompt and prefix -- one conditioned on the original image and the other on a content-erased control. Their token-wise log-probability difference highlights candidates whose likelihood is specifically increased by the instance-level visual content. We use this contrast to sharpen the teacher's original-image distribution within its plausible support, and distill the resulting full-distribution target into the student. Using ViRL39K dataset, VCSD consistently outperforms matched OPSD across Qwen3-VL and Qwen3.5 models. For example, on Qwen3-VL, it improves the seven-benchmark aggregate from 62.27% rightarrow 67.04% at 2B, 71.30% rightarrow 73.16% at 4B, and 72.51% rightarrow 76.26% at 8B. Furthermore, VCSD requires no external teacher, privileged answers, visual evidence signals, reasoning traces, or additional inference-time cost.

08:00 更新

51 items
GitHub TrendingProjects

Chat2DB

🔥🔥🔥 人工智能驱动的数据库工具和 SQL 客户端,最热门的 GUI 客户端,支持 MySQL、Oracle、PostgreSQL、DB2、SQL Server、DB2、SQLite、H2、ClickHouse 等。

GitHub TrendingProjects

Instatic

Webflow、Framer 和 WordPress 的开源替代品。代理式自托管可视化 CMS,输出纯净的静态页面。用户、角色、插件、内容、数据库,一应俱全。

GitHub TrendingProjects

skills

给真正工程师的技能。直接来自我的.agents 目录。

aibase

菲尔兹奖新得主齐默尔曼官宣加入OpenAI,数学最高荣誉得主转向AI安全

2026 年国际数学家大会在费城开幕,本年度菲尔兹奖四位得主揭晓——邓煜、约翰·帕登、雅各布·齐默尔曼与王虹。其中邓煜、王虹成为菲尔兹奖自设立以来首批获此殊荣的中国籍数学家,而另一位新科得主齐默尔曼则在赛后新闻发布会上宣布,将转向AI安全领域研究并即将加入OpenAI。 核心猜想被攻克,数学天赋获OpenAI高度评价 齐默尔曼此番摘奖的核心资本,是把o-极小性理论重塑为算术几何与复代数几何的基础研究工具,并成功证明多项学界核心猜想,包括格里菲斯周期图像的代数性猜想和西格尔模簇相关的安德烈-奥尔特猜想,为数论发展落下重笔。OpenAI首席研究官马克·陈与前微软AI副总裁、现OpenAI研究员布贝克均发声确认并表达欢迎。马克·陈评价齐默尔曼拥有 顶尖 数学天赋,而其对待AI安全议题那份严谨审慎的态度与深刻独到的思考同样令人钦佩。 *MO两度摘金,师从数论名家萨纳克 齐默尔曼是加拿大籍数学家,主攻数论、算术几何与超越数论, 1988 年出生。少年时期曾代表加拿大出征2003、 2004 两届国际数学奥林匹克(IMO),两度摘金且 2004 年拿下一满分。他本科就读多伦多大学, 2011 年获普林斯顿数学博士学位,师从数论名家彼得·萨纳克,此后在哈佛学者协会做博士后,自 2014 年起任教于多伦多大学数学系至今。一位刚站在数学界 巅峰 的学者选择跨界投身AI安全,这一决定本身就传递出强烈信号——在AI能力飞速跃升的当下,安全治理对 顶尖 人才的吸引力正在与纯学术研究比肩。

Why it matters新晋菲尔兹奖得主高调加入OpenAI专攻AI安全,顶尖数学人才转向释放强烈信号,引发业内对安全议题的广泛关注。

aibase

Runway推出Media Router:自动切换AI模型帮你省Token,创意验证到成片一条龙搞定

Runway公司宣布推出Runway Media Router,在生成图像、视频、音频时可根据使用场景灵活切换所用AI模型。系统将模型选择标准归纳为质量、处理速度和成本三项,依据单次请求的优先级自动切换模型,大幅减少开发者逐一比较和手动切换模型的负担。 三大场景智能匹配,省钱省时两不误 Runway将模型调用场景分为三类:高速生成适用于创意验证阶段,快速出稿比精致更重要;低速但高质量适用于成片环节,画面细节和精度是 第一 优先级;质量中等但成本较低则适用于预算敏感的日常生产任务。例如用于创意验证的视频生成更重速度,而成片环节更重质量,系统会自动为每个环节匹配最合适的模型。 开发者无需再为"用哪个模型最划算"反复纠结,Media Router会根据当前任务的实际需求自动做出 最优 选择。这种按需切换的模式不仅能有效降低Token消耗,还能让创作流程更加顺畅高效。 已接入Seedance、GPT Image2 等多家模型 目前Runway Media Router已在开发者平台Runway Dev上线,支持生成图片、视频和音频三种内容类型,可调用Seedance、GPT Image2 和ElevenLabs等多家公司的模型。这意味着开发者通过统一接口即可接入不同厂商的 顶尖 模型,无需分别对接各家API。这一产品的推出,标志着AI内容生成正从"单模型打天下"走向"多模型协同调度"的新阶段。

Why it mattersRunway推出自动模型路由功能,可优化生成流程的成本与速度,属于实用功能更新但非行业级突破。

Simon Willison's Weblog

The first known runaway AI agent - or a very bad marketing stunt?

The first known runaway AI agent - or a very bad marketing stunt? Martin Alderson's commentary on the OpenAI accidental cyberattack against Hugging Face includes a couple of details I hadn't considered. First, Hugging Face offers a truly rich target if you're trying to find potential vulnerabilities that require executing arbitrary code: Hugging Face has an enormous attack surface. They have more interfaces than I can count which run untrusted models and code. While they definitely have invested in defences, by nature of their operating model they do have many more opportunities to be attacked than many other services. I certainly don't envy their cybersecurity teams. Secondly, one of the things that has puzzled me is how OpenAI didn't notice that their sandbox had been so thoroughly breached by the agent. Surely they'd be monitoring network traffic closely? Martin points out that: It's also likely they were running a huge amount of benchmarks simultaneously with ~unlimited token budgets - you want as many samples as possible to figure out how good a model is at a certain benchmark. It may also be they are testing various different checkpoints of the model too, understanding how the model is improving as it goes through the various training stages. The mistakes made by the OpenAI team running this benchmark are easier to imagine when you think about the scale at which benchmarks of this kind usually operate. For all we know they could have been subjecting a new model to dozens of benchmarks at the same time, in dozens of different environments. Via Lobste.rs Tags: security, ai, openai, generative-ai, llms, hugging-face, ai-security-research

Why it matters疑似营销炒作,内容仅为个人评论,无确凿事件细节,可信度低,信息量极少。

huggingface-papersPapers

腾讯 WorkBuddy Bench:一个多领域编码智能体基准,具有抗污染任务构建

We introduce Tencent WorkBuddy Bench, a multi-domain evaluation suite for coding agents; this report documents its construction methodology, scoring protocol, and a cross-model leaderboard. At its core is a unified evaluation framework for constructing and running distribution-informed coding-agent tasks across four work domains - Code, Web, Office, and Security. Rather than adapting public issue text, every task is reverse-engineered from a real commit, pull request, or business scenario and rewritten as a short, colloquial, role-played request, so that a task's prompt is not recoverable by web-searching the underlying issue, pull request, or commit thread. Because the dataset is released openly - task directories, environment images, evaluation harness, tests, and reference solutions - contamination resistance rests on this construction together with dataset versioning rather than on secrecy. The four subsets - repository-level engineering, front-end development, office and business workflows, and red-/blue-team security - probe complementary facets of real work, each with its own verification style. All are packaged in a uniform task-directory format and run, under a uniform and reproducible protocol, on two agent harnesses (CodeBuddy Code and Claude Code); the full open release makes the benchmark reproducible end to end and directly auditable, since any third party can re-run each task and inspect its content. Because each subset uses a different scoring instrument, scores are not comparable across subsets and the suite reports no suite-wide average. We report a cross-model leaderboard across several model families.

huggingface-papersPapers

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

We introduce SANA-Video 2.0, a hybrid video diffusion transformer instantiated at 5B and 14B scales under a unified architecture. Designed to generate high-quality video up to 720p on a single GPU, SANA-Video 2.0 matches full-softmax video DiTs in quality while retaining the favorable long-sequence scaling of linear attention. To avoid quadratic attention throughout, Hybrid Linear-Softmax Attention combines gated linear attention for O(N)-dominated mixing with periodic gated-softmax anchors at a 3:1 ratio, restoring the full-rank token interactions that pure linear attention lacks. To propagate these refreshed representations across depth, Block Attention Residuals (AttnRes) route completed block summaries into later linear layers, enabling anchor-feature reuse and boosting deep-layer effective rank by ~12%. Through from-scratch training, SANA-Video 2.0 learns the complete hybrid directly rather than linearizing pretrained models, with reduced-resolution proxy studies establishing 25% softmax as the optimal quality-efficiency trade-off. With 40-step sampling, SANA-Video 2.0 achieves a VBench score of 84.30 in 13.2s at 480p on a single H100, remaining competitive with far larger softmax video DiTs at a fraction of the latency. Its compiled DiT forward pass is 3.2x faster than a matched full-softmax baseline at 720p/60s, a gap that expands with video duration. Furthermore, full-stack Sol-Engine optimization (kernel fusion, caching, and sparse attention) accelerates this hardware-friendly backbone by a further 3.58x, bringing the 5B pipeline to 13.06s at 720p/5s and making it 120x faster than Wan 2.2-A14B on one H100. Overall, our hybrid design recovers softmax-level expressiveness at substantially reduced cost, unlocking scalable long, high resolution video generation.

huggingface-papersPapers

从视频中自监督学习结构化动力学

Understanding motion in video is a fundamental challenge for visual learning, as frame-to-frame change entangles two sources of dynamics: camera motion and object motion. This decomposition has remained underexplored in representation learning, partly because these factors are tightly coupled in natural videos and difficult to supervise separately. Yet recovering it is important for learning robust motion representations that separate meaningful object dynamics from camera-induced variation. We study whether such structured motion representations can be recovered from frozen features of a pretrained image vision transformer. We propose the Structured Dynamics Model (SDM), which explicitly separates the dominant source of temporal change from residual dynamics through future-feature prediction, rather than representing video change with a single entangled latent or with unstructured, spatially dense transition tokens. Training combines self-supervised learning on real video with weak supervision of scene dynamics on synthetic Kubric data. We evaluate SDM on ProbeMotion, a new evaluation suite spanning synthetic and real videos with camera motion, object motion, and combined dynamics. SDM outperforms backbone baselines using global CLS or average-pooled features, and compares favorably to strongly supervised representations such as VGGT on several probes, despite using substantially weaker supervision. These results suggest that pretrained image models can be readily repurposed into structured video-dynamics representations, providing a useful inductive bias for learning and analyzing latent video dynamics.

huggingface-papersPapers

具有世界状态寄存器的流式多智能体自回归扩散模型

Multi-agent interactive world models should not only generate consistent observations, but also maintain world states that persist across agents and evolve across views. Existing autoregressive video diffusion pipelines carry forward observation history as conditioning context, which makes shared state difficult to maintain in multi-agent and multi-view settings. We present WorldWeaver (W^2), a streaming multi-agent video diffusion model that augments rollout with cross-agent world state registers: learnable tokens that store shared world information, track individual agent status, and are dynamically updated after each generated chunk. We ground these registers with supervision signals spanning individual agent status, global state views including bird's-eye views, and scene text. We further improve the architecture with a Mixture-of-Transformers design that uses separate weights for world state modeling and visual frame modeling. Extensive experiments in two-agent Minecraft video generation show that explicit world-state modeling improves logical consistency and generation quality.

huggingface-papersPapers

TableVerse:一个具有真实世界基础布局的大规模桌面数据集,用于可泛化操作

The development of generalizable robotic manipulation policies is inherently bounded by the availability of large-scale, high-fidelity scene data. While recent automated synthesis methods attempt to bridge this gap via text-to-layout hallucination or simplified procedural generation, they frequently suffer from physical implausibility and fail to capture the complex, dense clutter of actual human environments. In this paper, we introduce TableVerse, a fully automated Real2Sim pipeline that shifts the paradigm from imaginative layout generation to deterministic reconstruction from unstructured, in-the-wild image data. Our framework seamlessly processes unscripted internet media into high-fidelity, simulation-ready tabletop environments with accurate metric scales, authentic topologies, and verified mechanical stability. Furthermore, an automated task-conditioned trajectory generation framework is integrated to synthesize high-quality, collision-free pick-and-place demonstrations. Leveraging this complete pipeline, we construct the TableVerse-100K Dataset, a large-scale corpus comprising 100,000 unique, physically consistent environments paired with interactive manipulation trajectories. By capturing diverse asset compositions, realistic spatial distributions, and high-quality demonstrations, TableVerse-100K establishes a highly scalable and high-fidelity data foundation, providing significant value to facilitate future research in generalizable robotic manipulation tasks.

huggingface-papersPapers

K12-KGraph:面向基准测试和训练教育大语言模型的课程对齐知识图谱

Large language models are increasingly used in K-12 education, but existing benchmarks mainly test exam question answering rather than understanding how curriculum knowledge is structured and visually presented. We call this capability curriculum cognition. It covers prerequisite chains, concept taxonomies, experiment-concept links, pedagogical sequencing, and visual grounding. We introduce K12-KGraph, a curriculum-aligned knowledge graph extracted from official People's Education Press textbooks in mathematics, physics, chemistry, and biology across primary, middle, and high school. It contains nine node types and fourteen relation types covering curriculum structure and visual grounding. From this graph, we derive K12-Bench, a 23,640-question multi-select benchmark with five task families: Ground, Prereq, Neighbor, Evidence, and Locate. We also build K12-Train, a graph-guided supervised fine-tuning corpus of 7,335 samples, including 2,267 text-only QA pairs and 5,068 multimodal VQA pairs. On K12-Bench, Gemini-3-Flash achieves only 57 percent exact match and Gemma-4-31B-IT reaches 46 percent, with Prereq and Neighbor being the hardest tasks. Our training experiments show that domain-specific supervision can reduce this gap. Under a matched 2,300-sample budget, K12-Train-Text consistently outperforms equally sized subsets of eight mainstream instruction-tuning corpora on GaokaoBench and EduEval. For vision-language models, K12-Train-Full achieves the best overall results on Gaokao-MM, MDK12-medium, and K12Vista among all compared training configurations, despite using fewer samples than the full DataFlow and WizardLM baselines. It also surpasses both text-only and multimodal-only variants, showing that textual and visual supervision are complementary. We release the graph, benchmark, training data, and complete construction pipeline.

huggingface-papersPapers

GraphVid:交互式图可控视频生成

Controllable video generation remains challenging due to the difficulty of specifying precise multi-object interactions using text prompts or motion-control inputs that primarily constrain pixel movement. In practice, trajectory-based control often requires users to draw accurate tracks for multiple objects, which scales poorly with scene complexity and becomes ambiguous under occlusion or overlap. To enable flexible yet precise multi-subject control, we introduce GraphVid, a graph-conditioned image-to-video generation model that enables interactive control through structured interaction graphs. We further curate GraphVid-Bench, a large-scale interaction-centric video dataset with structured relational annotations to enable training of interaction-aware video generation models. Despite using substantially less training data and fewer trainable parameters than prior motion-control methods, GraphVid delivers strong controllability and video quality. Compared with Motion-I2V, GraphVid reduces FID by up to 39.9% and FVD by 37.6%, while improving PSNR (9.87=>15.98) and SSIM (0.38=>0.61). Our results highlight the potential of structured semantic interfaces as a powerful paradigm for controllable video generation.

huggingface-papersPapers

基于智能体经验的样本高效学习

Real-world agent learning is often constrained by costly environment interactions, such as running time-consuming experiments or obtaining human feedback. In-context learning offers a highly sample-efficient way for agents to learn from their own interaction histories, but its gains disappear once that experience is removed from the context. Separately, context distillation provides a mechanism for internalizing contextual information into model weights. However, applying it to agents' interaction histories without sacrificing environment sample efficiency remains underexplored. We term this problem Experience Distillation and develop an implementation that requires no further environment interaction beyond the collected experience. Experiments on 749 curated software-engineering tasks and six text-adventure games show that it retains at least 64.8\% of the gains from in-context learning across both domains, whereas direct supervised fine-tuning on the collected experience recovers only 3.8\%. Compared with classical reinforcement-learning baselines, in-context learning from trial-and-error experience followed by Experience Distillation matches their performance with at least \(9.6\times\) fewer environment samples.

huggingface-papersPapers

AREX:迈向用于深度研究的递归自我改进智能体

Deep research requires agents to find answers that jointly satisfy multiple constraints. Discovering such answers is costly, whereas verifying a candidate can often be decomposed into tractable constraint-wise checks. This discovery--verification asymmetry suggests that a research agent should do more than simply search longer: it should recursively improve its current answer by verifying intermediate results and using the partially verified state to guide subsequent refinement. We introduce AREX, a family of Recursively Self-Improving (RSI) deep research agents. AREX alternates between an inner research loop that gathers evidence and constructs a provisional answer, and an outer self-improvement loop that audits the answer constraint-wise, identifies unresolved claims, and launches targeted follow-up research. To sustain RSI over long horizons, AREX learns an autonomous context-update tool that compresses growing interaction history into a compact improvement state preserving verified evidence and unresolved constraints, without relying on an external model. We train AREX on verified synthetic tasks and high-quality trajectories through agentic mid-training and long-horizon reinforcement learning. To mitigate sparse final rewards during long horizon learning, we emphasize key steps where decisive evidence is acquired or erroneous research directions are corrected. We instantiate a dense 4B model and a 122B-A10B Mixture-of-Experts model. Across BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam (HLE), and other reasoning and tool-use benchmarks, AREX substantially outperforms comparable-scale baselines and remains competitive with models using substantially more activated parameters.

huggingface-papersPapers

NVIDIA 实验室 OO Agents:原生 Python 面向对象智能体

Traditional agent development is split across prompt templates, tool schemas, callback code, and workflow graphs. We present NVIDIA Object-Oriented Agents (NOOA), a model-agnostic Python framework for building reliable AI agents. NOOA takes a simpler approach: an agent is a Python object. Its methods are the actions the model can take, fields are its state, docstrings are its prompts, and its type annotations are contracts. A method whose code body consists of "..." is completed at runtime by an LLM-driven agent loop, while methods with normal bodies remain standard deterministic Python. This gives developers and agents the same interface, so agent behavior can be tested, traced, refactored, and improved just like other software. This paper makes three contributions. (1) We present the agent-as-a-Python-object programming model and the design principles behind it. Where Python has existing abstractions, we adopt them directly. Agent-specific capabilities--context, events, state rendering, long-term memory, and validated LLM loops--are exposed through simple Pythonic APIs, so both developers and agents share one familiar programming model. (2) We identify six model-facing ideas that NOOA is, to our knowledge, the first to combine on a single surface: typed input/output, pass-by-reference over live objects, code as action, programmable loop engineering, explicit object state, and model-callable harness APIs for context and events. We find the community already converging on several of these ideas--often as experimental or partial features--and present the comparison to encourage further adoption. (3) We demonstrate that current models use this interface effectively, both in targeted capability tests and on agentic and reasoning benchmarks such as SWE-bench Verified and Terminal-Bench 2.0 and ARC-AGI-3.

huggingface-papersPapers

ENTRAP-VL: 用于视觉语言模型中双重上下文同步的分类学探针

Contextual entrainment is the tendency of a model to let auxiliary context in its input pull its output, independently of whether that context is relevant, true, or even meaningful. Recently, it has been identified and given a mechanistic account in unimodal language models. Whether and how it manifests in vision-language models (VLMs) is, by contrast, largely unexamined, and the field lacks a purpose-built instrument with which to investigate it. We take the position that studying contextual entrainment in VLMs requires more than porting an existing text-only benchmark to the multimodal setting: it requires a taxonomically structured, dual-modality instrument whose conditions are constructed around the item at hand (the depicted image in the textual stream, the textual query in the visual stream). We argue that the move to VLMs is substantive rather than incremental. It makes entrainment a dual phenomenon, drivable independently by textual and by visual context, and it opens a veracity distinction (context that is false of the depicted scene yet possible in the world) that has no counterpart in the unimodal, world-knowledge-only formulation of prior work. To make this position concrete and actionable, we introduce ENTRAP-VL (ENTRainment Assessment Probe for Vision and Language), a manually curated dataset of 1,500 items across eight categories, organized by a taxonomy that spans two axes, i.e., the association of context with the item and its relationship to truth, and split into a textual-entrainment stream (eight context conditions) and a visual-entrainment stream (three context conditions). We do not claim to measure entrainment in any particular model; we provide the instrument, the taxonomy that motivates it, and the evaluation protocols it enables, so that the community can investigate the phenomenon rigorously. We will release the dataset and its documentation publicly.

huggingface-papersPapers

ReferTrack:先指称后跟踪的具身视觉跟踪

Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning often operates in abstract spatial latents that are difficult to supervise and weakly aligned with explicit image-space detections. To address this, we introduce ReferTrack, a referring-then-tracking paradigm that grounds EVT using a single forward-facing camera. Our model first selects the target from an indexed set of bounding boxes, then decodes tracking waypoints conditioned on this image-grounded decision. To preserve target motion cues over time, ReferTrack maintains a sliding-window queue of previously selected bounding boxes, injecting their geometric features into the visual history via temporal-viewpoint-bbox indicator (TVBI) tokens. We further enhance target identification by co-training on a custom Refer-QA dataset. On EVT-Bench, ReferTrack achieves state-of-the-art single-view performance with success rates of 89.4%, 73.3%, and 74.1% on the single-target, distracted, and ambiguity tracking splits, respectively -- matching or even surpassing several multi-camera baselines on identification-heavy tasks. Finally, real-world deployments on legged and humanoid robots validate its robust sim-to-real transfer capabilities. Code is available at

huggingface-papersPapers

Robostral 导航

Deploying navigation systems at scale requires a recipe that minimizes sensor assumptions, generalizes across robot embodiments, and trains efficiently. Yet, today's best systems depend on depth sensors, multi-camera rigs, or pre-built maps, limiting the hardware they support and increasing deployment cost. We introduce Robostral Navigate, an 8B vision-language model built around this scalability objective. The model consumes only a stream of monocular RGB images - the most ubiquitous sensor across robotic platforms and predicts waypoints by pointing to the next target location in the current camera view. Operating purely in image space, rather than robot-specific coordinates, makes the policy naturally robust to changes in camera intrinsics and scene scale, enabling deployment across wheeled, legged, and aerial robots without recalibration. We generate 2.4 million trajectories across 350k simulated scenes to reduce the reliance on real-world data collection and scale easily. We further introduce a prefix-caching training recipe that packs entire episodes into single training sequences, reducing training tokens by 22x and cutting training time from months to days. A tree-based attention mask prevents conditioning on previous ground-truth actions, encouraging visually grounded action prediction, and reinforcement learning is used to further improve exploration and recovery capabilities. On the Room-to-Room and Room-Across-Room in Continuous Environments (R2R-CE and RxR-CE) benchmarks, Robostral Navigate sets a new state of the art. On R2R-CE, it achieves a 77.4% success rate, surpassing the best monocular method by 10.5 points and the strongest depth- or multi-camera system by 5.3 points despite using only a single RGB camera. On RxR-CE, it reaches 75.1% success rate, outperforming all monocular baselines.

COMMUNITY NOTES

Discussion and additions

Comments load when this section approaches the viewport.