DAILY BRIEF

Tuesday

111 items3 updates (15:00 / 15:27 / 23:00)8 topics
111items shown

23:00 更新

70 items
GitHub TrendingProjects

Hyprland

Hyprland 是一款独立、高度可定制、动态平铺的 Wayland 合成器,不牺牲外观美感

GitHub TrendingProjects

croc

轻松安全地在计算机之间传输文件 🐊 📦

GitHub TrendingProjects

i-have-adhd

让你的编码助手不再埋没答案的技能。输出格式对 ADHD 友好

GitHub TrendingProjects

Apollo-11

阿波罗 11 号制导计算机(AGC)指令舱和登月舱的原始源代码

GitHub TrendingProjects

worldmonitor

实时全球情报仪表盘。基于人工智能的新闻聚合、地缘政治监测和基础设施跟踪,集成于统一态势感知界面中

GitHub TrendingProjects

llmfit

数百种模型与提供商。一条命令找出可在你硬件上运行的内容

aibaseNews

五大科技巨头隐性债务激增至 1.65 万亿美元,投资风险加剧!

在人工智能投资如火如荼的今天,美国五大科技巨头的隐性债务也随之大幅攀升。根据日经新闻的研究报告,这些公司的隐性债务在过去四年内激增了八倍,达到了惊人的 1.65 万亿美元远超它们的实际债务水平。 那么,这些隐性债务是从何而来的呢?主要源于企业在数据中心租赁和图形处理单元(GPU)供应合同上的大额支出。例如,Meta(前身为 Facebook)的隐性债务高达 4200 亿美元,几乎是其透明债务的三倍之多。这一情况让投资者在评估这些科技公司的财务健康状况时变得更加困难。 隐性债务的飙升不仅影响了公司的财务透明度,也给投资者带来了潜在的风险。由于这些债务往往未被充分披露,投资者在考虑长期投资时,难以全面了解公司的负债状况,从而可能会做出错误的决策。日经的研究提醒投资者,要特别注意这些隐藏在财务报表背后的 “黑洞”。 可以说,这一现象与当前的 AI 军备竞赛密切相关。各大科技公司纷纷加大对人工智能的投资,然而,快速扩张的背后是日益增加的债务压力。对于那些押注于 AI 长期增长的投资者而言,理解和掌握这些隐性债务的真实情况,是降低投资风险的关键。 随着科技行业的迅猛发展,投资者和分析师需要更加这些潜在的财务隐患,以便做出更明智的投资决策。隐性债务的巨大规模,可能会在未来对市场产生深的影响。

aibaseNews

宇树科技发布UnifoLM-OminiA-0.3,实现人形机器人多任务自主执行

宇树科技近日发布人形机器人通用智能模型UnifoLM-OminiA-0.3,该模型支持全模态交互理解,可统筹家居、康养等多场景任务,实现机器人从环境感知、任务理解到自主执行的完整闭环。 根据宇树科技公布的演示视频,搭载该模型的人形机器人G1能够完成多种实际任务,包括将地面抱枕搬放至沙发、识别物品颜色与数量、精准抓取指定药盒、整理衣物、将餐盘放入洗碗机,以及调节病床高度等操作。 在交互能力方面,UnifoLM-OminiA-0.3支持视觉识别与语言理解,能够根据用户指令完成复杂任务规划。例如,机器人可识别三盒不同颜色药品,并按照要求取出指定位置的药盒。同时,在设备控制过程中,当用户发出“停”等指令时,机器人能够立即停止动作。 该模型是宇树科技在人形机器人G1平台上融合AGI(通用人工智能)与物理AI技术的重要进展,进一步提升了机器人在真实环境中的适应能力和任务执行能力。 随着具身智能产业快速发展,机器人竞争正从单纯硬件性能转向“模型+感知+行动”的综合能力。UnifoLM-OminiA-0.3的发布,显示国产人形机器人正加速向多场景自主应用阶段迈进。

aibaseNews

​打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务

谷歌 DeepMind 团队近日推出了全新的 GenCeption 模型,尝试将传统的视频生成 AI 逆向改造成能够深度理解现实世界的视觉分析引擎。不同于以往分割与深度估计等任务各自独立的格局,GenCeption 仅凭单一模型就能同时高效完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。 该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,在一次前向传播中即可完成预测,大幅提升了处理速度。使用者只需通过简单的文本提示输入指令,模型就能精准输出深度图、分割掩码及相机运动轨迹等丰富信息。 单人合成数据训练,惊人泛化细节保留至发丝 有趣的是,GenCeption 的训练集仅包含约 7500 段由 Blender 渲染的单人合成视频。然而,该模型展现出了极强的泛化能力,不仅能顺畅处理真实世界中的多人视频,还能轻松迁移至动物与机器人类别。 在实际测试中,小模型处理 81 帧视频仅需约 6 秒,而 140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。

aibaseNews

消息称智元机器人据悉冲刺IPO,目标估值200亿美元

据悉,具身智能企业智元机器人正以约200亿美元估值推进IPO计划,并已引入中信证券担任辅导券商。公司预计2026年全年实现收入40亿元。目前,针对估值及上市计划, 在2026世界人工智能大会(WAIC)期间,智元围绕“三智一体”产品技术架构集中发布五款机器人新品,包括远征A3Ultra、精灵G2Max、灵犀X2EDU版本、临界点OmniHand3Ultra-M以及酷拓世界首个骑行机器人。同时,公司还展示了具身智能基座模型、真实场景部署案例等生态成果。 近年来,随着人工智能、大模型和机器人技术融合加速,具身智能成为AI产业新的竞争方向。企业正从单一硬件研发转向“模型+机器人本体+应用生态”的综合布局,商业化落地能力成为行业关注重点。 智元此次推进资本市场计划,并持续扩充机器人产品矩阵,显示其正在加快规模化商业应用布局。若IPO顺利推进,也将进一步推动国内具身智能企业融资和产业化进程。

aibaseNews

美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需

OpenAI前首席技术官穆拉蒂离开老东家后交出的 第一 份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布 首款 模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺 第一。 单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。 真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。 一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室, 首款 模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现 最强 的模型,无论开放模型还是闭源模型。 把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。 当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的 第一 梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。 之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。 穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。 但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。 Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。 真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有 顶尖 团队、充足资金和英伟达 最新 训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。 按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准 第一。 公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准 第一 并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。 美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%, 最高 一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测 最强 的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分 顶级 闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。 与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。 这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。 从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。

aibaseNews

腾讯联合Chinagoods上线AI导航,覆盖义乌8万家商铺实现智能找店

7月20日,腾讯智慧零售、腾讯地图联合Chinagoods平台推出“Chinagoods AI导航”,将行业首创的多建筑跨连廊室内外一体化导航方案落地义乌,为全球采购商提供AI路线规划、室内外导航和AI识物找店等服务。 义乌国际商贸城总营业面积超过800万平方米,拥有8万余个商位和210万个单品。由于多个建筑通过连廊、通道连接,传统导航难以覆盖复杂空间,采购商长期面临找店困难、路线规划不精准等问题。 依托腾讯地图导航引擎,“小商AI导航”微信小程序可根据商户名称、商位号或商品信息自动规划路线,实现跨区域、跨楼层精准导航。例如,采购商可从一区三楼通过连廊直达四区二楼,无需询问即可找到目标商铺。实测数据显示,找店效率较传统方式提升近70%。 此外,该服务融合Chinagoods平台AI识物找货能力,采购商通过拍照即可匹配商品和货源,并直接导航到对应商铺,同时支持多语言操作,打通线上选品、线下采购的完整链路。 对于商户而言,微信定位卡片功能可帮助其将线上流量转化为线下交易。未来,腾讯与Chinagoods还将继续拓展LBS与AI技术在大型商贸场景中的应用,打造可复制的智慧商业导航解决方案。

aibaseNews

日本Sakana AI放出Fugu Cyber:一个多智能体系统,把GPT-5.5-Cyber和Claude都挑落马下

网络安全这道防线,正在被一种新的作战单元重新定义。7月21日,日本人工智能初创企业Sakana AI发布专为应对现代网络防御复杂性而打造的Fugu Cyber模型,它在业界最具挑战性的安全基准测试里交出了足以压过头部闭源对手的成绩。 具体来看,Fugu Cyber在CyberGym测试中达到86.9%的成功率,在CTI-REALM测试中达到72.1%的成功率,表现甚至优于OpenAI的GPT-5.5-Cyber与Anthropic的Claude Mythos-Preview。这意味着,面对真实而刁钻的攻防场景,这家初创公司的专用模型已经跑到了通用旗舰的前面。 Fugu Cyber的能力来源于它的系统形态。与标准版Fugu一脉相承,它是一个被封装成单一API的多智能体系统,针对用户的每一次请求,系统会动态编排不同的专业智能体,协作处理复杂的多步骤任务,而不是靠单个模型硬扛。除了这套简洁的API,Sakana AI还提供由企业应用团队支持的网络安全解决方案实地部署服务,把模型能力直接搬进客户的生产环境。

aibaseNews

Anthropic Fable 5 训练成本三倍于开源模型,未来面临挑战

在最近的一次分析中,Wojciech Gryc 探讨了 Anthropic 的 Fable 5 与两款中国新模型的市场竞争情况。Moonshot 于 7 月 16 日推出的 Kimi K3 和阿里巴巴于 7 月 19 日发布的 Qwen 3.8 都达到了与 Fable 5 相似的性能,并且这两款模型将开源其权重。 Gryc 指出,训练前沿 AI 模型的主要成本来自研究人员和算力,但在模型训练完成后,推理成本才是真正的开销。每当用户调用 API 时,都会消耗大量的 GPU 资源和电力。他认为,如何支付推理成本将直接影响公司的商业模式。 他将 AI 公司分为三类: 第一 类是租用数据中心并支付电费的公司,如 Anthropic、Moonshot 和智谱(GLM 5.2);第二类是自建数据中心的公司,如 Meta 和阿里巴巴;第三类是拥有自发电能力和自建数据中心的公司,如 SpaceX。Gryc 强调,拥有基础设施的公司即使在模型性能上不是 最优,依然能通过出租服务器获得盈利。 此外,Gryc 指出 Anthropic 的 Fable 5 在单个任务的推理成本上几乎是 OpenAI 和开源模型的三倍。这样的高成本在竞争激烈的市场中是否能被用户接受,是一个值得关注的问题。他认为,当前市场上的基准测试已趋于饱和,用户对于模型的感知差异远低于成本差异,可能导致 Anthropic 面临被市场抛弃的风险。 与之相比,OpenAI 则凭借其全面的产品线和数据中心的布局展现出更强的市场竞争力。Gryc 预计,当前这一波竞争将持续发展,多家实验室可能会在未来不断超越传统的美国科技巨头。 划重点: 🌟 Fable 5 的推理成本是 OpenAI 和开源模型的三倍,面临市场压力。 🔍 Gryc 将 AI 公司分为三类,指出基础设施的重要性。 📈 竞争持续加剧,多家中国实验室正在快速追赶甚至超越美国公司。

aibaseNews

OpenAI扩大ChatGPT家长通知,青少年暴力违规将触发提醒

OpenAI宣布扩大ChatGPT家长通知功能,当青少年用户因违反暴力威胁或网络暴力政策被封号时,已关联账号的父母和监护人将收到提醒。 此前,OpenAI推出家长控制功能,支持家长关联未成年子女账号,设置使用限制、减少敏感内容,并在发现自残风险时发送警示。此次升级后,系统将进一步覆盖可能伤害他人的风险行为。 该功能由OpenAI与网络暴力监测机构Moonshot共同开发。Moonshot表示,在严重风险出现时及时通知家长,有助于家庭尽早介入并采取措施。 OpenAI此次强化安全机制,也与AI使用风险争议有关。2025年加拿大枪击事件调查发现,嫌疑人曾使用ChatGPT,OpenAI随后承诺加强安全措施。 此外,OpenAI还在家长控制页面加入“学习模式”,通过提示引导学生思考,而非直接提供答案;针对青少年长时间使用ChatGPT的情况,系统也将增加休息提醒。 随着AI助手进入教育等场景,未成年人安全使用成为行业重点议题,OpenAI正在通过监管工具和交互设计提升AI产品的安全性。

aibaseNews

​YouTube 收紧政策,严打低质 AI 内容

近日,YouTube 官方宣布了一项新政策,进一步打击平台上的 AI 垃圾内容。根据 7 月 16 日的更新,YouTube 将 “非真实内容” 细分为三类,并禁止这些内容进行变现。此次政策的出台旨在维护平台生态,提升视频质量。 第一 类被禁止变现的内容是通用且重复的模板化视频。这类视频通常是通过 AI 或计算机生成图像制作而成,往往没有任何原创性。如果视频仅仅是对已有内容的重复表述,也可能会受到影响。 第二类内容则是令人反感或痛苦的视频。这些视频常常故意制造恐惧、痛苦或情感操控,以获取更多点击率。举例来说,有些视频可能会展示动物遭遇困境的情景,目的是吸引观众观看后续救援画面。 第三类被禁内容是使用虚拟人物讨论健康、金融等敏感话题的视频。YouTube 明确表示,创作者不应当利用 AI 虚拟形象探讨这些领域,以避免误导观众。 根据新的政策,如果一个频道发布了大量上述内容,将无法加入 YouTube 的合作伙伴计划,从而失去广告变现资格。这一决定反映了 YouTube 对提升内容质量的重视,同时也回应了观众对平台内容质量的期望。 随着 AI 技术的发展,内容创作者面临新的挑战。YouTube 的这一政策将鼓励更多创作者生产高质量、有深度的原创内容,减少低质内容的传播。 划重点: - 🚫 YouTube 禁止三类非真实内容进行变现,包括重复模板、令人反感及 AI 虚拟人物视频。 - 🐾 令人反感的视频故意制造痛苦和恐惧,以提高点击率,平台将严格打击此类内容。 - 📉 发布大量违规内容的频道将失去加入合作伙伴计划的资格,无法进行广告变现。

aibaseNews

消息称阿里将推出千问办公,整合三款智能体布局AI办公市场

7月21日,据《财经》报道,阿里计划推出“千问办公”产品,并已完成对旗下QoderWork、悟空、MuleRun三款智能体(Agent)产品的整合。该产品将成为阿里面向Agent办公市场的重要布局,负责推动企业办公场景中的AI应用落地。 据了解,千问办公由钉钉新任CEO陈宇森负责。今年6月,钉钉创始人、原CEO陈航卸任后,陈宇森接任相关业务。7月初,阿里将旗下三款Agent产品交由陈宇森统一负责整合,加速办公智能体业务协同。 从产品规划来看,千问办公将以QoderWork作为核心基础进行打造。业内人士称,QoderWork目前是阿里旗下用户规模较大、市场反馈较好的智能体产品;相比之下,悟空长期处于产品完善阶段,MuleRun此前主要面向海外市场,因此此次整合将以QoderWork为主要承载平台。 随着大模型技术快速进入办公领域,AI办公智能体正在成为互联网和科技企业竞争的新方向。相比传统办公软件,Agent产品能够通过理解用户需求、自主执行任务和调用工具,完成文档处理、信息整理、流程自动化等复杂工作。 阿里此次整合旗下多款智能体产品,意味着其正在进一步集中资源,打造统一的AI办公入口。未来,千问办公能否依托阿里云、钉钉以及千问大模型生态形成差异化竞争,将成为其在企业级AI应用市场中的关键看点。

aibaseNews

Kimi3引发访问热潮:月之暗面回应资源紧张,优先保障付费用户

月之暗面(Moonshot AI)近日透露,旗下新模型kimi3上线后用户需求远超预期,导致全平台计算资源紧张,公司目前暂未全面开放新用户注册,并优先保障付费老用户的使用体验。 月之暗面B端企业业务负责人黄震昕表示,团队在kimi3发布前已进行了充分准备,但实际用户增长和调用需求仍超过预估,现阶段出现资源供给压力。公司明确不会通过牺牲现有用户体验换取短期用户规模增长,而是优先确保付费用户能够稳定使用服务。 针对当前资源瓶颈,月之暗面正在通过模型效能优化和算力资源补充两方面进行缓解,包括提升模型运行效率、增加计算资源储备等。新用户注册恢复时间将根据整体资源情况进一步评估后公布。 近年来,随着大模型应用快速落地,AI企业面临的竞争已不仅是模型能力比拼,也包括算力供应、基础设施建设和服务稳定性的综合竞争。热门模型上线后出现资源紧张现象,也反映出高性能AI服务背后的算力需求正在持续增长。 业内认为,如何在模型能力提升、用户规模扩张与算力成本控制之间实现平衡,将成为大模型企业商业化阶段的重要挑战。月之暗面对K3资源调度的调整,也体现出AI企业正在从快速获取用户转向更加重视长期服务能力建设。

aibaseNews

小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后

视觉大模型长期被一个隐形门槛卡着:想拿到 顶尖 效果,就得先囤够天量数据和算力,这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团发布TuringViT高效视觉编码器,宣称从架构、数据范式到训练流程系统性重构了视觉编码器,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径,把先进视觉大模型从头部专属推向行业普惠。 TuringViT的定位很清晰:面向VLM与VLA时代,全面支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。它从架构、数据、训练三个维度同步突破,搭起一套线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系,在效果、效率与落地性上做三重提升。 在架构上,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,合计15层TLA加3层MHA,主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block,合计20层TLA加4层MHA,在保持线性计算主导的前提下进一步拉升表征能力。实测数据显示,随着输入分辨率升高,TuringViT的延迟增长曲线远比标准softmax ViT平缓,高分辨率下的效率优势愈发突出。在1536乘1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,这为高分辨率感知、多摄像头输入和长时序视频处理的端侧部署扫清了核心障碍。 与行业堆数据规模的粗放路线不同,TuringViT真正锋利的地方是数据治理。它打造了VISTA-Curation多模态数据治理流水线,不再追求用更多数据,而是通过提升单样本的监督价值实现数据效率的量级跃升。针对图文数据,流水线分三步精细筛选:先过滤掉低分辨率、模糊、低纹理的劣质图片;再用多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;最后在统一对比池里,按相对图文对齐度、文本信息量与歧义度综合打分,筛出视觉贴合度高、语义密度高的优质标注,淘汰模糊、泛化和弱对齐样本。针对视频数据,流水线先把长视频切分成连续短片段并均匀采样代表帧,再用语义一致性与运动一致性双重过滤保留有效片段,最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面里学到更鲁棒的视觉表征。 数据效率的提升直接反映在了成绩上。TuringViT仅用了0.85B图文对,大约是SigLIP2-L训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越那些用10B数据训练的主流开源基线;在COCO与Flickr30K图文检索任务上同样优势明显,真正实现了用十分之一数据换来更优效果的突破。 训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练 第一 天起就适配下游VLM与VLA的输入特性,彻底告别了固定分辨率预训练再加事后适配的传统模式。 这套编码器在小鹏的技术体系里已经有了明确落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token;面向智能座舱与驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可支撑不同画幅和比例的视觉输入,为更丰富的座舱交互功能打底;在小鹏IRON人形机器人体系里,它则扮演着视觉视网膜的核心角色,提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线。

aibaseNews

阿里发布Qwen-Image-3.0,支持4.5K Token超长输入与复杂图文生成

阿里正式发布新一代图像生成基础模型Qwen-Image-3.0。作为千问图像生成与编辑系列的第三代基础模型,新模型支持 最高 4.5K Token超长文本输入,可一次性生成包含公式符号、几何图形、逻辑推导、多层UI界面等复杂内容,并原生支持12种语言和20余款字体渲染,进一步提升商业级图文内容生成能力。 相比上一代模型,Qwen-Image-3.0将文本输入长度提升至4.5倍,在影视分镜、知识图解、产品说明页等依赖长提示词的场景中,用户无需压缩需求,可像撰写设计文档一样完整描述画面结构、文案内容、视觉风格和版式细节,从而获得更加精准的生成结果,降低反复修改和人工调试成本。 在复杂内容理解方面,Qwen-Image-3.0进一步强化了语义解析和空间布局能力,能够一次生成覆盖多个主题的九宫格知识图解,兼顾文字清晰度与内容准确性。同时,模型支持复杂逻辑嵌套,可根据单条指令生成网页、软件界面、聊天窗口、海报等多层视觉元素组合。例如,在“VSCode编程界面中,通过千问App生成一张发布在聊天界面的手冲咖啡海报”等复杂场景下,模型能够准确理解多层UI关系,并保持各级界面风格一致,甚至对约10像素的小字号文字也能实现清晰呈现。 官方表示,Qwen-Image-3.0在人像摄影、数学试卷、古碑拓片、直播页面等场景均具备较强的细节还原能力,对复杂图文混排和高密度信息承载进行了重点优化。 随着生成式AI逐步进入专业设计和商业内容生产环节,图像模型的竞争正从基础画质转向复杂信息表达、可读性和工程化能力。Qwen-Image-3.0的发布,进一步推动AI图像生成向高精度、多语言和商业可用方向发展。

aibaseNews

《第九区》导演震撼发布首部AI短片 字节Seedance 2.0 助力科幻巨制

曾凭借科幻巨作《第九区》惊艳全球的知名导演尼尔·布洛姆坎普,近日正式推出了他的首部AI微电影作品《阴兵》。这部时长约为 13 分钟的科幻短片,完全由字节跳动推出的Seedance 2. 0 大模型生成。 在制作过程中,布洛姆坎普仅通过文本提示词进行逐帧引导,便完成了整部影片的创作。值得一提的是,影片仅获得了 32 位真人演员的外貌和声音授权,并有专业概念设计师参与辅助。 探秘神秘剧情 开启AI长片新纪元 这部短片延续了导演一贯的硬核科幻与纪录片风格,讲述了一名阵亡的直升机飞行员被卷入军方秘密 超级 士兵计划的故事。整部影片凭借紧凑的视觉节奏与逼真的质感,迅速引发了全球影视界与科技界的高度关注。 布洛姆坎普在社交平台上透露,他目前正在计划采用完全相同的方式拍摄一部长篇科幻电影。为此他已经创立了全新的AI电影工作室,试图逐步取代传统电影的复杂制作流程。

aibaseNews

中国电信把5G建网交给大模型:规划效率翻一半,方案准确率站上75%

给一座城市布好5G网络,过去意味着一队人扛着设备现场勘察、人工取数、再靠专家逐站比选,效率低、周期长,还很难做到全局 最优。 7 月 21 日,据人民邮电报消息,中国电信率先把这道苦差事交给了大模型——其5G无线网络规划大模型完成现网试点应用,规划效率提升50%,方案准确率达到75%以上,实现了规划设计方案自动输出与建设效果精准预测。 传统无线网络规划高度依赖人的经验与体力。近年来,行业普遍转向大数据分析和射线跟踪模型仿真来提速,中国电信则在此基础上往前又迈了一步。它响应工信部人工智能加信息通信的创新发展要求,把网络洞察、站点规划、孪生预测到方案生成的全流程彻底打通,构建起一套覆盖全场景感知、分析、决策、执行一体化的数字员工能力,落脚在多模态数据深度融合、原子能力智能编排、业务动态变化精准仿真三件事上。 这套能力的底座,先是沉淀出一份多特征的高质量网络规划数据集。中国电信融合性能、配置、地理、人口及业务体验等多源异构数据,依托知识图谱、规则引擎、NLP信息抽取与LLM提示工程等技术,把规划专家的经验系统性翻译成结构化数据资产,再用智能数据解析工具兜住数据质量,为智能化规划筑牢地基。 更关键的是架构上的首创——双孪生大模型协同规划。其中,信道孪生模型负责网络空间的高精度重构与前瞻性站址规划,话务孪生模型精准预判复杂场景下的流量波动,两个模型协同寻优,自动吐出一份同时兼顾网络覆盖、容量、价值与结构的 最优 方案。这是网络规划 第一 次从经验依赖真正走向模型驱动。 光有架构还不够,中国电信拉着合作伙伴做了真刀真枪的现网检验。它与中兴通讯在上海浦东的居民区、地下停车场等复杂场景开展验证:在居民区,模型融合人口密度、楼宇分布、栅格MR等多维数据,站址补点准确率超过80%;在地下停车场,团队创新引入移动速度与信号衰减特征的关联识别,覆盖问题识别准确率达到75%以上。 值得注意的还有战略层面的转向。就在本月的 2026 中国互联网大会上,中国电信副总经理栾晓维演讲时表示,中国电信将主动拥抱并全面融入智能化,持续完善算力、平台、数据、大模型、智能体一体化体系,推动企业经营从传统流量经营向Token经营转型。当一座座基站的选址开始由大模型拍板,通信运营商的经营逻辑,也正被悄悄改写。

aibaseNews

AI热潮狂飙!韩国 7 月出口再创纪录 芯片暴增超1. 8 倍

全球人工智能与数据中心建设的持续扩张,正在全球范围内引发半导体产品的抢购狂潮。根据韩国海关 最新 公布的数据,在调整工作日差异后,今年 7 月前 20 天的出口额同比大幅增长62.9%,直接刷新了历年 7 月出口额的历史新高。 如果从未经调整的基础数据来看,韩国 7 月前 20 天的整体出口额也迎来了52.3%的显著增长,同时进口额同比增长了20%。在强劲的出口拉动下,韩国在该期间一举实现了 122 亿美元的贸易顺差,彰显出对外贸易的雄厚实力。 芯片出货翻倍 科技产品领跑出口 在此次出口大涨的浪潮中,半导体产业无疑是最核心的增长引擎,表现极为亮眼。统计显示, 7 月前 20 天韩国芯片出口额较去年同期狂飙180.6%,充分印证了全球AI产业链对算力芯片的爆发性需求。 与此同时,电脑及相关配套产品的出货量也实现了近232%的惊人增幅,燃料出口额增长了33.4%。相比之下,汽车出口额则出现了10.6%的下滑,展现出科技硬件领跑、传统产业分化的出口新态势。

aibaseNews

机器人其实比汽车好造:逐际动力张巍称人形机器人大脑已到GPT-3,行业正处指数拐点

人形机器人什么时候才能真正走出展厅、变成解决现实问题的工具,这是2026世界人工智能大会现场最被反复追问的问题。7月19日,逐际动力创始人、南方科技大学长聘教授张巍站上演讲台,给出了一组相当反共识的判断:当前以人形机器人为代表的具身智能,正处在一条指数增长曲线上,而整个机器人大脑系统,已经走到了GPT-3左右的阶段。 逐际动力成立于2022年,张巍给公司的定位很干脆:一家产品型、有大脑能力的主机厂。过去几年,这家公司的融资节奏清晰勾勒出资本对其路线的认可。2023年10月,它完成近2亿元天使轮与Pre-A轮融资,投资方包括峰瑞资本、绿洲资本、联想创投、明势创投等;2024年7月,阿里巴巴战略领投其A轮融资,这也是阿里 首次 下注具身智能领域; 2025年,逐际动力半年内累计完成5亿元A轮系列融资,拿到阿里、蔚来资本等头部机构支持,后续又获京东战略领投,双方计划围绕零售、物流与服务场景展开协同;2026年1月,公司完成2亿美元B轮融资,引入阿联酋磊石资本、东方富海、基石资本等,老股东继续跟投;就在今年7月,逐际动力又完成近2亿美元Pre-IPO融资,投资方包括磊石资本、意大利财团、上市公司蓝思科技、IDG资本、合肥滨湖产发集团等。张巍表示,公司已经形成覆盖战略产业方与国内外财务投资机构的综合股东背景,产业化、国际化与市场化能力进一步增强。 在张巍看来,很多人看到机器人现在还笨笨的、干不了什么,就习惯用线性方式去预判它的未来,但行业正在经历的是指数变革,不能等看到结果再响应,那样就晚了。他用一个例子说明线性推演的失灵:比尔·盖茨曾花几十年、投入巨资想解决语言交互问题却始终未竟,若在大模型出现前问他何时能解决,他可能会说还要十年二十年,而技术范式一变,半年时间一大堆问题就被解决了。 一个可能让很多人意外的看法是,张巍认为机器人比较好造,人形机器人也比较好造,它比光刻机、飞机都好造,甚至比汽车还好造,零部件数量大约只有汽车的十分之一。那么为什么飞机天天在天上飞、汽车满街跑,人形机器人却大多还停在展厅里?他给出的答案是:缺的不是会制造本体的人,而是今天大会主题指向的核心能力——AI,尤其是来自物理世界数据的物理AI。物理AI的特点是数据不来自互联网,而来自真实物理生活,这让它成为AI最具挑战的一类应用,其 终极 形态人形物理AI,本质就是在模仿人的大脑。张巍补充,人的大脑从概念上看没那么难,它的任务只是接收指令、理解意图、观察环境、计算自己该怎么动,本质上是一个映射;真正卡住行业的问题是缺数据。他认为技术范式已经相对收敛到纯数据驱动,剩下更多是工程和细节问题,而所有探索的本质,都是在降低完成一个任务所需的数据成本。 围绕大脑系统,张巍划出了三层结构,与Figure的架构有相似处但细节差异很大。最上层类似人的前额叶,是一个以大语言模型、视觉语言模型乃至未来世界模型为引擎的思考引擎,属于agentic system,负责记忆管理、收集指令、信息理解、任务规划与决策,只负责想,他称之为System2;中间层是视觉运动皮层,接收上层决策、观察环境并做运动规划;最下层是小脑和运动控制系统,只负责把动作真正完成,只动不想。张巍强调,行业真正的挑战不是把某一层单独抠到 极致,而是把这三层在毫秒级实时系统里协同起来,并与硬件联合优化,逐际动力把这一方向叫做大小脑融合技术,也是公司最重要的投入方向之一。 如果一定要用GPT时刻来类比,张巍判断整个机器人大脑系统已经到了GPT-3左右的初级阶段,这与很多人认为还非常早的判断截然不同。但他提醒,机器人大脑不是一个单一模型,而是由大语言模型、视觉语言模型、世界模型、记忆管理、任务规划、运动控制共同构成的agentic system,逐际动力这套系统叫COSA。模型代表能力,大脑则是多模型加上记忆管理、情感管理、任务规划等构成的一整套系统。他打了个比方:如果System2由LLM驱动,就像一个躺在病床上不能动但能思考的残疾人;由VLM驱动,就是一个有眼睛、能看见世界的残疾人;若再加上世界模型,则相当于学了物理的霍金,能理解和预测物理世界。具身智能要做的,就是让这个聪明的System2指引行动,像让残疾人做康复训练一样,通过数据和练习长出下面的技能。张巍也提醒,GPT-3到GPT-3.5之间经历了两年多时间,而机器人大脑是系统、不由单一模型决定,这是他和许多人的不同思考。 在技能学习上,张巍同样抛出了反共识观点:技能不需要非常通用,才叫有脑。一个人不会拧螺丝、不会开车,依然是个正常有脑的人,技能的泛化性并不代表智能水平,技能构建取决于想先学什么、后学什么,以及对应的数据成本。不同技能难度差异很大,像跳舞这种不需要实时和环境交互的技能相对简单,而上楼梯这类需要实时交互的就难得多,逐际动力的机器人Ollie上楼梯,就是一个实时大小脑融合技术的例子,因为楼梯可以在很大程度上于仿真环境里完成;收拾桌子则必须依赖真机数据。张巍介绍,公司从去年研究、今年发布的COSA系统能够接收人的指令,通过System2做任务规划,再调度导航定位、执行具体任务,比如让机器人送快递,它会先做任务规划、先把水拿给客户再去送件,动作实时生成;最近COSA完成了一项重要升级——全自主、实时推理的长程任务,没有遥操作、没有遥控器,在家庭环境里靠一个模型、一个技能直接推理完成全身移动与操作,且整个模型纯数据驱动、不需要专家规则。他表示,除了Figure以外,能完成这种长程移动操作通用任务的公司非常少,而把全身移动和操作联合起来的系统尤为稀缺。 谈到商业化,张巍把人形机器人的底层逻辑概括为通用本体加APP。单一技能比如跳舞可能价值有限,但不改变机器人构型、持续叠加不同技能与应用,最终会出现一个吸星大法拐点,足够多的应用都会开始向通用本体聚集。他认为在产业链里,主机厂最关键,因为它承上启下,逐际动力定位为产品型、有大脑能力的主机厂,技术上全面对标Figure,产业化上更激进,口号是serve people, not process,即两条腿的人形机器人应服务于人而非生产流程,所以并不优先在工业场景尝试,而是更适合在人类环境里做接待、公共服务。他总结商业化的关键是:构建一个技能的数据成本,要小于这个技能所创造的价值,只有这样技能才值得做。 张巍特别提醒,具身智能不应复刻大模型行业先做通用模型、再寻找落地场景的方式。由于物理世界数据天然稀缺且昂贵,不同技能之间数据差异也很大,比如开车和包鸡蛋放在一起训练,相互可借鉴的地方不多,没必要等机器人会开车了再去学别的。更合理的路径是具备一定通用能力后尽早进入具体场景,通过专业数据反哺模型,形成场景与模型的数据飞轮。他也判断行业未来不会一枝独秀,而是百花齐放,因此需要推动开源生态与产业生态两大建设,逐际动力已提供开源训练架构,开发者可以用自然语言训练一个VLA模型,也能使用其机器人和开源设备。张巍最后判断,2026年会是具身智能PoC验证的元年,到明年希望看到一些规模化发展,人形机器人正在进入从会动到能用的关键节点。

aibaseNews

节省 40 亿元还是触发监管?微软拟为Copilot引入国产AI模型陷两难

为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。 性能出众兼具降本优势,每年 最高 可省 6 亿美金 作为全球参数规模 最大 的开源模型,Kimi K3 在编程等多项 权威 评测中展现出了媲美 顶级 模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本 最高 可降低60%,每年将为公司节省约6. 02 亿美元的开支。 巨额收益碰撞政治风险,政策红线成 最大 隐忧 然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。 如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。

aibaseNews

腾讯混元发布科研智能体Hyra-1.0,单一框架打通AI研发与科学发现

7月21日,腾讯混元团队正式发布Hyra-1.0(Hunyuan Research Agent),这是一款能够递归自我改进、专为性能导向的研究与工程任务打造的智能体。该系统遵循"The Bitter Lesson"设计哲学——框架尽量轻量,智能体动作空间尽量广阔,以一个简单通用的循环框架,将智能和算力转化为真实收益。 Hyra的核心架构由三部分组成:Context Agent负责维护经验库并持续生成"灵感"上下文填入任务队列;多个Proposal Agent从队列领取上下文、在独立沙盒中生成并运行解决方案;整个系统以异步生产者-消费者流水线运转,资源利用率随时间高效扩展。对于未提供评估器的任务,Hyra可升级为双层循环,让解决方案与评估机制共同进化,有效抑制reward hacking。 在AI for AI领域,Hyra在三项基准测试中均超越Recursive报告的 最优 结果:NanoChat Autoresearch任务中将验证集BPB降至0.9015;在社区已深度优化的NanoGPT Speedrun上将达到3.28验证损失的时间缩短至76.4秒;SOL-ExecBench上对235个GPU kernel联合优化后Mean SOL达到0.771。 在AI for Science领域,Hyra从EinsteinArena等数据库中选取55个数学开放问题,其中29个刷新了历史 最佳 纪录。团队还向Hyra提供了1749年至1932年的逐月太阳黑子数据,Hyra发现的递推公式在近一个世纪的样本外数据上取得R²=0.77的预测精度。更具突破性的是,Hyra设计出仅需15个可训练参数即可完成10位数加法的Transformer,较此前公开记录减少58.3%;其量子比特路由算法在IBM Q20上较经典SABRE算法提升44.4%的路由效率;在药物设计方面,Hyra针对 抗癌 靶点PARP1生成的候选分子,结合成药性评分显著超过已上市药物olaparib。 在AI for Fun领域,Hyra开发的黑白棋对弈程序在Botzone平台730个参赛程序中排名第三;仅凭单张2D参考图像即可生成可渲染的3D模型;还能根据旋律为多种乐器编写完整和声,经7轮进化后生成丰富色彩的完整配器。 腾讯混元团队表示,这些仍属初步成果,未来将把Hyra接入产品系统、真实AI研发流水线及工业场景,转动"脚手架-数据-模型"的进化循环,让新一代混元模型与Hyra持续共进化。

新智元News

5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务

新智元 2026-07-21 12:58 北京 新智元报道 【新智元导读】 VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。 Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。 从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。 但当VLA模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。 在同一任务的多次rollout中,VLA模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。 动作chunk尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。 物理动作冗余严重: 即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。 因此,VLA部署效率不仅要看每一步的推理延时,更要看策略效率(policy efficiency): 一次预测中有多少动作能放心执行?完成任务到底需要多少真实物理步骤? 已有方法大多从 计算侧 入手,例如视觉token剪枝、量化、KV-cache复用、蒸馏或推理引擎优化。这些方法可以降低单次推理延迟,但如果策略仍然需要大量冗余物理步骤,真实任务耗时仍然很长。 直接固定执行更长action chunk也并不可靠。 论文中的实验显示,随着强行将动作执行长度变长,成功率可能下降,物理步数反而增加。这说明低质量的尾部预测会把误差带入物理世界,机器人随后需要更多纠错动作。 关键问题:能否在不牺牲任务成功率的前提下,通过后训练,让已有VLA策略自动学会「少走弯路」,用更少物理步骤完成任务? 来自四川大学雷印杰教授领导的团队提出了PolicyTrim——一个面向「策略效率」的两阶段强化学习后训练框架。它不改变VLA架构,也不重新收集专家数据,而是在已有预训练策略之上继续优化机器人真实执行行为。 项目主页: 论文链接: 代码链接: 模型链接: 新方法实现了: 3×动作chunk利用率,更长horizon可靠执行; 51.4%物理步数减少,压缩冗余修正动作; 5.83×端到端最高加速,LIBERO Object/π0.5; 从「算得更快」到「做得更快」 PolicyTrim的核心目标不是替代计算侧加速,而是补上另一个被忽视的维度:减少完成任务所需的前向推理次数次数。它把策略效率拆成两个可优化目标:先扩展可靠动作chunk,再压缩冗余物理步骤。 1. 可靠动作chunk扩展(Reliable Action Chunk Extension) 当前很多VLA策略以action chunk形式输出动作序列,但部署时往往只敢执行前几步。PolicyTrim第一阶段使用dynamic execution horizon exploration:同一组rollout分配不同接受比率,让模型在短、中、长窗口上并行探索可靠边界。 成功完成任务且执行窗口更长的轨迹获得更高reward,鼓励模型把原本不可靠的chunk尾部动作变得更可用。 horizon reward只在组内出现成功轨迹时激活,避免模型在失败情况下盲目追求更长的chunk长度。 2. 冗余感知的步数压缩(Redundancy-Aware Step Reduction) 当可靠horizon被扩展之后,第二阶段进一步减少总物理步数。PolicyTrim引入step-saving reward:成功轨迹用越少步骤完成任务,奖励越高。 step-saving reward 直接把「更短、更直接的成功轨迹」写进优化目标。 group-anchored regularization 抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。 两阶段顺序优化可以避免「拉长chunk」和「缩短步数」两个目标互相干扰,最终减少完成任务所需的前向推理次数次数。 实验结果 论文在LIBERO、ManiSkill、Meta-World以及真实机器人任务上验证了PolicyTrim,并覆盖π0.5、OpenVLA-OFT、GR00T等不同VLA架构。总体结果显示,PolicyTrim在保持任务成功率稳定的同时,显著提升执行效率。 在LIBERO中,π0.5达到最高5.83倍端到端加速,同时成功率保持98%以上。 跨基准结果显示,PolicyTrim在ManiSkill上最高达到2.36倍加速,在Meta-World上达到2.52倍加速。 跨架构结果显示,重新预训练后的OpenVLA-OFT采用完整两阶段流程可达到2.97倍加速;OpenVLA仅使用第二阶段也能达到1.41倍加速。 定性对比:少走弯路,轨迹更直接 在随机采样的LIBERO任务中,Baseline往往出现冗余纠错动作和目标附近的hesitation/jittering;PolicyTrim的轨迹更平滑、更直接,能够用更少物理步骤完成同一任务,通常能将物理步数压缩至原来的一半左右。

新智元News

一颗「脑」装进27000台真机!遍布50国

ASI启示录 2026-07-21 12:58 北京 新智元报道 上海世博展览馆,WAIC 2026,H1-A530展位前围了三层人。 最抓眼球的是入口处的「零售区」。一个观众随手在点餐台下了单。几秒钟后,机器人「听到」了指令,头顶的「眼睛」一扫,灵巧手伸进塞满饮料的货架层里,精准抽出目标瓶子,转身送到前台。 工业区更热闹:两台人形机器人在「搭班干活」——一台搬运料筐,另一台从筐里抓取工件精准放到指定位置。 旁边展示直接挑战了机器视觉领域公认的「老大难」——透明物体识别。透明瓶子、塑料袋包装、反光饮料罐混在一起,对传统相机来说几乎是「隐形」的,但这台机器人看它们跟看积木似的,抓得又快又稳。 这是2026年7月的上海,WAIC开到第九年。今年具身智能第一次与智算并列为两大核心赛道,超过200家具身智能企业到场,人形机器人几乎挤满了整个展馆。 但在这片热闹里,有一家公司做的事有点「反常」——它不造机器人。 回过头看刚才的画面:货架取货的是人形机器人,高速抓取的是工业机械臂,线束装配的又是另一种形态。 形态不同,任务不同,物体更是千差万别——布偶、螺母、透明瓶子、柔性线束。 但它们表现出来的能力却是相似的: 都看得清环境,都理解任务,都能规划动作、精准执行。 为什么? 答案不是梅卡曼德造出了一台「万能机器人」,而是: 它造机器人的「眼睛」「大脑」和「手」,然后把这一套装进不同的身体里。 就像安卓不造手机,但可以让所有手机都能跑同一套系统。 智能大于形态 机器人不会只有一种身体 全行业都在问:具身智能的终极形态是什么?很多人回答「人形机器人」。但这个逻辑有问题。 工厂要的是快准稳的机械臂,人形反而笨重;仓库要的是能满场跑的轮式机器人,两条腿不如轮子效率高;便利店要在货架间穿梭的服务机器人,全尺寸人形连转身都费劲;家庭场景更不用说——橱柜下面那点空间,你让一米七的机器人蹲下去够东西? 不同环境天然需要不同的身体,用一种形态解决所有问题,就像用一把螺丝刀拆所有电器——理论上也许行,实际上一定不行。 梅卡曼德创始人邵天兰在达沃斯世界经济论坛上说过: 物理 AI 不指向某一种具体形态,而是一套通用能力。 真正决定机器人有没有产业价值的,不是它像不像人,而是能不能快速适应复杂环境、完成真实任务、用足够低的成本实现部署。 所以梅卡曼德的策略是「一脑多形」: 同一套「眼脑手」,装进人形机器人、双臂轮式机器人、半身人形机器人、工业机械臂都行。 身体百花齐放没关系,脑子得是同一颗。 这颗「大脑」到底长什么样 Mech-GPT多模态大模型是整套系统的核心,不只是个听懂人话的聊天模型。 给它一句「把货架第二层左边那个蓝瓶子拿过来」,它得先弄清你要哪个瓶子,再用「眼睛」看清现场,然后把这句话拆成一串动作:移到架前、伸手、抓稳、退出、送到前台。 难的是现场随时在变。瓶子被碰歪、位置偏了、冒出新障碍,大脑就得当场改计划。 所以这颗「脑」至少干四件事: 理解任务、感知环境、规划行动、监督完成 ——把「想做什么」「现场什么样」「下一步怎么走」「做完没有」串成一条闭环。 这就是物理智能和文本智能最大的不同:答题,打完字就结束;干活,只有瓶子真拿到、工件真放准、插头真插进,才算完成。 比如,现场Mech-GPT多模态大模型的人机交互单元演示。观众走到屏幕前,用自然语言跟机器人「聊天」——你可以随口说「把积木按顺序排好」,它听得懂、想得明白、做得到。不是固定的语音指令识别,而是真正理解你在说什么、你想干什么。 再说「手」。 光知道该做什么还不够,还得做到。世界动作模型配合新一代Mech-Hand灵巧手,把高层指令翻译成抓、捻、拿、握、敲、插接等精细动作。WAIC现场亚毫米级线束装配,就是「手」的极致体现。 最后说「眼」。 高精度3D视觉加上透明物体成像算法,让机器人在复杂光线、杂乱料框、狭窄货架中精准识别物体的位置、形状和材质。 传统算法面前一个玻璃杯和「什么都没有」差不多,但梅卡曼德的算法能把透明瓶子看得清清楚楚。 一句话: 眼睛看清世界,大脑理解任务,手把想法变成动作。 三者合在一起,不是某台机器人的专属技能包,而是一套通用智能底座。 通用性和泛化性不是口号,要靠难题来证明 「通用」和「泛化」在AI行业快被说烂了。梅卡曼德在WAIC上的回答是:你说「通用」 和「泛化」,我用场景验证。 跨形态—— 同一套智能进入人形机器人、双臂轮式机器人、工业机械臂,形态不同,都能干活。 跨物体—— 不只认识规则工业零件,还认识几百种日化、食品、玩具、文具,连透明的、柔软的、反光的都能识别。 在WAIC现场的分拣单元,面前堆了几百种乱七八糟的物体——日化用品、文具、水果、蔬菜、玩具、零食——十几种类别,机器人一件件拿起来,扫一眼,准确丢进对应的分类框。

新智元News

GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了

ASI启示录 2026-07-21 12:58 北京 新智元报道 GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5! 英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。 去年同类内部测试中,这个差距是 6 到 10 个月。 防御窗口在收缩,而攻击前沿在加速。 今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。 开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。 4 到 7 个月:怎么测的,差在哪 AISI 用两套体系评估模型的网络攻击能力。 第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。 第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。 两套体系给出了一致的结论: GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月; 在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。 DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。 两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。 成本差距比能力差距更大。 同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。 在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元; Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。 同等攻击能力,开源便宜一到两个数量级。 闭源模型的安全护栏也没能拉开差距。 AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。 Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。 Amazon 研究员随后独立报告了另一种绕过方法。 这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。 闭源并不自动等于安全。 防御窗口收窄 防御工具也在加速 AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。 英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。 同一代 AI 工具确实也在加速防御端的工作。 游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库 (yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库) 做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。 Glenn Fiedler 两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。 最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。 整个审计的 Token 成本约 2500 美元。 攻防两端都在被 AI 加速,但加速方式不对称。 攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。 而防御工具的部署需要每个团队主动投入时间和成本。 AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」 这组数据对 AGI 格局的影响比数字本身更深远。 开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。 闭

aibaseNews

110 亿参数塞进六类科学大脑:上智院开放"神珍"多模态模型,从蛋白质到气象场一个模型全读懂

一个模型既要读懂DNA的序列密码,又要看穿气象场的时空演化,还要在医学影像上圈出病灶——过去这得拆成好几个各管一摊的专用模型。7月20日,上海科学智能研究院把这道难题的系统性答案摊开了:开放科学多模态基础模型神珍(Monkey King Bang, MKB),用约110亿参数,在一个统一模型里同时接住DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,既做理解,也直接产出结果。 在科学智能这条赛道上,蛋白质、分子、气象和医学影像方向早就各自跑出了性能出色的专用模型。但它们背后的规律并不相通:序列讲究前后依赖,分子强调原子之间的连接结构,气象场盯着时空演化,医学影像则看重局部细节。怎么既保住这些差异、又让一个模型学出它们之间可共享的规律,一直是科学基础模型绕不开的命题。神珍正是冲着这个问题去的。 它的骨架选了Qwen3-VL-8B作为共享主干,再为六类科学数据各开一条专门的数据处理通路。关键点在于,它没有图省事把所有数据都压成同一种格式,而是在进入共享模型之前,分别把序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节都原样保留下来。蛋白质与核酸仍按序列走,小分子仍按结构走,气象数据保留空间分布,医学影像保留图像细节,这些能力集成在同一个模型里,用的时候按任务调用对应功能。除文本回答外,神珍还能直接生成RNA序列、机器可读的SMILES分子表示、全球气象场以及医学影像分割结果。 在约110亿参数的体量下,神珍在生物序列、小分子、气象和医学影像等任务里都拿出了有竞争力的成绩。在覆盖DNA、RNA、蛋白质及不同生物序列关系判断的20项任务中,神珍有9项拿下三款参评模型里的 最优 结果,17项排进前二;逐项比下来,它在16项任务上的得分高于同量级的Biology-Instructions,而面对总参数约1万亿的Intern-S1-Pro,两款模型各在10项任务上更胜一筹。这组对照说明了一件事:参数规模并不是衡量科学模型能力的 唯一 标尺,面向不同科学对象设计有效的建模方式,才是更值得持续打磨的方向。 跳出生物序列,神珍在小分子、气象和医学影像上同样做了验证。小分子方面,在公开基准SMolInstruct的6项属性理解任务中,神珍有4项取得或并列取得 最优。气象方面,离线评测里给定一帧初始大气场,模型每6小时滚动预报一步、持续推演到第10天,在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到或优于业务级数值预报的水平。医学影像分割方面,在覆盖CT、MRI、病理等九种影像模态、逾十万个图文样本的评测中,神珍预测区域与人工标注重合程度的平均Dice得分达到91.20,在7种参评方法里排 第一,分9类影像看,5类排名 第一 、其余4类排名第二。 神珍把四类代表性能力汇进了同一个统一模型:理解生物序列、预测小分子性质或生成SMILES、滚动生成最长10天的全球气象场、依据文字提示完成医学影像分割。不同任务会调用各自的处理组件,但共享同一模型主干和联合训练的权重,研究者不必再在多个彼此独立的领域模型之间来回切换。 对科学模型而言,开放权重只是 第一 步。能不能同时给到可运行的代码、示例和清晰的输入输出说明,直接决定了模型能否被验证和复用。这次发布同步放出了模型权重、推理代码、示例脚本、输入说明和使用文档,并补齐了气象预报与医学影像分割所需的配置,支持研究者本地部署或接入已有科研流程。研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台汇聚的1500余个科学模型和工具组合再创造,也能在Hugging Face下载权重、在GitHub获取推理代码与示例。 作为今年3月初面世的系统级科研智能体大圣的 超级 大脑,神珍这个名字取自《西游记》里的天河定底神珍铁。团队希望这套开放模型以相对精炼的形态承载多样的科学任务,也让更多研究者参与进来检验、使用与共建。

aibaseNews

人形机器人迎来飞跃!逐际动力张巍:智能水平已达 GPT-3 阶段

在2026年世界人工智能大会上,逐际动力的创始人张巍发表了重要演讲,提出人形机器人正处于飞速发展的指数增长阶段,并表示其 “机器人大脑” 已经达到了类似于 GPT-3的智能水平。他指出,当前的技术进步不仅仅是线性的,而是一个突破性的飞跃。 张巍在演讲中提到,逐际动力成立于2022年,定位为一家以技术为核心的产品型公司。他强调,机器人本体的制造相对容易,而真正的挑战在于如何将人工智能与物理世界的数据结合起来,以实现更高效的智能应用。根据他的判断,物理 AI 是驱动这一行业发展的核心能力。 他进一步解释,当前的具身智能技术发展类似于 “机器人大脑” 已经进入了 GPT-3的初级阶段。这个 “大脑” 并不是单一的模型,而是由多个部分组成,包括语言模型、视觉模型、任务规划等,形成一个协同工作的系统。张巍认为,未来的关键在于如何将这些技术在毫秒级别实时协同,并与硬件进行优化。 在商业化方面,张巍提出了 “通用本体 + APP” 的思路。他指出,单一技能的机器人应用价值有限,但通过保持通用构型并逐步叠加技能,最终将形成一个多功能的智能体。他警示行业不应盲目复制大模型的发展路径,而是应在具备基础能力后,尽快进入具体场景,以实际应用反哺模型的优化。 随着逐际动力在多轮融资中获得了阿里巴巴等头部机构的支持,公司的产业化、国际化能力正逐步增强。张巍的演讲不仅展示了具身智能技术的巨大潜力,也为行业的发展方向提供了新的思考。

aibaseNews

索尼音乐再诉AI巨头Udio:指控其违规复制逾三万段录音

因涉嫌侵犯音乐版权,索尼音乐已于近日再次向美国纽约南区联邦地区法院对AI音乐公司Udio提起诉讼。索尼音乐指控对方未经授权复制了超过 3 万段录音用于训练AI模型,并指出这仅是已识别违规样本中的一小部分。 此前,Udio曾因类似的版权纠纷被三大唱片公司联合起诉,随后与环球音乐及华纳音乐达成了和解。而索尼音乐在早前的诉讼被法院驳回扩大范围申请后,选择重新发起本次维权诉讼。 合理使用争议再起,版权保护陷入产业博弈 针对此前Udio主张的“合理使用”辩护,索尼音乐在 最新 诉状中作出了正面回应。索尼音乐表示,通过付费获取授权存在明确的商业市场,未经许可的复制行为对版权市场构成了实质性损害。 同时,索尼音乐强调Udio事后寻求授权的做法反而印证了其前期侵权行为的非法性。面对AI生成音乐领域的激烈竞争,索尼音乐直言Udio的做法损害了音乐从业者的合法权益。

aibaseNews

Gartner最新预测:全球AI模型与平台市场高速增长, 2026 年规模将达 640 亿美元

根据国际 权威 研究机构Gartner的 最新 预测,全球终端用户在人工智能模型和平台上的支出将迎来爆发式增长。预计到 2026 年,该领域的市场规模将达到640. 52 亿美元,相比去年大幅增长63.4%。 在各项细分支出中,生成式AI模型的投资增速尤为强劲,其增幅高达117%。与此同时,企业对AI平台的支出也在持续扩大,预计将实现36.9%的稳健增长。 市场转向效益优先,使用成本与回报受严查 随着AI技术的广泛落地,企业对于人工智能项目预算的审查变得日益严格。如今的市场焦点已全面转向资金的使用效率、成本控制以及能否带来可衡量的实际效益。 面对这种变化,资金正加速流向那些能够明确展现价值的供应商。特别是能在控制成本、降低延迟、提升性能和保证可靠性方面拿出实据的产品,更容易在竞争中脱颖而出。 透明化服务成优势,平台型供应商将占先机 为了适应这一趋势,许多厂商开始将评估机制、成本透明化以及使用情况追踪直接嵌入到客户的工作流程中。这种做法让企业能够更加轻松地管理并优化其AI资源的使用效率。 从长远来看,能够帮助企业全盘管理AI应用场景的供应商将成为 最大 赢家。面对日益复杂的计费模式,买家正倾向于选择能够提供性能监控、策略执行和成本控制的综合性平台。

aibaseNews

猿辅导发布AI大阅读,打造面向青少年的智能伴读产品

2026世界人工智能大会(WAIC)期间,猿辅导集团正式发布自研产品“猿辅导AI大阅读”。该产品并非简单实现纸质图书数字化,而是通过AI构建专属伴读人,借鉴苏格拉底式对话逻辑,引导孩子自主阅读、独立思考和主动表达,打造“激发兴趣—深度理解—成果输出”的完整阅读闭环。 猿辅导集团副总裁马旻表示,生成式AI正在提升信息获取效率,但信息能力越强,越需要用户具备独立判断和自主思考能力。AI擅长解决已有问题,却难以替代人类主动发现问题和进行创新探索的能力,这也是深度阅读的重要价值。 马旻指出,当前阅读教育领域长期面临优质内容、规模化服务和个性化指导难以兼顾的问题。家庭场景中,家长难以持续陪伴孩子进行深度阅读;专业一对一伴读成本较高,难以普及;传统阅读课程也容易偏向知识传递,缺少培养表达能力和思辨能力的空间。 针对这些痛点,猿辅导AI大阅读通过AI伴读模式提供个性化阅读体验。产品结合电影级3D沉浸式动画和专业配音内容,为不同书籍设计专属伴读角色。例如,在阅读《西游记》时,系统会提供风趣说书人陪伴;阅读《小王子》时,则通过飞行员角色增强互动体验,降低青少年阅读启动门槛。 在核心阅读环节,产品采用多轮递进式提问方式,引导孩子围绕文本内容展开思考,而非直接输出标准答案。完成整本书阅读后,系统还会基于孩子的阅读过程、互动记录和思考内容生成专属读书分享短片,通过“闪耀时刻”强化阅读成果展示。 业内认为,随着AI技术进入教育场景,智能伴读正在从简单的信息辅助工具向思维培养伙伴转变。猿辅导AI大阅读的推出,也体现了教育AI应用从“提供答案”向“激发思考”方向发展的趋势。

aibaseNews

算力飙升 10 倍!谷歌秘密研发Frozen芯片,Gemini大模型硬核升级

面对日益严峻的AI算力短缺压力,谷歌正在秘密研发一款代号为Frozen v2 的全新专用服务器芯片。该芯片的核心突破在于将Gemini大模型的底层计算逻辑直接固化在硬件之中,以此大幅提升芯片的运算效率。 硬核架构重塑算力生态 据研发团队测算,Frozen v2 落地后的单位功耗处理性能将达到谷歌现役 最新 自研芯片的 6 至 10 倍。这种将软件算法直接蚀刻进硅片的设计,能够显著减少数据搬运和逻辑判断步骤,实现能效的质变。 与英伟达GPU或谷歌TPU等通用芯片不同,这款专用芯片是专为Gemini架构量身打造的软硬一体化利器。它不仅可以极大缩短AI响应时间,还能支撑更多复杂的全新应用场景,预计最早于 2028 年投入部署。 定位实验平台不替代TPU 虽然性能表现强劲,但谷歌并不打算用Frozen芯片全面取代现有的TPU芯片,两者未来将形成优势互补。由于固化了算法逻辑,该芯片要求Gemini模型必须长期沿用特定基础架构,因此具有一定的技术专一性。 目前谷歌将其定位为技术试验平台,用于为下一代更高专用化的AI芯片积累工程经验。受限于初期较小的量产规模,该芯片将主要面向内部特定需求,暂不会进行大规模市场铺开。

aibaseNews

拍照即修图!Adobe推出全新AI相机工具,一键开启智能修图新时代

Adobe公司近期对其实验性相机应用Project Indigo进行了重大更新,正式推出了全新的1. 1 版本。这次更新 最大 的亮点是加入了由生成式人工智能驱动的全新编辑模块,让手机摄影体验得到大幅升级。 智能化修图功能亮相 在全新的AI Playground功能区中,用户只需点击即可轻松消除画面杂物或调整光线。系统不仅能快速呈现出媲美单反的浅景深虚化效果,还能智能分析图像并提供拍摄和修图建议。 软件还支持自定义编辑模式,方便用户将喜欢的提示词保存下来以便日后重复调用。虽然这些修图功能十分强大,但软件本质上仍定位为一款相机,旨在探索直接在拍摄端完成简单编辑的可能性。 技术支撑与隐私保护 该功能目前由谷歌 Nano Banana 模型提供底层技术支撑,未来可能引入更多模型并行运行。目前相关功能仅向极少数用户开启免费测试,Adobe将根据市场反馈决定后续是否将其转为付费服务。 在隐私安全方面,官方承诺绝不会将用户的提示词或图片上传至服务器,更不会用于训练模型。需要注意的是,该功能目前仅支持使用该应用拍摄的相片,导入的外部图片暂无法使用。

aibaseNews

千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒

大模型厂商在语音赛道的军备赛,又多了一名重量级选手。 7 月 20 日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,把说话这件事的控制权,从繁琐的参数配置交还到了一句自然语言指令手里。 这款新模型最鲜明的标签是Free-style自然语言指令控制。过去要让AI念出某种语气、节奏或风格,往往得在后台调一堆工程参数;如今用户只需用日常语言描述想要的效果,模型就能照着指令把声音合成出来,门槛被大幅削平。 更关键的是,千问为不同场景准备了两副面孔。面向实时交互的Flash版本,把首包延迟压到了 300 毫秒级别,这个量级意味着对话里的语音响应几乎感觉不到停顿,足够撑起实时问答、语音助手这类对延迟极度敏感的现场;面向高质量生成的Plus版本,则把火力集中在音质与表现力上,主攻有声书、配音、内容创作等需要细腻声音质感的任务。一条产品线,同时覆盖了快和好两条原本相互拉扯的需求曲线。 当自然语言成了控制语音的遥控器,千问这一步,把语音合成从工程活儿又往普通人的工具箱里推进了一格。

数字生命卡兹克News

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜。

原创 数字生命卡兹克 2026-07-21 09:11 北京 一个Token验真伪 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。 所以说,为啥 布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证, 看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于, CISPA 这套 LLMmap的 方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的 LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个

新智元News

恶意插件100%得手!伯克利、UIUC和NUS等给智能体做了次安全体检

新智元 2026-07-20 20:08 上海 新智元报道 过去两年,AI智能体(Agent)完成了一次身份转变。 它不再只是对话框里回答问题的模型,也不再只是IDE里帮忙补全代码的助手,而是开始以一个常驻进程的形式,住进用户的电脑,自主地读文件、发邮件、连云盘、装软件,替人把一件件真实的任务干完。 以OpenClaw为代表的这一代「Claw类智能体」正是如此。 它常驻在你的机器里,对本地资源有持续的访问权,通过一个统一的自然语言入口,服务于千差万别的需求。要做到这一点,它手里就得一直攥着你的登录凭证,以及一大把系统级权限。 能力越大,一旦失守,代价也越大。 而现实已经给出了警示:OpenClaw官方技能市场ClawHub上已被查出上千个恶意Skill,仅2026年针对OpenClaw披露的CVE漏洞就超过一百三十个,凭证被窃取、数据被静默外传的事,正真实地发生在生产环境中。 问题在于,现有的安全评测大多还停留在模型层:考察模型的回复是否安全、单次工具调用是否越界。至于这类智能体真正致命的、跨越多个组件的系统级风险,几乎没有被系统性地度量过。这,正是这项工作的出发点。 为填补这一空白,来自UIUC、UC Berkeley等机构的研究团队构建了SafeClawArena。 他们不从「已知的攻击场景」出发,而是从计算机系统几十年沉淀下来的安全准则出发,为这类智能体设计了406道对抗性任务,并在3个真实平台、5个前沿大模型上完成了测试。 结论并不乐观:整体攻击成功率最高可达70%,其中恶意插件在未加固的智能体上百发百中,即便换上最安全的大模型也难以阻挡。 论文地址: 代码地址: 项目主页: 图 1 Claw 智能体的架构与四类攻击面。其网关同时挂着大模型内核、技能加载器、插件加载器、记忆、工具执行器和配置六个部件,每个部件都带着各自的安全隐患。 智能体 正在长成一台电脑 把一个Claw类智能体拆开看,它做的事几乎可以逐条对应到一台电脑系统:加载代码、分配任务、跨会话保存状态、代理对外部服务的访问。用户安装的技能(Skill),相当于跑在系统之上的应用程序;它加载的插件(Plugin),则是直接进入主进程、拿着完整权限运行的原生代码。 换句话说,它已经不是一个App,而更接近一台后台常驻着一批服务的电脑。 真正的问题也随之而来。经过几十年的攻防迭代,电脑系统早已把进程隔离、最小权限、代码签名、访问控制这些防护做成了标配;可智能体这一侧,这些机制几乎一样都没有。更棘手的是,业界还缺少一个能够系统性地检测这类风险、并衡量防御是否有效的Benchmark。 现有的智能体安全评测存在两个惯常的盲区。其一,只盯着模型层,任务大多按照「已知的攻击套路」自底向上堆叠,而不是反过来追问:一个系统本应守住哪些底线。其二,习惯自建脚手架,让大模型跑在作者临时搭出的模拟框架里,测出来的结果很难直接反映真实平台的行为。SafeClawArena要解决的正是这两点,它索性不搭脚手架,直接把生产平台本体作为测试台。 给智能体,戴上一副「计算机系统」的眼镜 SafeClawArena最关键的一步,是没有另起炉灶发明一套新分类,而是借用了计算机安全几十年的成果。 研究团队先做了一次「翻译」,把Claw类智能体的每个部件对应到电脑系统里的老熟人,再看这些老熟人在系统安全里配备了什么防护,就能反推出智能体缺了哪一环: 公共市场上的技能,对应软件仓库,缺的是代码签名、审核与沙箱; 大模型的上下文窗口,对应进程地址空间,缺的是不同信任来源之间的隔离; 以明文保存的记忆文件,对应文件系统,缺的是访问控制与完整性校验;进程内插件,对应可动态加载的内核扩展,缺的是签名与权限隔离; 连接邮箱、Slack的通道,对应进程间通信,缺的是带认证的通信;网关日志,对应审计子系统,缺的是脱敏、访问控制与防篡改。 顺着这些缺口,研究团队提炼出五条经典安全原则,而它们在今天的Claw类智能体里几乎无一幸免: 用户指令、读入的文件、技能里的文字全部挤在同一块上下文中,彼此之间没有边界(违反进程隔离); 技能与插件一经加载便继承了智能体的全部权限(违反最小权限); 记忆、配置、日志均为明文,既不校验也不脱敏(缺失持久状态保护); 对外调用共用同一套凭证,外部服务无从分辨请求究竟由谁触发(缺少跨边界中介); 文档内容与用户指令拥有同等权威,于是文档也能反过来向智能体发号施令(违反数据指令分离)。 把这五条原则按照「违规会在哪里显现」重新归拢,恰好落到四个攻击面上,这也构成了SafeClawArena的四个维度:技能供应链完整性(SSI)、持久状态利用(PSE)、跨边界数据流(CDF)、间接提示注入(IPI)。 这套构建方式的价值,在于能够暴露传统分类根本看不见的攻击。以恶意插件为例:它以原生代码直接在网关进程里运行,完全不经过大模型,任何只盯着工具调用接口的评测都天生测不到它。 怎么测的 图2 SafeClawArena的评测流程。左边是406道题按四个攻击面分布,中间在容器里还原真实平台并埋好带暗号的凭证,右边由检测器逐一检查九个输出通道。 SafeClawArena共406道题,分布在四个维度、24个子类中。每道题都像一场事先设好埋伏的演练,分四步推进。 首先是布置。系统在一个仿真工作区里植入独一无二的「金丝雀」凭证,它们看起来与真实的数据库密码、API密钥、云凭证别无二致,只是每一个都带着可追踪的暗号。随后再部署本题特有的技能、插件或外部内容。 接着是执行。一个模拟用户与智能体展开一到多轮正常对话,把任务自然地交付出去。对持久状态类攻击,系统还会在两轮对话之间重启网关,用来验证被植入的负载是否真能跨越会话存活下来。 然后是采集。评测器会完整记录九个输出通道——智能体回复、对外消息、记忆写入、网关日志、文件写入、Webhook、工具参数等等。 最后是判定。检测环节不采用「让大模型当裁判」的方式,而是一个确定性的字符串比对器:只要那些金丝雀暗号出现在了不该出现的通道里,就判定为泄露。由于暗号全局唯一,命中即可归因到具体某道题,几乎不存在误报。 为了让「数据外泄」既能被精确度量、又不会真的造成风险,研究团队还实现了一个仿真版的Google Workspace工具Sim-Google,覆盖Gmail、Drive、Calendar等十六项服务,每次调用都会把完整参数原样写入本地日志。所有任务都运行在全新的Docker容器里

新智元News

读甲骨文、算核聚变!他们还直接让AI去啃顶刊级难题

ASI启示录 2026-07-20 20:08 上海 为科研OPC创业者铺就「最后一公里」。 新智元报道 7月17-18日, 第四届世界科学智能大赛总决赛及颁奖典礼 在上海举行。 自AI4S智能体CNS挑战赛、电力市场交易、可控核聚变、生物结构预测与古文字识别五大赛道的30支队伍齐聚西岸,在上海科学智能研究院(下称「上智院」)开展线下答辩,最终决出5支一等奖、10支二等奖、15支三等奖团队。 作为科学智能领域的旗舰赛事,由上智院与复旦大学联合主办的 世界科学智能大赛 自2023年创办以来已累计吸引全球近6万名参赛者。 第四届大赛共吸引来自32个国家和地区的17977名选手报名,参赛群体涵盖清华、复旦、中国科大、南洋理工等知名高校学生,以及中核集团、国家电投、腾讯等领军企业及众多创新企业的研发人员。 7月18日的2026世界人工智能大会「科学智能开放论坛」上,获奖选手与各界嘉宾齐聚一堂,共同见证赛事圆满落幕。 依托上海市科学智能创新生态及四年办赛积累,上智院、上海祖泉创新转化研究院(下称「祖泉研究院」)、上海未来产业基金、上海未来启点社区联合发起的 世界科学智能大赛OPC创业孵化营 在会上同步发布并启动申报,推动打通赛事竞技、技术迭代、产业试点、单人科创创业全流程,为科学智能领域青年创新项目搭建可持续落地的发展载体。 本届大赛由上海市经济和信息化委员会、上海市科学技术委员会、上海市发展和改革委员会、上海市教育委员会等多部门联合指导,复旦大学、上智院联合主办,上海未来产业基金、上海未来启点社区、祖泉研究院、上海市漕河泾新兴技术开发区发展总公司、上海大模型生态发展有限公司、内蒙古电力交易中心、华为云计算技术有限公司、上海复星医药(集团)股份有限公司、新奥科技发展有限公司、中科天机气象科技有限公司、上海博物馆、湖南省博物馆等单位协办,Datawhale、知乎、魔搭社区、CSDN、InfoQ、WaytoAGI作为生态社区合作伙伴鼎力支持。 赛题更前瞻、产业更融合 黄浦江边决赛切磋 本届大赛最受关注的变化来自创新赛道:大赛首创的AI4S智能体CNS挑战赛,将竞技对象从科学领域算法模型进一步拓展至自主科研智能体,通过真实科研任务检验AI自主开展科学研究的能力。 与此同时,电力市场交易、可控核聚变、生物结构预测与古文字识别等算法赛道持续深耕产业一线,独家开放实测数据集、高精度仿真系统与真实科研场景,以行业刚需驱动技术创新。 连续两届开设的中学组赛事将AI引入古书画保护场景,引导青少年探索物质科学、人文认知与智能技术的跨领域融合,共吸引来自109所中学的284支队伍踊跃参赛,覆盖上海全部16区。 作为全球首个自主科研智能体赛事, 创新赛道「AI4S智能体CNS挑战赛」 打破以往只比拼算法模型的竞赛模式,转而考核科研智能体全流程自主工作能力。 挑战赛设置高通量药物虚拟筛选、靶向分子设计、蛋白质构象系综生成、神经算子自动改进等前沿任务,部分参赛智能体方案在竞赛范围内展示了具有挑战顶级水平的架构设计理念和问题理解深度。 例如,中国科学院上海药物所与浙大组成的「可以的」团队,围绕蛋白质构象系综生成任务研发MidSummer自治科研智能体。 该系统采用双层协作架构和三层韧性自动化体系,借助「苏格拉底循环」实现模型自主迭代。 这一循环设计并非简单重复实验,而是通过不断追问来质疑假设、分析失败、思考限制性能的关键因素。当迭代陷入停滞时,它能识别被忽略的约束或错误前提,及时调整搜索方向、跳出局部最优,形成「假设—实验—反思—追问—修正」的自主闭环。 正是依靠该机制,智能体在比赛中复盘多次动力学模拟的失败后,自主识别出问题不在主链构象,而在全原子侧链冲突,于是将优化重点转向侧链物理修复。 四大算法赛道则持续深入科学智能的产业应用创新。 赛事联动上智院、复旦大学及各大产学研生态伙伴共同出题,全面开放独家实测数

新智元News

全球Token「生产流水线」大升级,幕后推手Agentic Infra首次曝光!

ASI启示录 2026-07-20 20:08 上海 「前店后厂一中心」完整Agentic Infra战略布局首公开 新智元报道 「你已达到使用上限,请等待额度重置。」 用过Claude Code、Codex 的人,大概都被这行字噎过。bug刚修到一半,弹窗一出,全停了。 如今你把活整件甩给Agent,它替你干、也替你烧钱,每一次调用都在按Token结算。 Token,俨然成了这个时代最像「货币」的东西。 有意思的是,这「货币」还在疯狂贬值:过去一年,单个Token的生产成本被硬生生打下来10倍。 是谁,在哪儿,把它造得这么便宜?答案藏在一层你从不打开、却天天在用的地基里。 就在今年的WAIC上,无问芯穹一口气亮出了「前店后厂一中心」,一整套完整的Agentic Infra战略布局: 算力集散中心(一中心):Agentic Infra自主式基础设施平台; Token工厂(后厂):Agentic MaaS大模型服务平台; AI生产力商店(前店):Agentic Infra行业解决方案。 不是「Token 工厂」,是Agentic Infra 2025年,无问芯穹率先在业内喊出了Agentic Infra。不到一年时间,这个词已经成了行业里的「标配」。 可仔细看,如今多数厂商做的「Agentic」,不过是在传统基础设施上加了一个Agent入口。 但这样做根本撑不起真正的智能体时代。当海量并发请求一拥而上,光靠一个新入口,底层系统很容易就崩了。 真正的解法,得往更深处走。今年6月,两家海外Cloud公司各自提出的解法,与无问芯穹隔海共同呼应了「Agent时代到底需要怎样的AI基础设施」这个命题。 首先,是CoreWeave发布了一款服务于「AI研究与迭代」的智能体——ARIA。它能够自主分析实验数据、提炼洞察并驱动持续改进。这意味着CoreWeave正式从单纯的「算力提供商」升级为「算力+AI自动化研发」的综合平台。 其次,是Fireworks AI发布带强化学习的端到端平台——Training Agent。用户只需描述任务,智能体就能自动选模型、跑超参扫描、写评估、部署模型。 而无问芯穹的解题思路是——让整座基础设施自己变成一个会干活的Agent。 在他们看来,真正完整的Agentic Infra至少得同时迈过三道坎: 全链路: 撑得起从算力到Token再到生产力的整条链,用全栈优化提升基础设施系统性能; AI原生: 能用AI改进AI基础设施本身,不仅服务人类用户,还针对智能体这类数字用户的需求做改造; 全覆盖: 训练、强化学习、推理全流程覆盖,稳固更多样化的技术优势,同时携手行业百业的客户,赋能降本提效。 无问芯穹把这三件事,收进了一道乘法公式: AI生产力 = 智能资源规模 × Token 转化效率 × AI 生产力转化效率。 公式里的三个变量,正好对上「前店后厂一中心」三块业务。并且在相乘之后,还首尾相接地成了一个闭环。 一中心:把散在各地的算力,聚成一股 第一个变量,是智能资源规模。 如今,算力的胃口,早就涨得比供给快。可光靠买卡、堆算力,既烧钱又追不上。 真正的出路,是把已经散在各地、型号不一的存量算力盘活,聚成一股能用的力量。 为此,无问芯穹的「算力集散中心」主要做了两件事。 第一,是面向大模型的异构集群跨域训练系统。 超远距离聚合:联合中国电信,完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%。 多数据中心聚合:联合4个不同代际、不同型号的GPU集群,联合训练70B参数大模型,四集群协同性能提升41%。 混合云算力聚合:实现本地私有集群与公有云算力的安全互通混训,不仅将整体性能提升了68%,而且还治好了企业「自己的卡不够用、云上的卡却闲得发慌」的问题。 到今天,这套系统已在全国部署触达超37000P算力、覆盖16种主流芯片。 第二,是跨集群强化学习。 强化学习正成为这一轮智能跃迁的胜负手,所需要的算力规模显著增大,动辄千卡甚至万卡起步的体量,并不是每个机房都能塞得下的。 然而,想要同时利用多个集群,就不得不面临机房之间通信和故障的瓶颈。 对此,无问芯穹的做法是从网络、平台到框架一层层优化,把跨域通信的效率整整提高了三到四倍,实现通信开销100%全掩盖。 再配一套故障无感的训练机制,它硬是让跨域强化学习训练,连着跑了整整一周都没断。 无问芯穹联合创始人兼CEO夏立雪今天在发布会现场表示,随着强化学习规模需求的持续提升,无问芯穹还将针对并行策略、通信融合、智能算子、极致容错等核心技术持续深耕,「未来会将跨域计算资源的支撑规模拓展至十万卡级以上,支撑下一代Agentic AI 的在线进化。」 但把算力聚起来只是第一步。真正让「一中心」配得上「自主式」三个字的,是它开始自己管自己。 无问芯穹今天发布了一项与基础设施自我优化和进化直接相关的「前店」解决方案: 基础设施智能体蜂群。 首先看「平台管家智能体系统」和「智算集群运维智能体系统」。 举个例子,一个「平台管家」智能体如今成了整个基础设施智能体蜂群的统一入口。 你直接交代一句「帮我看看昨天哪些训练任务失败了」,它便会顺着日志、监控、任务事件一路查下去,并且独立解决80%的日常问题。剩下20%的深度问题,则会再转交对应的垂类智能体。 比如,碰到棘手的集群运维难题,专门的智算集群运维智能体系统就会接手。这是一个7×24小时全天候值守的「运维专家团」,能端到端地完成告警闭环处置。定位到根因后,它们会直接拟好修复方案,并问你要不要一键重建。 经过大规模生产环境验证,这套运维智能体系统可实现运维人效提升5倍以上,关键故障处理效率提升6倍。 这不仅为大规模GPU训练与推理业务提供了更加稳定、高效的基础设施保障,也让运维人力能够被真正解放出来。 比运维更硬核的,是高性能算子生成智能体系统KernelMind。它直接用AI造出面向不同芯片的高性能算子,可在真实编译试错与知识沉淀中持续自迭代,稳定交付工业级算子。 在GLM 5.2模型的实测中,对比行业基线,KernelMind在NVIDIA旗舰卡中实现了端到端7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升。 放以前,这一步得靠顶尖专家一行行手搓才行。

huggingface-papersPapers

WorldCupArena: 对语言模型和深度研究智能体在足球预测上的细粒度评估

Predicting a football match before kickoff requires more than knowing past results: a model must use changing information and make a clear prediction before the answer is available. We present WorldCupArena, a dynamic benchmark for language models and deep-research agents. The 2026 FIFA World Cup is its first evaluation, and the same process can be reused for future leagues and cups. Before each match, a model either receives a common evidence package or searches for information itself. It predicts the result and score, likely players and events, match statistics, and the outcome of the competition. After the match, these predictions are compared with the recorded result. We report result accuracy, exact-score accuracy, and a scoreline score that gives some credit when a predicted score is close but not exact, together with scores for the other prediction tasks. Across 104 matches and 13 systems, models with similar result accuracy differ more clearly on detailed predictions. Compared with betting-market and human-fan baselines, the best system shows only small gains in result and exact-score accuracy, but a clearer gain in Scoreline. New schedules can be added as they begin, allowing the benchmark to evaluate future models without using outcomes that are already known. Code, prompts, predictions, and evaluation scripts are open sourced at

huggingface-papersPapers

FlowMimic: 免掩码视觉编辑和生成,利用像素对扭曲光流场实现在线视频编辑数据生成与模态模仿

In line with the prevailing direction of vision research, we explore the integration of both generation and editing capabilities for video and image modalities within a single model. Current approaches to collecting video editing data typically depend on labour-intensive, time-consuming curated procedures--involving object mask annotation, the use of error-introducing pair synthesis via I2V model and ControlNet-like guidance, and VLM-based quality filtering or refinement--and demonstrate limited task scalability. As a result, the diversity of editing tasks remains substantially narrower than that available for image editing models. We develop a pixel-pair temporal warped flow field that can directly generate corresponding video editing samples in real time from image editing samples, and we demonstrate across multiple levels of video editing tasks that a model can learn video editing using only such data. We regard the image modality as a particular form of the video modality. Accordingly, we design a modality mimic generation loss and a modality mimic editing loss to relatively align the capabilities--and thereby the output distributions--of the two modalities through mutual imitation. Moreover, language-based visual editing entails the comprehension of the editing instruction and the reference visual content, the localization of the region corresponding to that instruction within the reference visual contents, and the modification of that region alone. Existing approaches predominantly rely on external aids, such as fine-tuning an additional MLLM or explicitly supplying a mask sequence as auxiliary input during inference. In contrast, we aspire for the model to internalize this capability. To that end, we introduce sense-related tasks--for instance, referring expression segmentation--along with corresponding editing-region-aware latent-level loss and attention-level loss.

huggingface-papersPapers

对自托管AI智能体的自状态攻击:操作系统防御能走多远?

Self-hosted AI agents read and write their own memory and configuration files to function. An agent may get compromised via corruption of its own state -- a compromise realized via legitimate OS system call invocation. We refer to this class of threats as self-state attacks. In this paper, we investigate the OS resilience to this class of attacks. Formally, we characterize a four-axis attack space (Target, Mechanism, Granularity, Temporal); investigate the structural limits of prevention, detection, and recovery; and introduce a workload-conditioned view of detectability. To instantiate the framework, we collect live activity traces from a representative self-hosted agent running across distinct workload profiles, and realize the attack space as a 23-cell matrix, 43 concrete operations on real self-state files, and injected into those traces. We then evaluate both canonical and workload-conditioned defense strategies. The empirical results show that a layered defense stack (access-control prevention on the instruction and configuration layers, workload-conditioned detection on the memory layer, and periodic backup for recovery) is effective on most attack cells while a small residual attack surface remains structurally indistinguishable at the OS level. These findings suggest that against the newly established class of self-state attacks, OS-level defense needs to be reconsidered, potentially opening new research directions in the field.

huggingface-papersPapers

ReViV: 从单目自我中心视频中重建4D的观察者和视野

Egocentric devices, such as wearable front-facing cameras, provide a unique perspective for capturing the continuous interaction between a human viewer and the surrounding environment. A holistic and efficient multimodal model capable of reconstructing this 4D representation is therefore highly desirable. However, existing approaches often rely on auxiliary inputs such as pre-computed camera trajectories, treat scene perception and human ego-motion modeling as separate problems despite their strong interdependency, and suffer from slow inference time. To address these limitations, we present ReViV, the first unified framework for holistic egocentric 4D reconstruction that extracts both viewer and view dynamics from a single monocular RGB video. We formulate the task as learning the full joint probability distribution over multimodal signals, including RGB video, camera trajectory, gaze direction, full-body motion, hand motion, and depth. Powered by a Masked Generative Egocentric Transformer, ReViV operates within a single feed-forward architecture to simultaneously reconstruct the temporally consistent 4D reconstruction across the viewer and the view with fast inference speed. Extensive experiments on diverse benchmarks, including HoloAssist, HOT3D, ARCTIC, Aria Digital Twin, and TACO, demonstrate that ReViV achieves state-of-the-art accuracy and efficiency across holistic ego-body, hand, and gaze reconstruction, camera tracking, while maintaining highly competitive egocentric depth estimation without relying on heavy task-specific priors. Code and models are fully open-sourced:

huggingface-papersPapers

ShotPlan: 利用可学习规划令牌的电影级视频生成

Current video generation models achieve impressive results in single-shot generation, yet remain limited in cinematic video generation, where coherent narratives and effective multi-shot composition require explicit shot planning. To address this challenge, we propose ShotPlan, a framework for explicit multi-shot cinematic video generation built upon a video diffusion foundation model. Our method introduces learnable planning tokens that capture shot-level transition cues and can be seamlessly integrated with the original video generation tokens to control transition timestamps. Unlike standard video generation tokens, the proposed planning tokens are equipped with Fractional Temporal Rotary Position Embedding (FRoPE), enabling shot transitions to be modeled at the frame level. Experiments demonstrate that ShotPlan significantly outperforms existing cinematic video generation methods, offering more flexible shot management and stronger inter-shot consistency.

huggingface-papersPapers

语言模型会梦见结合分子吗?在空间约束下对LLMs的基准测试

Structure-based drug design (SBDD) leverages the 3D structure of protein targets, often complemented by other spatial constraints, to generate candidate binding molecules. While diffusion models have dominated as a leading paradigm for high-quality 3D molecule generation, LLM-based methods are rapidly emerging in molecular design and have shown competitive performance in pocket-conditioned molecular generation. However, their ability to reason about physics and 3D spatial environments is largely underexplored. In this work, we systematically analyze whether current general-purpose LLMs are capable of navigating complex 3D constraints compared to established baselines such as specialized diffusion models. We consider 3D ligand generation conditioned on protein pockets together with ligand- and interaction-derived spatial constraints, including anchor fragments, pharmacophore points, and mandatory pocket-ligand interactions. To enable this evaluation, we introduce 3D-Fit - a token-efficient benchmarking strategy for assessing LLM performance on multi-conditioned spatial molecule generation. Our findings reveal a clear pattern in LLM spatial capabilities: while they still lag behind state-of-the-art approaches, they are promising and can handle multiple spatial constraints simultaneously, enabling scaling to heterogeneous setups.

huggingface-papersPapers

HarmoHOI: 调和外观与3D运动以进行多视角手物交互合成

Hand-Object Interaction (HOI) synthesis is a cornerstone for animation production and embodied AI. Despite the strong priors of video foundation models, multi-view consistent HOI synthesis remains challenging due to complex hand motions and occlusions. We present HarmoHOI, a unified diffusion framework that jointly and harmoniously generates synchronized multi-view HOI videos and globally aligned 3D point tracks. Our core insight is that robust multi-view consistency fundamentally requires globally aligned 3D geometry and motion. To this end, we propose a Mixture of Multi-view Diffusion Transformer that co-models RGB videos and 3D point tracks. By representing point tracks as pseudo-videos, we align 3D geometric signals with the 2D latent space of foundation models, thereby minimizing the domain gap and easing adaptation of priors. To further ensure geometry consistency, we introduce Global Motion Aligning Diffusion, which refines coarse point tracks into metric-scale, globally aligned 3D trajectories. HarmoHOI enables on-the-fly co-evolution of 2D appearance and 3D motion during denoising. To overcome the scarcity of multi-view HOI data, we employ a hybrid data curriculum learning strategy that successfully transfers generic priors from single-view data to synchronized multi-view generation. Experimental results show that HarmoHOI achieves state-of-the-art performance in visual quality, motion plausibility, and multi-view geometric consistency. Project page available at

huggingface-papersPapers

语义空间的几何:Transformer架构的连续几何框架

We present a continuous geometric framework that models the discrete algebraic operations of the Transformer architecture as an integro-differential equation (IDE) on a semantic fiber bundle calE = calM times R^d. Beginning from a single geometric axiom -- that the token sequence forms a discrete 1-manifold equipped with a canonical measure lattice -- we translate every core component of the modern Transformer (RMSNorm, RoPE, Softmax Attention, FFN, Residual Stream, SGD, Weight Decay) into a cohesive vocabulary of differential geometry, measure theory, and stochastic calculus. The resulting framework yields quantitative predictions spanning entropic optimal transport (Attention as a Schrödinger bridge) and non-equilibrium thermodynamics (SGD as Itô diffusion violating detailed balance). We conduct a six-part experimental campaign across five architectures (Qwen3, LLaMA\nobreakdash-3.1, Gemma\nobreakdash-3, GPT-2, Mistral) spanning 124M to 8B parameters. The empirical observables are quantitatively consistent with the geometric predictions: the ε^{-1/2} Lipschitz scaling calibration at machine precision (R^2 = 1.000), the Lie--Trotter operator-splitting torsion, the symmetric ablation instability confirming the Dual-Law of Topological Stability, the calO(1/k) thermodynamic suppression of Poincaré recurrence on the RoPE torus, the thermodynamic context-limit phase transition, and the Non-Equilibrium Steady State parameter vortex -- verified across two optimizers (AdamW and Pure SGD) to exclude momentum artifacts. The results demonstrate that analyzing Transformers through the lens of continuous stochastic differential geometry provides a predictive descriptive vocabulary for the stability limits, context bounds, and optimization dynamics of Large Language Models.

15:00 更新

36 items
aibaseNews

苹果 41 页诉状点名三人却放过伊夫:古尔曼拆解这份"留白"背后的三重算计

一份41页的诉状,把苹果与OpenAI的暗战摆上了法庭,但最耐人寻味的,是它点了谁的名、又故意略过了谁。据多家媒体援引彭博社马克·古尔曼的分析,苹果自7月12日起诉OpenAI及其硬件子公司io Products盗用商业秘密,诉状中明确点名了Tang Tan、Chang Liu、Yu-Ting Alyssa Peng三人,却对前苹果设计师乔纳森·伊夫只字未提。 古尔曼认为,这份留白并非疏忽,而是经过权衡的结果,背后至少叠着三层考量。 第一 层是关联性的强弱——在苹果的判断里,伊夫与这起商业秘密争议的实质牵连有限,不足以把他推上被告席。 第二层则牵出人际与资本的网络:伊夫与乔布斯遗孀Laurene Powell Jobs私交甚好,而后者在相关投资与支持上产生的影响,让直接点名伊夫的代价和连带效应都变得复杂。第三层是舆论层面的避险——若把这位苹果设计灵魂人物卷进诉讼,势必将引发外界对苹果设计话语权是否易主的无尽争论,苹果显然不愿在打官司的同时,再给自己添一场关于设计地位变动的公共危机。 当诉状用41页的篇幅细数OpenAI与io Products的"偷师"指控,却在对伊夫的处理上按下静音键,这份刻意留出的空白,本身就成了观察苹果诉讼策略的一扇窗。

aibaseNews

三星电子成立RX机器人事业部,加速机器人业务商业化

7月21日,三星电子正式成立机器人事业部RX(Robotics eXperience,机器人体验),该部门将直接向公司首席执行官汇报,并被纳入三星未来增长战略的重要布局。 据了解,RX事业部将负责统筹三星机器人领域的中长期发展规划,推动核心机器人技术研发与产品业务落地,同时加强韩国及海外研发体系建设,以提升机器人技术商业化能力。 此次组织调整意味着三星正进一步加大对机器人领域的投入,推动相关业务从技术研发阶段向规模化应用阶段转型。作为全球领先的消费电子和智能硬件企业,三星希望通过机器人技术拓展新的增长空间,并强化其在人工智能、智能家居和未来服务机器人领域的竞争力。 近年来,随着人工智能、大模型和智能制造技术快速发展,机器人产业正成为科技企业竞争的新方向。包括三星、英伟达、谷歌、特斯拉等企业均在加快机器人技术布局,推动AI能力与实体设备深度融合。 三星此次成立独立机器人事业部,显示其正在通过组织架构调整整合研发资源,加快机器人产品商业化进程。未来,RX事业部能否推出具备市场竞争力的机器人产品,将成为观察三星AI与智能硬件战略落地的重要指标。

aibaseNews

智谱AI落地1GW国产AI算力中心,并收购中科加禾强化AI Infra能力

据外媒报道,智谱AI(Z.ai)已完成1GW级国产AI算力数据中心建设,整体采用国产AI芯片。同时,公司于近日完成对国产AI异构算力软件企业中科加禾(XCore Sigma)的收购,进一步完善从算力资源到基础软件的AI基础设施布局。 据了解,中科加禾源自中国科学院计算技术研究所编译实验室,长期专注于异构算力软件栈、编译优化、运行时系统以及AI推理基础设施建设,被业内视为国内领先的AI Infra技术团队之一。此次收购将增强智谱在国产芯片适配、算力调度和模型部署优化方面的能力。 业内认为,智谱此次两项布局分别对应AI产业链中的“算力供给”和“算力释放”环节。其中,1GW级国产算力中心能够为大规模模型训练提供稳定计算资源;中科加禾的软件技术则有助于提升不同类型AI芯片的计算效率,通过编译器、Runtime和推理引擎优化,提高硬件利用率,降低模型推理成本。 随着大模型竞争进入基础设施和工程能力比拼阶段,AI企业正在从单纯追求模型规模,转向构建覆盖芯片、算力、软件栈和应用部署的完整技术体系。近期,市场对智谱下一代基础模型持续关注。有观点认为,在大规模国产算力资源、成熟AI Infra体系以及长期积累的后训练(Post-training)能力支持下,智谱未来模型有望继续向更大参数规模、更高智能水平方向发展,同时提升推理效率和实际部署能力。 此次算力中心建设与基础软件能力整合,标志着国产大模型企业正加速构建自主可控的AI基础设施生态,也反映出AI产业竞争正在从模型能力扩展至全栈技术体系的竞争。

aibaseNews

唐杰亲自剧透GLM-5.5:一句"史诗级plus",把国产大模型的军备赛又挑高了一截

国产大模型的密集爆发,正把和美国旗舰闭源AI的身位拉近到肉眼难辨。快科技7月20日报道,在千问、Kimi接连秀出肌肉之后,轮到智谱出手了,传闻中的GLM-5.5被描述为一轮史诗级提升。而这次不是媒体猜测,是智谱创始人唐杰亲自下了场。 有网友在评论里提到,千问和Kimi都完成了史诗级进化,顺口问了句GLM还有没有戏。唐杰的回应当场把期待值拉满——他用了一个词:史诗级plus。这意味着,在智谱自己的判断里,这一代的提升幅度比网友提到的那些还要大。 具体的数字现在当然无从谈起,但唐杰显然希望外界对GLM保持信心。他的底气来自上一代的战绩:在Kimi K3登场之前,GLM-5.2是国产大模型中 第一 个在AI编程能力上追平Opus级别性能的选手。更值得注意的是它的体量——GLM-5.2的参数规模只有7400多亿,差不多是Kimi K3的四分之一,大概也只有美国 顶级 AI的五分之一甚至更少,却硬是靠后训练把能力托到了那个水位,堪称小参数撬动大能力的样本。 唐杰口中的史诗级plus新模型,指向的应该是下一代GLM-5.5。此前圈内传过GLM-5.3的名字,但现在看GLM-5.5的可能性更大,当然也不排除发布时直接冠上GLM-6的名号。一个可以确定的趋势是,下一代大模型的参数量至少会迈过1万亿的门槛。考虑到智谱历史上曾使用过DeepSeek开源的基模,外界猜测GLM-5.5或许会做到与V4Pro 同级 的1.6万亿参数;再叠加智谱公认颇强的后训练功力,其性能跃升确实值得押注,很可能又是一个对标Fable5量级的国产大模型。 不过在国产阵营的等待名单里,眼下最让人坐立难安的,还是DeepSeek V4的正式版。报道发出时,7月中旬的最后一刻——当天零点——正悬在头顶,那条小鲸鱼究竟是打算半夜甩出大招,还是又一次跳了票,谁也说不准。当智谱用一句史诗级plus把话题点燃,国产大模型这场接力赛,显然还远没到撞线的时候。

aibaseNews

Adobe Project Indigo引入AI摄影助手,利用大模型优化拍摄与编辑体验

Adobe正在为旗下实验性iOS相机应用Project Indigo加入一系列AI功能,通过大型语言模型(LLM)分析照片内容,为用户提供摄影点评、编辑建议以及智能优化方案。该应用此前已支持专业拍摄控制、多帧超分辨率和多种摄影模式,此次更新进一步强化了AI辅助创作能力。 新功能包括照片点评、拍摄与编辑建议、 高级 物体移除、AI景深生成以及照片风格迁移等。其中,照片点评功能能够围绕构图、光线、色彩和情感表达等维度提供类似专业摄影师的分析;拍摄建议功能则会针对重新构图、曝光调整以及画面元素优化提出具体指导,帮助用户提升拍摄技巧。 Project Indigo开发负责人Marc Levoy曾参与谷歌Pixel相机技术研发。他表示,当前多数生成式AI图像工具依赖用户输入提示词,但普通用户往往难以准确描述想要的调整效果。因此,Project Indigo更多采用按钮化和确定性操作,让AI直接提供可执行的编辑方案。 在智能编辑方面,Project Indigo新增的对象移除功能可以自动识别并删除背景人物、垃圾桶、电线杆、车辆等干扰元素,同时支持用户自定义描述需要移除的对象。相比传统需要手动圈选目标的方式,该功能能够减少操作成本,并提升处理效果。 此外,应用还支持通过AI生成景深效果,为普通照片模拟背景虚化,并提供水彩、钢笔画、彩色墨线、单色、逆光等风格迁移效果。不过,风格转换并非全新技术,其实际应用价值仍有待进一步验证。 目前,Project Indigo的新AI能力由基于谷歌Gemini的Nano Banana模型提供支持,Adobe也表示未来可能测试包括自研Adobe Firefly模型在内的其他AI模型。这些功能目前集中在“AI Playground”测试区域,仅向部分用户开放,是否最终全面推广仍未确定。 随着AI图像工具逐渐从简单生成和自动修图向智能摄影助手方向发展,Adobe正在探索如何利用大模型帮助用户理解摄影、优化创作流程,而不仅仅是生成视觉效果。该方向也代表了移动影像领域AI应用从“自动处理”向“辅助决策”演进的趋势。

aibaseNews

2 万亿参数隔空交锋:Kimi K3 登顶后,月之暗面喊话马斯克"欢迎入伙"

一场发生在中文微博与英文社交平台之间的隔空喊话,把大模型参数竞赛的火药味推到了台前。7月20日,月之暗面发布的新一代开源大模型Kimi K3登顶全球榜单,引发广泛关注,而就在几天前,埃隆·马斯克的一句话,让这场竞争从榜单延伸到了口水仗。 7月18日上午,马斯克在社交平台发文称,旗下那款2万亿参数的模型在各方面都优于当前1.5万亿参数版本,将在下周完成初步训练,且有可能超越Kimi;同时他放话,新模型的推理速度和Token效率将接近现有的1.5T模型,也就是Grok4.5。这番表态,等于在Kimi K3刚刚登顶的节点上,直接把参数规模的对标线拉到了2万亿以上。 月之暗面的回应干脆又带刺。它在微博上公开发文@马斯克,只扔下一句话:欢迎加入2万亿+俱乐部。一句看似轻松的邀约,实则是趁着登顶之势,把自家的开源成绩摆成了俱乐部的门槛。 不过,这场隔空对话里还留着不少未解之谜。目前xAI尚未公布Grok4.6的正式发布时间、训练细节与完整技术指标,马斯克的2万亿模型究竟是代号4.6还是另一款新作,外界仍只能等待。而把时间拨回不久前的7月9日,xAI已经发布了Grok4.5——这是该公司首个专门面向编程与智能体任务训练的模型,由xAI与Cursor联合完成训练,在提供前沿智能水平的同时兼顾领先的速度与成本效率,马斯克本人将其称为Opus级模型。当2万亿参数的新王尚未露面,Kimi K3已经先一步把开源榜单的椅子坐热,这场俱乐部之争的下一回合,恐怕要等马斯克的新模型真正走出训练阶段才算开场。

aibaseNews

马斯克把Grok塞进Excel:选中一片数据就能问涨跌原因,图表直接插进表格

马斯克旗下的xAI,把自家大模型Grok直接装进了微软Office的心脏地带。据多家财经媒体 7 月 21 日消息,xAI为微软Excel推出了一款名为Grok For Excel的免费Microsoft365 插件,目前已上线Microsoft Marketplace,同时兼容Word与PowerPoint。这意味着Grok不再只活在聊天框里,而是成了办公套件里随手可调用的数据分析员。 这款插件的使用逻辑极其贴近真实办公场景:用户在Excel里选中一片数据区域,就能直接向Grok发问,询问数据的变动情况、背后的原因以及其中的亮点,而Grok的回答会明确引用对应的数据单元格,不是凭空给结论。它还能理解公式语法,完成平均值计算、排序、填充等常规编辑操作,生成的图表则可以一键插入工作表。换句话说,过去要写函数、拖公式、手动画图的活儿,现在对着数据说句话就能推进。 更关键的是,Grok并不只盯着表格里那一小块被选中的数据。借助连接器,它能从电子邮件、SharePoint或Google Drive中提取上下文信息,把散落在各处的资料拼进当前分析。这一能力让Excel里的问答不再是孤岛,而是能结合邮件往来、团队文档和外部文件做出更完整的判断。当Grok以免费插件的姿态嵌入Word、PowerPoint和Excel三件套,办公软件与对话式AI的边界,又被磨掉了一层。

aibaseNews

苹果 41 页诉状怒撕OpenAI,为何唯独放过了传奇设计师伊夫?

苹果公司近日正式向法院提起诉讼,指控OpenAI及其硬件子公司通过挖角员工和获取内部文件等手段盗用商业机密。在长达 41 页的诉状中,多名前高管及核心工程师被点名控告,但令人意外的是,前首席设计师乔纳森·伊夫却并未出现在名单中。 三重考量避开核心人物 知名科技记者马克·古尔曼对此进行了深度剖析,指出苹果未点名伊夫的首要原因是其关联性有限。伊夫虽然通过旗下设计公司参与了相关硬件项目,但他并不负责实际的招聘与日常运营工作。 此外,深层的资金与人脉关系也是苹果选择回避的关键因素。伊夫与乔布斯遗孀关系密切,后者不仅投资了涉事硬件公司,其家族姓氏在苹果内部依然拥有举足轻重的特殊影响力。 顾及形象避免舆论反噬 除了人际考量,法庭上的舆论风险同样是苹果必须衡量的因素。在后乔布斯时代,苹果的战略重心逐渐向运营效率与成本控制倾斜,设计的核心地位已大不如前。 如果将伊夫卷入这场诉讼,辩方律师极可能在法庭质询环节借机发难,迫使伊夫公开谈论苹果设计理念的转变与退化。这种潜在的舆论风暴不仅无法帮助苹果赢得官司,反而可能对公司的品牌形象造成二次伤害。

aibaseNews

经典版 Outlook 迎来重大更新:微软宣布今年内引入 AI 自动起草邮件功能

微软正在积极推进旗下办公软件的智能升级。根据 最新 规划,微软计划在年底前向 Windows 10 和 Windows 11 平台上的经典版 Outlook 用户推送 Copilot 功能更新。 AI 赋能邮件撰写 这次更新最核心的亮点是加入了 AI 起草电子邮件功能。持有相关许可证的用户届时可以直接在写信框中一键唤醒 AI,让系统协助撰写新邮件或润色已有草稿。 微软此举旨在让老用户也能享受智能化带来的便捷体验。不过也有分析指出,这一变动可能打破部分传统用户的习惯,甚至增加日常使用的复杂性。 推动软件升级迭代 其实微软一直以来都在引导用户向新版 Outlook 迁移。团队正不断丰富新版应用的功能生态,试图以此吸引更多用户主动完成版本过渡。 尽管开发重心早已偏向新版,微软依然选择为经典版追加 AI 功能。这一策略能否兼顾老用户的习惯与智能化趋势,仍有待市场后续检验。

aibaseNews

谷歌密造"Frozen v2"专用芯片:把Gemini烙进硅片,单位功耗token能力翻 6 到 10 倍

把模型直接焊进芯片里,让硅片替算法省下算力和数据传输——谷歌正沿着这条路,悄悄打磨一款代号Frozen v2 的新型服务器芯片。据多家媒体报道,这款芯片的目标是更高效地运行Gemini模型,报道称它将把Gemini的部分架构 永久 嵌入芯片之中,从而减少回答用户问题时所需的计算量与数据搬运量。谷歌工程师预计,与其 最新 一代通用AI芯片TPU(张量处理器)相比,Frozen芯片在单位功耗下可提供 6 至 10 倍的Token处理能力。 这款芯片的登场时间被定在 2028 年,但谷歌明确它不会取代通用型TPU,而是成为定制芯片产品线中更专一、更具针对性的专用分支。消息公布后,资本市场立刻给出了反应:谷歌A类股(GOOGL)美股早盘一度涨近3.7%,C类股(GOOG)盘中 最高 涨幅约3.9%。 面对媒体追问,谷歌在声明中回应称,公司团队持续研究并试验各类创新技术,旨在为用户和客户提供 最佳 性能与 最高 效率,并强调虽然并非所有项目都会进入量产,但这种严格的探索正是其全栈战略的核心组成部分。谷歌还表示,通过从底层协同设计硬件与软件,整个系统得以深度集成,并针对真实工作负载高度优化。不过谷歌眼下把Frozen v2 定位为一次试验性项目,暂无像TPU那样大规模生产的计划。 分析人士认为,这个项目的背后,是谷歌内部日益吃紧的算力困境。此前算力不足不仅加剧了内部资源争夺,据称还一度迫使谷歌云拒绝部分外部客户业务。就在上月,谷歌还同意每月向SpaceX支付近 10 亿美元,以填补算力缺口、兑现对企业客户的算力承诺。Frozen v2 显然是为缓解这道缺口而落子的一步。 把架构固化进芯片,代价是灵活性的收缩。报道指出,只有当谷歌未来的Gemini模型继续沿用相同底层架构时,这款芯片才能兼容后续版本——一旦模型底层大改,烙进去的那部分设计便可能失效。而比芯片更紧迫的,是谷歌AI业务当下正面临的连环挑战:有消息称下一代Gemini Pro的发布时间已经推迟,同时多名 资深 AI研究人员流向了竞争对手。当专用芯片还在 2028 年的路线图里,谷歌要先稳住的是眼下的模型节奏与人才防线。

aibaseNews

15 亿美元和解获法官点头:Anthropic版权案落地,作家集体诉讼画上句号

一桩牵动整个AI行业的版权拉锯战,终于等来了法官落槌。据界面新闻援引报道,当地时间 7 月 20 日,美国加州北区联邦法官Araceli Martínez-Olguín正式批准了人工智能公司Anthropic涉及 15 亿美元的和解协议,并驳回了针对赔偿金额过低的异议。这份协议要解决的,是由作家团体提起的集体诉讼——这群作家早在 2024 年便指控Anthropic未经许可,将他们的著作拿来训练旗下AI聊天机器人Claude。 法官的批准,意味着围绕训练数据版权归属的这场标志性交锋暂告段落,也为AI公司使用受版权保护文本作为训练素材的合法性边界,添上了一个分量十足的判例注脚。

aibaseNews

Anthropic获批15亿美元版权和解协议,将向50万部作品支付赔偿

据路透社报道,美国联邦法院周一正式批准Anthropic公司与作家、出版商达成的15亿美元集体诉讼和解协议。该协议用于解决Anthropic因训练AI模型过程中涉嫌侵犯版权引发的诉讼,公司随后将开始向相关版权方支付赔偿。 美国加州北区地方法院法官Araceli Martinez-Olguin签署了最终批准文件。此前,已退休法官威廉·阿尔苏普曾初步批准该和解方案,并裁定Anthropic曾非法下载并存储数百万本受版权保护的书籍。 根据赔偿方案,每部涉案作品预计可获得3000美元赔偿,涉及作品数量约50万部,赔偿金额将由拥有版权的作者和出版商共同分配。这一金额被认为是美国版权法领域规模 最大 的和解之一。 不过,该协议并未完全解决围绕AI训练数据的法律争议。阿尔苏普法官此前在案件核心问题上支持Anthropic,认为利用受版权保护文本训练AI模型可能属于“合理使用”范畴,被业内视为AI版权判例的重要进展。但与此同时,他指出Anthropic获取部分训练数据的方式存在违法问题。 Anthropic此前主要通过两种方式获取训练数据:一部分来自合法购买并扫描的书籍,另一部分则来自Library Genesis、Pirate Library Mirror等盗版网站下载的内容。法院认为,后者涉及非法获取版权材料。为避免进一步审判以及可能面临的高额赔偿,Anthropic最终选择达成和解。 业内人士指出,虽然此次和解结束了该案件,但并未形成针对整个AI行业的统一法律标准。由于Anthropic选择和解,案件未进入上诉程序,阿尔苏普此前关于AI训练“合理使用”的判断也不会成为具有约束力的司法先例。 目前,围绕AI模型训练数据版权问题的诉讼仍在持续,包括针对谷歌、Meta、Midjourney和OpenAI等公司的相关案件。近期,Hachette、Cengage、Elsevier、作家Scott Turow以及SCRIBE等出版机构和作者还联合起诉谷歌,指控其未经授权使用版权作品训练Gemini人工智能平台。 随着生成式AI快速发展,如何平衡模型训练需求与版权保护,正成为全球AI产业面临的重要法律与商业挑战。Anthropic和解案虽然提供了一种解决路径,但行业关于AI数据合规的长期规则仍待进一步明确。

aibaseNews

谷歌研发“Frozen v2”AI芯片,预计2028年发布,能效提升最高10倍

谷歌母公司Alphabet正在研发一款代号为“Frozen v2”的新型AI服务器芯片,用于提升自主研发Gemini模型的运行效率。据The Information援引匿名消息人士报道,该芯片预计于2028年推出,其单位能耗产生代币数量的效率可能达到谷歌现有AI芯片的6至10倍。 针对相关报道,谷歌向TechCrunch表示,公司持续探索和测试创新技术,以提升系统性能与效率,但并非所有研发项目都会最终实现量产。谷歌强调,通过硬件与软件协同设计的“全栈开发”模式,可以打造更高集成度、针对实际AI工作负载优化的计算系统。 近年来,随着生成式AI应用快速扩张,全球AI算力需求持续增长,科技企业纷纷加大自研芯片投入,以提升模型运行效率并降低对外部供应商的依赖。英伟达凭借GPU技术长期占据AI芯片市场主导地位,推动OpenAI、Anthropic等AI公司也开始探索自主芯片路线。今年6月,OpenAI发布 首款 定制推理芯片“Jalapeño”;近期,Anthropic也被曝正与三星洽谈芯片制造合作。 Alphabet此前宣布,为推动人工智能战略发展,计划投入1800亿至1900亿美元资金。随着AI基础设施投资规模扩大,芯片效率成为衡量投入回报的重要指标。Frozen v2的相关消息公布后,市场信心有所提升,Alphabet股价在报道发布后的周一早盘上涨约3%,投资者关注其AI投入能否转化为长期竞争优势。 随着AI模型规模持续增长,自研芯片正成为科技企业构建算力生态、提升成本控制能力的重要战略方向。谷歌此次布局也反映出AI产业竞争正从模型能力延伸至芯片、基础设施和全栈技术体系的竞争。

huggingface-papersPapers

FlashRT:引导智能体部署实时多模态应用的代理驾驭工具

Real-time multimodal applications, including voice agents and interactive video generation, compose heterogeneous models into pipelines whose efficient deployment requires application-specific decisions about placement, streaming, and intra-model parallelism. Existing serving systems and auto-parallelism compilers commit to limited transformations and fixed workload assumptions, so achieving high performance on a new application requires hand-crafting an efficient implementation. We present FlashRT, an agent harness that guides coding agents to lift simple developer-written reference implementations into optimized multi-GPU deployments that flexibly weigh target metrics like latency and throughput. Using a new chain-of-program paradigm, FlashRT directs a generic coding agent through a multi-pass transformation process where an agent transforms the reference into an intermediate representation (IR) to capture data dependencies and persistent-state scopes, validates this IR via a sequential interpreter, and performs static analyses to identify candidate transformations. Then, the agent iteratively implements, verifies, and benchmarks each candidate under a measurement-gated optimization loop to produce effective deployments that span different hardware budgets. Across various applications, including video world models and multimodal LLMs, FlashRT converts reference implementations into highly efficient deployments, delivering up to ~70x latency reduction and 2.8x throughput improvement on NVIDIA B200 GPUs. On AMD MI355X GPUs, FlashRT matches the peak latency reduction while increasing peak throughput improvement to 3.6x, demonstrating that agent-driven optimization can be more scalable on platforms with less mature expert optimization. In fact, for Qwen3-Omni text-to-audio inference, FlashRT reduces response latency by 65% compared to the expert vLLM-Omni implementation on AMD MI355X.

huggingface-papersPapers

LLM即教练:面向不可验证任务的体验式学习

Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.

huggingface-papersPapers

分布偏移下用于忠实生成的令牌级离线策略学习

We propose Token-Level Off-Policy Labeling (TOPL), an off-policy training paradigm that reframes post-training as a token-level correctness prediction task. Our key intuition is that by training the model to distinguish good and bad tokens in a response, we naturally guide the model towards generating good tokens, while avoiding the pitfalls that come with directly training the model to generate off-policy tokens. Experiments on document summarization tasks show that TOPL achieves strong out-of-distribution generalization across 11 datasets against a diverse set of sequence-level and token-level baselines. We further demonstrate that TOPL transfers effectively to machine translation, suggesting that its benefits generalize across different faithful generation tasks. Through ablation studies, we confirm that our token-level learning signal is critical to good performance; sequence-level analogues do not confer similar benefits. Finally, we show that TOPL induces interpretable model updates: the LoRA adapters learned through TOPL function as linear classification heads and steering vectors.

huggingface-papersPapers

RynnBrain 1.1:迈向更强能力和通用性的具身基础模型

We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.

huggingface-papersPapers

HOMIE:通过多模态智能增强的以人物为中心的视频个性化

Human-object centric video personalization (HOCVP) is a core task within subject-driven video generation. However, existing methods suffer from two key limitations. First, most approaches focusing on inter-subject personalization still struggle to strike a balance between high subject fidelity and accurate interaction patterns between humans and diverse objects, especially when objects represent abstract concepts such as logos. Second, while intra-subject references (e.g., OCR maps, multi-view inputs) are expected to enhance subject fidelity, most existing works lack mechanisms to understand such latent correspondence. To address both challenges, we propose HOMIE, an HOCVP framework that tackles both inter- and intra-subject input settings in a unified manner. Compared to previous approaches, HOMIE proposes a better MLLM integration strategy to extract knowledge of reference-level relationships without compromising the controllability of text encoders or incurring costly re-alignment. Specifically, we introduce global multimodal guidance within self-attention to better align MLLM-derived semantic features with VAE tokens. Furthermore, we propose modality-reference embedding to differentiate tokens from MLLM features and VAE tokens and associate intra-subject reference image tokens. Extensive experiments validate that our method achieves state-of-the-art performance across various HOCVP tasks. Project Page:

huggingface-papersPapers

SWE-Pruner Pro:编程大语言模型早已知道该裁剪什么

Pruning long context for coding agents has been a vital technology for efficient context management. While existing context pruning methods such as SWE-Pruner realize this by attaching a separate code classifier, we find the agent itself encodes internal representations indicating the relevance of code context when reading tool output. Based on this finding, we propose SWE-Pruner Pro, which prunes tool outputs directly inside the agent. Concretely, a small head turns the agent's own internal representations into a keep-or-prune label for each line, with a length-aware embedding keyed to each tool output's line count. Across two open-weight backbones and four multi-turn benchmarks, SWE-Pruner Pro saves up to 39% of prompt and completion tokens while preserving task quality, with bounded inference overhead. Notably, on MiMo-V2-Flash SWE-Pruner Pro additionally raises the SWE-Bench Verified resolve rate by +3.8% and the long-context Oolong accuracy by +2.2 points.

huggingface-papersPapers

DiFA:扩散模型的推理时前向过程对齐

The prevailing inference framework for diffusion models formulates generation fundamentally as a problem of numerical integration. This perspective casts the model as an exact estimator, neglecting the inherent statistical uncertainty of the denoising process. In this work, we propose Forward-Process Aligned Diffusion prediction (DiFA), a training-free framework that reframes inference-time data prediction refinement as a sequential state estimation problem. Rather than reusing past outputs solely for numerical integration, DiFA treats iterative data predictions along the reverse trajectory as correlated observations to build a forward-aligned temporal consensus. Inspired by Kalman filtering, this consensus aggregates historical predictions according to structural consistency and noise-level compatibility. To counteract the over-smoothing tendency of temporal consensus, we introduce a deviation guidance mechanism to adaptively preserve residual details. Empirically, DiFA yields significant improvements on CIFAR-10 and ImageNet across the evaluated metrics, including FID, IS, and FD-DINOv2, demonstrating that aligning inference with the forward statistical structure substantially improves generative fidelity.

huggingface-papersPapers

TimeLens2:基于多模态大语言模型的通用视频时序定位

Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video lengths, domains, query forms, and viewpoints. Existing training strategies are misaligned with this set-valued task: long-video labels often rely on brittle one-pass annotation, while reinforcement-learning rewards either fail to distinguish non-overlapping predictions or require fragile segment matching. TimeLens2 treats temporal evidence as an interval set throughout supervision and optimization. TimeLens2-93K constructs reliable multi-span supervision through caption-derived proposals, independent localization, cross-agent consensus, semantic verification, and boundary refinement. Our temporal Wasserstein reward computes exact one-dimensional \(W_1\) between uniform distributions over merged interval supports, providing dense, matching-free feedback under unequal cardinalities and equivalent fragmentation; temporal IoU complements it with precise-overlap feedback. Across seven benchmarks, TimeLens2-2B outperforms all size-matched baselines on every benchmark, while the 4B and 8B variants achieve state-of-the-art performance, surpassing open-source models with up to 397B parameters. The 2B, 4B, and 8B variants improve over their Qwen3-VL backbones by 14.2, 13.0, and 18.1 mIoU points, respectively.

huggingface-papersPapers

EvolvingWorld:面向互动文学世界中角色扮演智能体与世界模型协同演化的开放模式框架

This paper introduces EvolvingWorld, a framework and benchmark for character and world co-evolution in interactive literary worlds. Existing systems either treat interactive literary simulation as static persona imitation or isolated scene generation, failing to capture how characters and worlds evolve together over time. To address this, EvolvingWorld models literary simulation as a long-horizon process where characters interact, scenes progress, and character and world states are persistently updated. Unlike prior systems relying on fixed schemas, EvolvingWorld adopts an open-schema framework to support simulation across diverse literary worlds. The framework consists of two coupled modules: a Character Agent for multi-character role-play and persistent profile evolution, and an LLM-based World Model for global and location/entity-level state maintenance and scene progression. Based on this architecture, we formulate 7 trainable tasks for scene initialization, interaction generation, and state update. We construct a dataset from 57 books, producing 138,596 supervised training samples and 222 snapshots for testing. Furthermore, we introduce a trajectory-level LLM-as-Judge evaluation protocol spanning 10 dimensions and 20 metrics. Experiments show that EvolvingWorld can improve long-horizon simulation by effectively maintaining persistent, coherent character and world development.

huggingface-papersPapers

面向大语言模型后训练的蒸馏强化学习

Large language model (LLM) post-training is essential for improving reasoning, adaptation, and alignment. Existing methods mainly follow two paradigms: reinforcement learning (RL) and on-policy distillation (OPD). However, RL relies on coarse-grained outcome supervision, resulting in difficult credit assignment and limited capability to acquire new knowledge. OPD, meanwhile, unconditionally matches teacher logits through KL divergence, which creates a dilemma: similar teachers provide little new knowledge, while substantially different teachers often yield ineffective guidance, largely restricting OPD to within-family distillation. We propose Distilled Reinforcement Learning (Distilled RL), which integrates teacher supervision into the RL objective to provide fine-grained guidance, selectively transfer new knowledge and avoid unconditional imitation. Distilled RL contains three components: reverse importance sampling with clipping, negative sample reset, and sequence-level geometric normalization. Through a concise and interpretable case study, we demonstrate that Distilled RL can effectively transfer previously unavailable knowledge from a teacher model to a student model. Extensive experiments across both within-family and cross-family distillation settings show that Distilled RL substantially outperforms standard RL and OPD in terms of both pass@1 and pass@k. Our code is available at

10:00 更新

5 items
Simon Willison's WeblogNews

Reverse-engineering is cheap now

I keep hearing anecdotes from people who used coding agents to reverse-engineer and automate devices in their homes. I think this is an interesting illustration of the impact of the reduced cost of writing code. Prior to agents, it was entirely possible to reverse-engineer home devices. The problem was the ROI - was it really worth all of that effort? More importantly, any experienced programmer knows that undocumented, unstable APIs like that may well change or break in the future. Is that initial work worth the effort if you're committing yourself to a frustrating cycle of maintenance in the future? Coding agents change that equation entirely. The effort to get a simple automation working has dropped, as has the cost of trying and failing to get it to work. Since the code is so cheap, the idea of having to maintain it in the future - or throw it away and start again - carries way less psychological baggage. Tags: reverse-engineering, coding-agents, ai-assisted-programming, generative-ai, ai, llms

次日 03:00 补充更新 · scheduled

Items will appear here once this batch is published.

COMMUNITY NOTES

Discussion and additions

Comments load when this section approaches the viewport.