资讯日报 · DAILY BRIEF
星期日
次日 03:00 补充更新
7 条AI Mania Is Eviscerating Global Decision-Making ↗
AI Mania Is Eviscerating Global Decision-Making Here's an entertaining perspective from Nik Suresh on the AI mania that is overwhelming the large companies that he consults with. It's crammed with spicy anecdotes from anonymous sources. In one extreme case, I have seen an executive confess that they had never even used ChatGPT or any AI tool in their life, immediately after producing a technical strategy for an organisation with $2B+ in revenue which was entirely centered around AI. Here's a report from an engineer at a company with a token leaderboard: Checking out a parallel copy of our Go repository and telling the AI to rewrite the whole thing in Zig while I work on something else just so I can keep my job. I particularly enjoyed this conversation with a skeptical executive at an over-enthusiastic company: I asked why this was being repeated without opposition. Was it just sales fluff? The answer was a lot more interesting. It was partially ridiculous sales material being delivered to an easily excitable audience, but this was not the dominant factor constraining honesty. Executives at their customers were saying absurd things about achieving 100x productivity, and this meant that if any executive at the vendor said that these gains were not plausible, it would undermine the credibility of the customer’s executive, be perceived as an attack (or heresy), and possibly result in an enterprise contract cancellation. And getting enterprise contracts cancelled because you wanted to opine on something that doesn’t really matter to your organisation’s mission is a great way to get fired. Via Hacker News Tags: ai, ai-ethics, ai-misuse
Claude Code uses Bun written in Rust now ↗
In Rewriting Bun in Rust Jarred Sumner made the following claim: Claude Code v2.1.181 (released June 17th) and later use the Rust port of Bun. Startup got 10% faster on Linux but otherwise, barely anyone noticed. Boring is good. I decided to have a poke at my own Claude Code installation to see if I could find evidence that it was using Bun written in Rust. I found these two commands convincing: strings ~/.local/bin/claude | grep -m1 'Bun v1' For me this outputs Bun v1.4.0 (macOS arm64). The most recent release of Bun on GitHub is currently v1.3.14 from May 12th, so that v1.4.0 version number in Claude supports them shipping a preview of a not-yet-released Bun version. ( Update: The Rust version has been released as Bun canary - running bun upgrade --canary will install this release.) strings ~/.local/bin/claude | grep -Eo 'src/[[:alnum:]_./-]+\.rs' This outputs a list of 563 filenames, starting with these: src/runtime/bake/dev_server/mod.rs src/runtime/bake/production.rs src/bundler/bundle_v2.rs It looks like Bun in Rust is indeed being run in production across millions of different devices. Like Jarred said, "Boring is good". Update: Here's a neat trick from Ajan Raj: cat > /tmp/bun-version.ts <<'EOF' console.log("embedded bun:", Bun.version); process.exit(0); EOF BUN_OPTIONS="--preload=/tmp/bun-version.ts" claude --version This outputs 1.4.0 for me. Here's the commit from May 17th that updated the version in package.json to 1.4.0. That version hasn't been changed since then, but also hasn't yet made it into a tagged release outside of canary. Tags: bun, rust, anthropic, claude-code, jarred-sumner
SQLite Query Explainer ↗
Tool: SQLite Query Explainer Julia Evan's, in Learning a few things about running SQLite: Maybe one day I’ll learn to read a query plan. Big same.... which inspired me to have Fable build this interactive explain tool, which runs SQLite in Python in Pyodide in Web Assembly in the browser and adds a layer of explanation to the results of both EXPLAIN and EXPLAIN QUERY PLAN. Approach with caution, since I don't know enough about SQLite query plans to verify the results myself, but it seems cromulent enough to me. Tags: sql, sqlite, tools, julia-evans, pyodide, claude-mythos-fable
Claude make Fable 5 permanent ↗
Claude make Fable 5 permanent An update from the @claudeai account on Twitter: Beginning July 20, Claude Fable 5 will be included in all Max and Team Premium plans, at 50% of limits. Pro and Team Standard users will continue to have access to Fable via usage credits, and will receive a one-time $100 credit. As I was saying last week, the competition from GPT-5.6 Sol (and maybe to a lesser extent Kimi 3 ) made untenable Anthropic's plan to remove Fable 5 from their subscription accounts and make it available exclusively through API pricing. Why pay $100 or $200/month for a subscription plan that doesn't include Anthropic's best model? Their original plan was driven by concerns over compute capacity. I wonder if they'll have to dial back their training efforts in order to make more GPUs available to help serve the model. A lot of people were losing sleep over trying to make the most of Fable 5 before subscriber access was withdrawn. It's nice not to have to worry about the Fablepocalypse any more. Update: Important to note that users on the $20/month plan will still not have access to Fable 5 on that subscription. The Max plans are $100 and $200/month. Tags: ai, generative-ai, llms, anthropic, claude, llm-pricing, claude-mythos-fable
nascheme/quixote ↗
nascheme/quixote A certain vintage if Python web nerd might be delighted to learn that the most recent commit to the Quixote web framework was six hours ago. The oldest commit in that repo is from 21 years ago, and that was the initial import of Quixote 2.4 from Subversion into Git. Tags: computer-history, python, web-frameworks
23:00 更新
62 条Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了 ↗
ASI启示录 2026-07-19 17:53 北京 新智元报道 今年WAIC开幕当天,上海世博展区挤满了各种机器人、大模型和智能体。 但如果你问一圈做AI的人,2026年最让他们睡不着觉的事情是什么,答案出奇一致—— 不是模型不够强,是算力不够用了。 过去一年,AI行业发生了一个根本性的切换: 大模型从「陪聊」变成了「干活」。 这带来一个很直观的变化: Agent太能吃了。 这不是夸张。今年,密歇根大学、斯坦福等机构测算发现,在一组真实软件工程任务中,编码Agent每生成1个输出Token,背后平均要累计处理约154个输入Token。 更要命的是,这些Agent不是偶尔吃一顿,它们7×24小时不停地吃。行业里的共识是,今年AI推理的算力需求是去年的5倍到10倍。 与此同时,英伟达最新的高端卡今年很难大批进入国内,存量供给几乎没怎么增长。 需求暴涨,供给不动。怎么办? 就在今天,商汤在总部举办以「算创·无限」为主题的Agentic时代AI基础设施创新发展论坛。 本次论坛上,商汤给出了一个听起来有点反常识的答案: 不造更强的卡,而是把比赛拆开,让不同的卡接力跑。 一场铁人三项的启示 要理解商汤在做的事情,得先搞清楚一个技术概念。 大模型每一次推理,其实可以拆成两道工序。第一道叫 Prefill,就是「读题」:把用户扔过来的资料、文档、聊天记录、上下文全部读进去,理解清楚。第二道叫 Decode,就是「答题」:在理解的基础上,一个字一个字地往外蹦答案。 这两道工序对硬件的要求完全不同。 读题拼的是计算吞吐量——你得一口气吞下海量信息,越快越好。答题拼的是显存带宽——你得一个字一个字地往外挤,快不了但不能卡。 过去大家的做法是一张卡从头干到尾,既读题又答题。这就好比让一个人独自跑完铁人三项——游泳、骑车、长跑全包了。能不能跑完?能。但一定不是最优解。 商汤的思路是: 把铁人三项拆开,让三个运动员各跑自己最擅长的那段。 具体来说,就是 让通用国产卡去做Prefill——它们的计算吞吐量不差,干这个活效率很高。把高端卡集中起来做Decode——这是它们的绝对强项。 这就是所谓的「异构混合推理」。说白了,不是逼国产卡去硬刚英伟达,而是让每一张卡都去干自己最擅长的事情。 听起来很美,但这事能落地吗? 这事可远不是「把卡插上去就能跑」那么简单。 你想想看,一台Decode节点要同时协调三十个Prefill节点,这三十台芯片还可能来自不同厂家、不同代际。 网络怎么不堵?请求怎么分?长文档和短对话怎么区别对待?某张卡突然掉线怎么办?缓存命中率怎么保证? 商汤首席科学家张行程说得很实在: 纯英伟达方案4个Prefill对1个Decode就够了,换成国产方案变成30对1,网络复杂度、调度复杂度、容错复杂度全线飙升。 所以商汤这几年在底层做了海量的脏活累活——编译器、算子、网络、缓存、调度、容错,一层一层地打通。经过系统级调优,才能让这套复杂程度远高于英伟达方案的异构系统,实现长时间稳定运行,系统可靠性达到99.9%,真正实现大规模商用。 而且从2018年开始,商汤就在做多芯片适配,到今天形成了一整套方法论。 张行程说,这不单纯是技术上的方法论,更是一种组织上的方法论——商汤自己的研发团队、芯片原厂、高校和科研机构,有的深度绑定、有的灵活协作,拧在一起才啃得动这块骨头。 目前,这套方案已经在真实客户场景中跑通了。适配的模型包括GLM 5.2、DeepSeek V4、Kimi K2.7、MiniMax M3、SenseNova V6.7等主流大模型。 但光是「能跑」还不够。技术再漂亮,不赚钱就是玩具。接下来才是整个故事里最关键的一步。 国产算力,上桌吃饭 过去几年,国产算力的叙事基本上是这么个套路:自主可控很重要,供应链安全很紧迫,我们的芯片能跑了。然后呢?然后往往就没有然后了。 能跑,但是性价比不行。能用,但客户不买单。声音很大,账算不平。 商汤这次最让人意外的地方在于: 国产芯片参与的混推集群,已经实现了可盈利。 这里的「可盈利」不是财务游戏,商汤科技联合创始⼈、⼤装置事业群总裁杨帆给了一个非常明确的定义: 收入覆盖折旧、摊销、机柜租赁、电费和人员服务费之后,利润率为正。 是真金白银地赚钱。 怎么做到的? 第一步,把国产卡的实际性能「榨」出来。 商汤在三个不同厂牌的国产芯片上做定向优化,单卡MFU(可以理解为「有效利用率」)相比原厂出厂表现平均提升约一倍,最高的一款提升了152%。 第二步,通过异构混推,让同样成本产出更多Token。 相比国产同构推理,异构混推的同成本Token产出规模扩大了2.5倍。简单说,同样花那么多钱买卡和建机房,产出的Token多了一倍多。 第三步,Token量跑起来了。 年初日均4000亿Token,到7月底预计日均2.42万亿,年底目标是日均10万亿——全年预期增长25倍。账算得正是一回事,规模跑得起来才能证明这不是小打小闹。 这意味着, 国产算力第一次不必等到单卡全面追平英伟达,就通过系统分工,提前进入了真实的商业市场。 不是等着领先了再上桌,而是找准了自己的位置先坐下来——还挣到钱了。
WAIC华山论剑,罕见AI新共识:机器人ChatGPT时刻,最快两年! ↗
ASI启示录 2026-07-19 17:53 北京 新智元报道 上海,WAIC 2026。 核心官方分论坛之一、具身智能的「华山论剑」智启具身论坛,今日终于开场。 Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等海外明星机构,与智元、清华大学、腾讯Robotics X等学术与产业力量同台,一众具身智能核心人物悉数到场。 他们把各自的模型、数据和训练体系摆上桌面。表面看,大家都在追逐「通用机器人」;真正把几份技术路线叠在一起,却是刀光剑影。 谁都承认,具身智能正在逼近临界点。但对「最后一公里究竟该怎么走」,各有绝招。 具身智能的「最后一公里」,各有奇招 先亮战绩,再亮主张。五家最硬的成果和一句话立场摆出来,你会发现连「墙在哪」都没谈拢。 智元机器人 手握GO-2(LIBERO基准98.7%刷新SOTA)、世界模型GE-Sim 2.0(WorldArena全球第一)、龙旗南昌产线稳定运行3个月、成功率99.99%。智元机器人的姚卯青直言,模型决定起点,数据定义终局——靠全栈飞轮硬冲数据、表征、闭环三道墙。 清华大学计算机副研究员苏航,聚焦可恢复性——真正的智能不是不犯错,是知道怎么改回来。 他提出的 TUTOR方法把长程任务的自主成功率从8.3%拉到35%。 Physical Intelligence 最新的π0.7,一个模型开箱即通吃多任务,连没训练过的机械臂都能零样本迁移。Physical Intelligence研究科学家任至意坚信,模型能力足够,唯缺上下文——泛化会自己涌现。 Genesis 押注人手数据手套,从全世界的日常家务里抠经验,号称仿真快1000倍。联合创始人王尊玄介绍了他们如何让物理AI以软件的速度进化。 Dyna的 DYNA-1把折餐巾做到99.4%、24小时85多张,直接开进真餐厅。创始人兼首席科学家马也骋坦言,通用模型不够可靠,专用模型不够可扩展,他们选择先把可靠做到极致。 绝招亮完,战场却各画各的:智元盯着数据、表征、闭环三道墙,PI说墙是上下文,Dyna说是可靠性,清华说是机器人自救。 华山论剑第一招,是先否掉对方对战场的判断。 物理AI三道墙前,背后三场争论 不过,这次有个隐秘共识:下一阶段不再拼Demo花哨,而是拼谁能把「经验」规模化。 这要从大语言模型的成功让人产生的错觉说起: 只要把模型做大、数据喂多、算力堆高,机器人迟早也会出现自己的ChatGPT时刻。 可物理世界不吃这一套。物理智能Scaling面临三道墙:数据墙、表征墙和闭环墙。 姚卯青一句话点破差异:数字智能是「知识系统」,物理智能是「经验系统」。前者靠语言表征就能大规模积累,后者还在满世界找「经验的通用表征」。 经验系统至少管五件事:空间感知、物理交互、精细操作、失败恢复、工具使用。 判断标准叫「经验密度」——录画面和关节角度,那是「一小时录像」;同时记下任务目标、物体状态、动作质量、错在哪、结果如何,才叫「一小时经验」。 数据规模回答「见过多少」,经验密度回答「学到多少」。两者差着一整条产业鸿沟。 背后是三场争论:经验从哪来、怎么算好、能不能省钱。 第一场:有人所有数据全都要,有人偏要少 真机遥操作数据最对口,可太贵:一个人盯一台机器,采集还不如自己上手,想堆出互联网规模,账单比机器人先觉醒。 智元全都要。 姚卯青甩出一个数字:物理AI的数据量只有大模型的两万分之一。为填这条沟,智元和觅蜂科技打造具身智能数据「平台型供给」基础设施,开源了行业首个百万真机数据集AGIBOT WORLD,目前累计下载了120万余次。
告别审稿抽卡!全新LLM校准机制,给AI顶会统一打分尺度 ↗
新智元 2026-07-19 17:53 北京 新智元报道 21,575。 这是NeurIPS 2025收到的论文投稿数量。 与2020年相比,这一数字增长超过一倍。与此同时, ICLR 2026投稿量也逼近2万篇。AI顶会热度持续走高,海量稿件涌入的背后,同行评审体系长期存在的痛点被无限放大。 不少投稿人都有同款困惑:两份措辞高度接近的审稿意见,最后给出的分数却能相差巨大。如今投一篇顶会论文,体验越来越像一场纯靠运气的「 抽卡游戏 」。 例如,两位审稿人都认为论文「缺少必要的消融实验」。其中一位认为只是需要补充实验,因此给出较高分;另一位则将其视为影响论文质量的关键问题,直接给出低分。 表面上,两人的意见高度一致,真正不同的是,他们对同一句评语对应着不同的评分尺度。 随着投稿规模不断扩大,这种评分尺度的不一致,正成为影响同行评审公平性和稳定性的重要因素。 近日,来自华中科技大学的李钦宾研究团队在ICML 2026 Position Paper Track提出了一种新的解决思路: 不是让大语言模型替代人类审稿,而是利用LLM对「评语—分数 」 之间的映射关系进行校准。 论文链接: 为什么没有选择让LLM直接审稿? 面对评审人手不足、打分标准混乱的现状,很多人会直观提出解决方案:干脆交给LLM完成全自动审稿。华科大团队给出的答案是否定的。 在研究者看来,学术评审绝非简单对错判断,还需要综 合衡量工作创新价值、领域发展意义、研究长远潜力 等高阶学术认知,这类深度领域判断依托研究者长期积累的行业经验,很难完全交由模型独立完成。 除此之外,完全AI主导评审还会催生投机乱象:若作者知晓论文命运由大模型裁决,写作重心会转向 刻意迎合模型偏好,而非聚焦真实科学问题的突破,彻底偏离学术研究初衷。 论文指出,目前同行评审实际上包含两个过程:一是审稿人阅读论文并形成定性判断;二是将这些判断压缩为一个最终分数。 真正容易出现偏差的,恰恰是第二步。 因此,这项工作的目标并不是构建一个自动审稿系统,而是解决同行评审中另一个长期存在的问题—— 如何让文字评语和最终评分保 持一致。 在现有评审流程中加入一个「评分校准器」 作者提出的方案没有改变现有同行评审流程,而是在后台增加了一层 LLM校准模块(Calibration Layer)。 整个流程可以概括为三个环节。 LLM对审稿意见进行结构化分析,将自由文本整理为论文的Pros(优点)和Cons(缺点)。 在统一Prompt和固定评分标准下,根据这些优缺点生成一个Anchor Score(锚点分数),作为一把统一尺度下得到的参考分数。 系统比较审稿人实际评分与Anchor Score之间的差值(Residual)。如果两者接近,说明评分与评语基本一致,无需额外处理;如果差距较大,则触发一次轻量级复核,要求审稿人重新确认评分,或者补充更多文字说明,解释为何自己的评分明显偏离常规尺度。 整个过程中,LLM不会新增任何学术评价,也不会参与录用决策,更不会替代领域主席(AC)或程序委员会(PC)的判断。它承担的角色更接近于一名「 评分审计员 」,负责检查分数是否能够被评语合理支撑。 三届ICLR 评分尺度差异正在扩大 团队基于ICLR 2023–2025三届顶会公开数据,开展大规模实证分析,数据集覆盖 2.2万余篇论文、5.2万条评审记录,能够真实反映近年顶会评审状态。 数据清晰证实,顶会审稿存在明显的年度尺度漂移:不同审稿人的打分标准差异逐年变大,相同评价对应悬殊分数的现象愈发普遍。 从量化指标来看,衡量评审分歧的核心偏差跨度指标逐年上涨,2023年整体偏差相对可控,2024年小幅恶化,到2025年打分离散程度显著提升,极端不合理打分的占比持续走高。 随着投稿量激增,审稿人的主观打分标准越来越不统一,评审随机性、不公平性逐年加剧。 校准后的评分 更接近论文的长期影响力 顶会评审中,最具争议的通常是 录用边缘论文(Borderline Papers)。这些论文往往处于录用与拒稿之间,一点评分差异就可能影响最终结果。 为了验证校准机制是否能够改善这一问题,作者以论文长期引用量作为客观参考指标,对比人工原始评分与LLM锚点校准后的排序结果。 实验结果显示,经过统一评分尺度校准后,论文排序与长期学术影响力之间具有更高的一致性。 以ICLR 2023数据为例,在最难取舍的5–6分临界区间,LLM校准筛选出的论文,其平均引用量相比仅依据人工评分筛选提升了94%。 这一结果说明,统一评分尺度后,可以在一定程度上减少不同审稿人评分习惯带来的影响,使评审结果更加一致,也更容易保留后续产生较大学术影响力的边缘论文。
15:00 更新
8 条10:00 更新
44 条刚刚,中国AI首次赢了!一张8K东方长卷惊艳全场 ↗
ASI启示录 2026-07-18 18:26 北京 新智元报道 直出8K长卷,中国AI还是首次! 就在今天,WAIC大会上,商汤正式发布下一代「满血旗舰」——日日新SenseNova-U1 Pro。 这是业界头一回,把「看懂、生成、动手」原生做进了同一个多模态基座的底层。 现场,商汤科技董事长兼CEO徐立揭晓了一幅为WAIC九周年特制的「东方城市长卷」——《智会世图》。 8K超清巨制,受限于上传规格,画质有所压缩 从2018到2026,满城人物、山水楼阁、市井百态,尽数收进这一卷里——看到它,很难不想起《清明上河图》。 而这么大一幅、铺满整面迎宾墙的画,竟然是U1 Pro直出的。 换个场景,张张能交差 但一张全景图,还装不下它的全部本事。 东方长卷 · 盛唐长安西市 这张图的细节堪称恐怖。在21:9的超宽画幅下,盛唐的烟火气扑面而来。 画面中足足塞进了五十多号人物,最绝的是完全没有AI常见的「复制粘贴」敷衍感。 放大来看,骑马的官员、乐师弹琵琶、卖香料的胡商、追灯笼的孩童,每一个角色的神态、动作和服饰制式都精准独立。 朱红、赭石、深蓝、琥珀金四色铺开,灯笼暖光撞上夜色冷调,全在一次生成里落定。 电影海报 · 雨夜来信 一张民国上海的悬疑电影海报。 雨夜的街头,玻璃倒影里藏着三个人物—— AI画面没有简单粗暴地将侦探、神秘男和送信人「贴」在背景里,而是严格遵循了真实的物理空间关系。 通过老式邮局玻璃、雨水与薄雾的多层折射,将这三位叙事人物精妙地隐藏在倒影中,空间景深与悬疑张力直接拉满。 片名带着手写的墨迹,就连演职员表都巧妙地被「加密」的黑线代替。氛围、光影、文字、构图,一次到位。 动画海报 · 二次元 乐队 一张8K的国风二次元乐队《长安未眠》舞台海报,简直令人拍案叫绝。 五个人,五种乐器,五套不重样的国潮打扮,U1 Pro极其聪明地处理了群像排布。 背景中,水墨山河化作金色的声波和飞鸟,与顶部的中文「长安未眠」完美契合。朱红、墨黑与鎏金的光影碰撞,把那种「盛唐赛博」的舞台炸裂感直接拉到了最高。 商业广告 · 山岚高山乌龙茶 再看一张奢侈品级的茶叶广告,最考验的是材质和文字。 哑光纸盒、烫金字、薄胎白瓷、胡桃木桌、袅袅茶汤蒸汽——五种质感堆在一张图里,任何一处露出塑料感就废了。 展览海报 · 山河入画 换到平面设计,这张图的高级感,是那种可以直接挂在顶级美术馆门口的水平。 U1 Pro极其聪明地处理了「二维与三维」的打破与重组,底部的山体还是带着在宣纸上洇开的墨迹,往上走,竟顺滑地变成了有真实光影的3D岩石和云层。 朱红色的丝带贯穿山谷,与山脚下极小的白衣人物形成鲜明对比,那种「寄蜉蝣于天地」的宏大尺度感扑面而来。 而且,标题、展期、地点、开放时间,不仅干净利落,而且一个字都没写错。 老实说,在生图领域,「长文本排版」和「物理科学逻辑」是公认的两座大山。 但U1 Pro的成图,直接把这两座大山给推平了。 《月相》中文科普海报画面中,从主副标题、四段密集的科普正文,到图注、底部知识卡片,几百个汉字竟然做到了逐字精准,零错字、零乱码、零「AI伪汉字」。 更绝的是,AI常常缺乏空间物理常识,但U1 Pro精准构建了「日-地-月」的位置关系示意图。 信息设计 · 中国茶的六大茶类 信息图再进一步:六个模块环绕中心茶杯,茶名、茶汤色、产地、山水小插画各就各位,几十处中文零乱码,配色克制、逻辑清楚——一张能直接挂上博物馆展板的图。 从繁华长卷到商业广告,从科普卡片到电影海报,同一个模型,一口气全包了。 这张《岚月》角色设定图,足以证明了U1 Pro具备了「主美级」的落地能力。 在这个二次元原创角色设定集中,AI一并绘制了主图,以及三视图、四个动作图、技能特效,外加一堆装备细节和中文资料卡。 角色面部、复杂苗族银饰、多层蜡染裙甲,在所有视角下保持绝对统一。 接下来,让U1 Pro和GPT Image 2进行一场「硬碰硬」的实战。 在同一提示词下,究竟谁的成图更胜一筹?话不多说,直接看效果。 先来看看这道「麻婆豆腐」菜谱图。 从整体观感来说,U1 Pro赢在了「清爽」。 它知道菜谱的重
ChatGPT终于能「搜自己」!攒了近4年的对话,一键翻出 ↗
ASI启示录 2026-07-18 18:26 北京 新智元报道 ChatGPT推出快满4年了。 这4年,你跟它聊过多少句话、传过多少张图、开过多少个项目,大概连自己也数不清。 可有一个痛点,你一定记得:想翻回三个月前那次对话,基本得靠运气。 侧边栏那个搜索框约等于摆设,会话一多,搜旧对话近乎不可能。 在OpenAI开发者社区,苦这个旧搜索久矣: 终于能找到那条消息了,为什么拖了这么久;那个老搜索栏,从来就没好用过;会话一多,搜旧对话就变得不可能;翻旧对话简直成了噩梦…… 这不是零星几句抱怨。 ChatGPT什么都能生成,可是你写过的稿、讨论过的代码、生成过的图、囤过的资料,随着对话越堆越多,「翻记录」越来越像大海捞针,侧边栏拉到手酸,也未必找得到三周前那次关键讨论。 而这一次,变了。 7月14日,OpenAI给ChatGPT上线了一套全新的统一搜索,把你在ChatGPT里的所有东西,塞进了一个统一入口:历史聊天、项目、上传的文档、生成的图片,全部能搜。 Web、iOS、Android三端同步,从免费版到企业版,全球所有计划同步开放。 真去把那几年的「存货」翻一遍你就会反应过来:ChatGPT第一次能「搜自己」了。 而这,绝不是补了个搜索框那样简单:它让你的数据更值钱的了。 对于每个人来说,AI时代最值钱的资产,不是模型,而是你自己攒下的这一大堆与AI互动的数据。 一个入口 搜遍你的整个ChatGPT 这次更新,不是让ChatGPT去搜互联网,那是它早就有的功能。 这次搜的,是你自己ChatGPT账号里攒下的东西。 入口就在侧边栏。 搜索范围是四类:聊天、图片、文档、项目,支持按内容类型过滤。 搜到了,点一下直达目标内容,不用再一屏一屏往回划。 这和之前那个ChatGPT Search网页搜索,完全两码事。一个帮你在世界里找信息,一个帮你在自己攒的东西里找信息。 不过这里有一条边界:跨内容搜索只覆盖「上传进ChatGPT、或在Project和Work里生成」的内容。 挂在外面的Google Drive这类已连接应用,暂时搜不到,官方也没给扩展的时间表。 因此,ChatGPT能翻到的,还只是你亲手交给它的那部分。 但光这部分,就已经够多了。 从聊天机器人 到你的个人知识库 一个搜索框,能有多重要? 还真不能小看。它补上的,是ChatGPT做了近4年、却一直缺的那块拼图。 过去这4年,ChatGPT本质上是个「会话工具」。你跟它聊的一切,都锁在一次次孤立的对话里。 聊完那一刻价值最高,过了一周,基本等于沉进海底:你明明记得自己讨论过某个方案,却怎么也捞不回来。 这次更新背后,藏着一个更大的变化:ChatGPT正在从「聊天机器人」,长成一个「个人知识库」。 说得再直白点,它开始长出自己的「文件系统」。 Notion、Obsidian管的是你自己的笔记,谷歌搜索管的是全互联网的信息。 而ChatGPT要接管的,是一片过去从没被专门打理过的地带:你和AI这几年共同生产出来的东西。 它们,才是你在AI时代留下的资产。 模型会一代代换,但你和AI一起攒下的对话、项目、素材,别人拿不走,也复制不来。 而现在,所有这些数据,在 ChatGPT中能够 被你随手翻到,随时调出来用。 你的数据 越搜越重 搜索让你这堆数据更好用,它也让OpenAI手里那份索引更完整、更值钱,但同时也更敏感。 你越能翻到三年前那次对话,这份记录本身就越清晰。可这里有个问题:它的边界,你很难完全掌控。 先看一个多数人没留意的默认设置。 消费级计划(Free、Plus、Pro)里,你的对话默认就会被拿去训练模型,除非你手动钻进Data Controls把它关掉。而多数人,从没点开过那个开关。 再看一件事。 今年1月5日,在纽约时报等媒体起诉OpenAI的版权案里,美国联邦法院维持了一项裁定:强制OpenAI交出2000万条去标识化的ChatGPT对话日志,交给原告一方。 这2000万条,只占它已留存日志的0.5%,后者的量级是「数百亿条」。 OpenAI搬出用户隐私来抗辩,法院没接受,其中一条关键理由是:这些对话,是用户「自愿提交」给OpenAI的。 OpenAI官网回应页:公开反对《纽约时报》调取2000万条用户对话记录的诉求。(图源:OpenAI官网) 更微妙的是,据TechCrunch报道,原告此前指控OpenAI一直谎称自己「搜不了」这些日志。 而现在,OpenAI转手就给每个用户端上了一个「随便搜」的功能。 搜索升级本身没有改动任何隐私政策,官方也没宣布新的数据用途,但它却让你这几年攒下的东西,分量更重了。 你跟它说过的每一句话,既是资产,某些情况下,也可能被翻开、被呈上法庭。 ChatGPT为啥突然需要搜索框? 因为,它早就不只是聊天机器人了。 把OpenAI这一两年的动作连起来看: 文件上传、Projects、Memory,再到能跑几小时长任务的ChatGPT Work、直接生成网站和轻应用的Sites、把C
港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26 ↗
新智元 2026-07-18 18:26 北京 新智元报道 MoE大模型正在成为高效推理的主流路线。 它把一个大模型拆成很多「专家」,每个token只激活其中一小部分。这样一来,模型总参数可以很大,但每次推理的实际计算量不会爆炸。对服务商来说,这几乎是一个甜蜜的工程答案:更大模型,更低成本,更高吞吐。 但这篇来自ICML 2026的工作发现,MoE模型最重要的组件之一——专家路由里,藏着一个新的系统级风险。 来自港科大的研究团队提出了RepetitionCurse,这是一种针对MoE大模型服务的黑盒压力测试方法。 它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量token路由到同一小批专家上。 论文链接: 结果某些GPU被打成straggler,其他GPU空等同步,最终拖慢time-to-first-token(TTFT),也就是用户看到第一个token的时间。 实验显示,在常见8-GPU EP部署上,RepetitionCurse可让MoE模型的TTFT增加20%到148%。 攻击原理 MoE的router,本质上像一个分诊台。 每个token来了之后,router会判断它该交给哪些专家处理。 正常文本有丰富语义,token的隐藏表示比较分散,router通常会把它们分给不同专家,这也是MoE模型训练时非常注重的专家负载均衡。 而RepetitionCurse利用的是另一个极端:当输入里出现高度重复的token模式时,连续token的表示会变得非常相似。 对router来说,这些token像一群「长得几乎一样的客人」,于是被反复送进同一批专家。 正常输入下,3个GPU负载接近33%/34%/33%;RepetitionCurse输入下,负载可能变成98%/1%/1%,一个GPU变成straggler,其他GPU必须停下等待。 问题从这里开始变得系统化。 在实际部署中,MoE模型通常使用Expert Parallelism,也就是把不同的完整专家放到不同GPU上。正常情况下,这能分摊计算压力;但如果大量token都被路由到同一GPU上的专家,那张GPU就会成为瓶颈,而其他GPU即使没干多少活,也必须等它完成之后才能继续同步,导致系统出现 单点拥堵。 Mixtral-8x7B上,正常输入的专家负载分布较均匀;RepetitionCurse 会让大量token在多个层上集中到少数专家,热力图出现明显高亮块。 论文把这种现象称为routing collapse。攻击输入让router的选择从「分散派单」变成「固定派单」,最终把MoE的并行优势反过来变成系统短板。研究团队指出,RepetitionCurse可以在黑盒场景下工作,不依赖模型参数,也不依赖后端routing细节。它的目标也不是控制输出内容,而是拖慢prefill阶段,从而放大TTFT。 过去MoE模型的安全问题通常只在模型输出层被考虑,例如「让模型生成很长」「让模型无限思考」「让Agent调很多工具」,研究人员指出它们在服务系统层也可能有可被利用的安全漏洞,即便输出只生成1个token,也可能通过破坏每个输入token的计算效率,让服务变慢。 攻击效果 对用户来说,大模型卡不卡,最直观的指标就是TTFT。 TTFT指从请求到达,到第一个token返回之间的时间。它是聊天机器人、Copilot、搜索问答、Agent服务里非常关键的体验指标。用户不一定知道后端用了多少GPU,但一定能感觉到「怎么还不开始说话」。 论文用一个简单指标衡量延迟放大: 如果这个值是2.48,就意味着攻击输入下,第一个token的返回时间是正常输入的2.48倍。 研究团队在vLLM上部署目标模型,使用ShareGPT中2048条用户请求进行测试。结果很直接:EP size越大,RepetitionCurse越容易把并行系统「拧成单线程」。 在Mixtral系列上,8-GPU部署下TTFT最高增加148%。在更稀疏的Qwen3-30B-A3B系列上,当EP size扩到32时,TTFT最高增加115%。 在常见8-GPU设置下,RepetitionCurse还会把原本P99的SLA保证拉低到P98.6到P86.4,意味着服务违约率从1%上升到最高13.6%。 不同MoE模型在不同EP size下的TTFT LAR。 更麻烦的是,LLM服务不是一个请求一个请求孤立执行的。为了吞吐,服务系统会把多个请求打包成batch。这意味着攻击请求可以「搭车」影响正常请求。 论文分析了两种场景。 第一种是mixed-user batches:攻击请求和正常用户请求进入同一个batch。此时,正常用户明明没有发送异常输入,也会一起等待被拖慢的batch完成。 第二种是attack-only batches:某段时间里只有攻击请求进入系统。即便正常用户没有和攻击请求同batch,攻击请求也会占用prefill能力,导致后续正常请求排队更久。 攻击请求不仅增加同batch用户的TTFT,还会让后续batch的排队时间上升,影响沿服务队列传播。 RepetitionCurse不需要让后端GPU全部满载。它只需要制造一个足够慢的straggler,就能让同步机制把其他GPU一起拖住
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了 ↗
关注前沿科技 2026-07-18 15:45 北京 让AI自己改自己的Agent Harness,这事已经被顶级Agent社区注意到了。 Self-Harness团队 投稿 量子位 | 公众号 QbitAI 让AI 自己改自己 的Agent Harness,这事已经被顶级Agent社区注意到了。 上海人工智能实验室团队提出的 Self-Harness,近期被 LangChain CEO、联合创始人Harrison Chase 转发,也被 前OpenAI副总裁Lilian Weng 收进自进化Agent相关博客。 它盯上的不是换模型,而是Agent外层那套Harness。 做法很直接。模型先检查自己的运行轨迹,从失败里挖出模式,再提出有边界的Harness修改,最后交给回归测试决定要不要采纳。 实验结果显示,在Terminal-Bench-2.0上,底层模型、工具环境和评测协议都保持不变,只改Harness,三个模型后端都拿到了held-out提升。 其中Qwen3.5-35B-A3B总提升达到 104%,MiniMax M2.5和GLM-5分别提升 28% 和 24%。 论文和项目已经公开,文末附链接。 △ LangChain CEO/co-founder Harrison Chase转发Self-Harness 让Harness自己进化 Agent Harness可以理解为包在模型外层的一套运行装置,覆盖系统提示词、工具使用规则、验证器、运行时控制策略和轻量middleware。 在多轮工具任务里,它决定Agent怎么调用工具,什么时候停,失败后怎么恢复,产物又该如何验证。 过去,这套东西主要靠工程师手调。要读大量执行轨迹,找失败原因,改提示词或工具规则,再反复跑benchmark。 模型越多、任务越杂,Harness就越难继续按“一模型一套人工调参”的方式扩展。 △ 三种Harness改进范式:人工改、强模型外援改,以及Self-Harness让模型基于自身轨迹改 Self-Harness怎么工作 换到Self-Harness,流程被压成三步。先挖弱点,再提改法,最后跑回归。 Weakness Mining:从失败轨迹挖弱点 系统先让当前Harness驱动固定模型完成一批任务,记录完整执行轨迹、工具调用和评测结果。 失败样本不会被当成孤例处理。Self-Harness会结合验证器反馈、Agent行为和失败之间的因果关系,把可复用的失败机制聚起来。 这样,“某个任务没过”会变成“这一类失败可能来自同一种Harness缺陷”。比如缺少最终产物、重复执行无效命令、工具报错后不恢复,或者探索太久却迟迟不进入实现。 Harness Proposal:提有边界的改法 拿到结构化失败证据后,同一个模型会切换成proposer,针对已挖出的失败机制提出候选Harness edit。 这些edit只能落在预先声明的可编辑表面上,不能把整个Agent控制架构推倒重来。 每个提案都要说明想改变哪种行为,可能带来什么回归风险,以及为什么可能修好当前失败模式。 Proposal Validation:用回归测试拍板 候选Harness会在同一评测协议下重跑,并和当前Harness对比。 接受规则很保守。held-in或held-out至少一个split要提升,另一个split不能退化,才会进入下一代Harness。 这也是它和普通“自动改prompt”的差别。Self-Harness不让模型凭感觉拍板,而是把每一次改动都放进可记录、可复现、可回退的评测闭环里。 △ Self-Harness自改进闭环,包括弱点挖掘、修改提案和回归验证 不换模型,只改外层也能涨 论文在Terminal-Bench-2.0上做了系统评测。 Terminal-Bench-2.0是一个多轮智能体benchmark,任务运行在容器化终端环境中,覆盖文件管理、命令执行、错误恢复、产物验证等真实工具使用能力。 在固定模型、工具集、任务环境和评测配置的前提下,Self-Harness只改Harness。结果三个模型都出现提升。 MiniMax M2.5总提升 28%,Qwen3.5-35B-A3B总提升 104%,GLM-5总提升 24%。 这组结果的重点不是又换了一个更强模型,而是在同一个模型外面,Harness本身也可以被搜索、验证和迭代。 △ Terminal-Bench-2.0结果,三个模型后端在Self-Harness后均获得held-out提升 更重要的是,每个候选修改都经过held-in和held-out回归测试。 换句话说,Self-Harness不是堆更长的提示词,而是在一次次验证门控后,只留下真的带来收益、又没有明显回退的Harness edits。 △ Qwen3.5 Self-Harness进化路线,通过多轮验证门控保留有效edits 不同模型暴露出不同弱点 Self-Harness的另一个观察更像工程现场。不同模型不是同一种失败。 MiniMax M2.5:找到线索后迟迟不交付 在初始Harness下,MiniMax M2.5有时会持续探索数据集。即使已经找到关键元信息,也迟迟不创建评测所需的答案文件,最后因为缺少产物或超时失败。 Self-Harness保留的修改会鼓励Agent更早识别必需输出,先创建初始产物,并在工具调用过长时转向具体实现和验证。 Qwen3.5-35B-A3B:工具失败后容易陷入循环 Qwen3.5-35B-A3B的常见问题,是工具失败后进入重复编辑、重复覆盖或重复命令循环,甚至在停止前删除评测必需文件。 Self-Harness为它引入依赖预检查、失败后产物恢复、避免完全相同命令重试,以及由工具错误触发的artifact-focused提醒。 △ Qwen3.5保留下来的code-level Harness edits,集中在依赖预检查、产物恢复和重试约束。 GLM-5:更需要管住shell状态和节奏 GLM-5暴露出的弱点更集中在shell会话状态,以及从探索切到实现的时机。 改进后的Harness会提醒Agent在修改环境变量、安装工具或调整路径后,确认这些变化能跨命令持续可用。当长时间探索还没有形成产物时,系统也会推动它转向实现与测试。 这说明Self-Harness不只是给所有模型加一段通用提示。它会根据每个模型在真实轨迹中暴露出的弱点,生成并筛选适合它的Harness改动。 为什么会引起关注 Agent越来越像跑在工具环境里的系统,而不是只回答单轮问题的模型。 在这种设定里,模型能力只是一部分。外层Harness决定它是否知道何时调用工具,如何从错误中恢复,是否保留正确产物,退出前有没有做验证。 过去,Harness工程更像经验活。Self-Harness给出的方向是,让模型自己参与这套经验的挖掘和改写,但最终仍由评测而不是自评来拍板。 它没有证明“Agent可以完全自己进化”,也没有绕过benchmark范围。论文里的结果主要来自Terminal-Bench-2.0和固定模型后端。 但作为一个自进化Agent的组件,它给出了比较清楚的边界: 改什么,怎么改,怎么验,什么时候拒绝。 研究团队 该工作来自上海人工智能实验室团队,论文题为Self-Harness: Harnesses That Improve Themselves。 从现有文档看,团队公开了论文和项目地址,读者可以查看具体实验设置、Harness edits和代码。 论文: 项目地址: 一键三连 「点赞」「
量子位编辑作者招聘 ↗
关注前沿科技 2026-07-18 15:45 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至[email protected],邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
妙啊!无人机直连卫星传Token ↗
原创 关注前沿科技 2026-07-18 15:45 北京 世界人工智能大会最高奖 金磊 发自 上海 量子位 | 公众号 QbitAI 不儿,现在连 无人机 都开始传 Token (词元)了??? 对,你没看错,上视频! 就像视频里演示的那样,这个无人机啊,它身上背了2个东西,一个是 生成式智能传输 (Generative Transmission) 盒子,另一个是小型卫星通信设备。 无人机拍到视频后,就可以先在端侧把画面编码成Token序列,再 直接连接卫星,把信息传回后方。 这事儿要放以前啊,且得先在现场搭一套临时通信设备,无人机把视频传给地面接收器,地面设备再通过卫星,把信息送到后方指挥中心。 而且这套传统方案还有两道限制:一是无人机不能离地面通信设备太远,否则连接会受到影响;二是在设备载荷和功率限制下,可用的卫星链路带宽有限,传统方法也很难实时回传高清视频。 这便是 中国电信人工智能研究院(TeleAI),刚刚在 WAIC 2026 提出的新技术路线;其背后这套融合AI、通信和网络的技术体系,则是 智传网(AI Flow)。 就在此次发布前一天,智传网(AI Flow)还拿下了WAIC大会最高奖项 卓越人工智能引领者奖(SAIL) 中的 赋能(Applicative)奖。 据了解,TeleAI已经在 国内首次 攻克了轻小型无人机直连卫星并进行高清视频实时稳定传输。 这个“首次”解决的,是轻小型无人机长期面对的两道物理难题: 一边是载荷:通信设备越重,消耗的电量越多,无人机的续航和机动性也会跟着受到影响。 一边是卫星链路:更高的通信能力往往需要更大、更高功率的设备,但轻小型无人机载荷有限。因此,其可用带宽通常较窄,高清视频难以实时回传;直接降低码率,又可能造成画面模糊、卡顿或关键细节丢失。 也正如我们刚才展示的那样,智传网(AI Flow)的思路是换一种内容来传。 发送端先理解视频,把场景、人物、物体结构和运动状态等关键信息编码成Token序列。Token穿过卫星链路后,接收端再利用生成式模型,把视频重建出来。 换句话说,过去几年我们讨论Token,重点往往是大模型一次回答消耗了多少、能生成多少内容。 到了TeleAI这里, Token开始从聊天框里跑出来,进入无人机、卫星,甚至还有机器人和水下设备之间。 这事儿,就有点意思了。 无人机不用围着基站飞了 要理解无人机直连卫星的价值,可以先看传统应急通信是怎么做的。 洪水、地震等灾害发生后,现场可能同时面临断路、断电和断网,通信保障人员通常会在灾区搭建临时接收和发射设备,再通过卫星恢复通信。 这种方式能够解决基本的连接问题,但无人机仍然需要与地面设备保持通信。飞得太远,超出地面设备的覆盖范围,画面回传就会受到影响。 比如在洪水灾区,人暂时无法进入的区域,可以先派无人机完成大范围勘察。无人机拍下道路、积水、房屋和被困人员等信息,在端侧编码成Token,通过卫星传回指挥中心。 接收端重建出视频后,指挥人员可以据此判断道路是否中断、房屋是否存在风险、救援力量应该从哪里进入。 与此同时,智传网(AI Flow)的生成式智能传输能力,也已经进入实际应急场景。 今年,TeleAI与中电信应急公司将基于智传网 (AI Flow) 技术的千余套设备,投入全国31个省份的一线防汛抗洪工作。 从一次技术演示走向跨省应用,意味着生成式智能传输已经开始接受真实环境的检验。至于轻小型无人机直连卫星,则是此次新近跑通的一项技术能力,后续还将进一步走向产品化和实际应用。 沿着无人机到卫星的链路继续向上, TeleAI 还在推进另一项工作—— 将智传网(AI Flow)解码模型部署到在轨卫星。 传统星地链路通常面临上行带宽有限、下行带宽相对充裕的情况。如果解码模型能够在卫星端完成部分计算和重建,就可以减少对地面算力节点的完全依赖,再通过下行链路将结果发送给接收端。 而当通信链路回到地面,智传网(AI Flow)连接的设备就从无人机 扩展到了机器人。 具身智能想在现实环境中执行任务,需要处理人与机器、机器与机器之间的通信与协同。操作人员要看到机器人看到的画面,机器人也要及时收到远程控制指令。多台机器人共同作业时,还需要共享周围环境和任务进展。 智传网(AI Flow)结合5G低时延能力,可以将具身智能遥操作的端到端时延压缩至20-50毫秒,让机器人的远程控制半径从局部区域扩展至跨城际乃至全国范围。 即便机器人进入没有基站的荒野区域,也可以通过卫星链路回传现场画面,并接收来自远端的操作指令。 远程控制半径变大,只是其中一层价值。 智传网(AI Flow)采用统一编码的 词元流,还可以连接不同类型、不同厂商的机器人。 TeleAI 自研机器人以及合作伙伴的机器人,可以共享环境感知、目标位置和任务信息。 一台机器人发现道路受阻,可以把结果同步给其他机器人;另一台机器人找到可通行路线,也能将经验传回系统。 多台设备由此减少重复感知和重复计算,逐渐形成分布式群体智能,并进一步走向 基于连接与交互的智能涌现。 这条链路再往前走,便 进入了水下。 水下通信一直是行业中的一道难题。在自然水域中,水体对信号的吸收、散射等因素会造成明显衰减,远程无线实时传输高清视频尤其困难。 依托智传网(AI Flow), TeleAI 此次实现了自然水域中的远程无线实时高清视频传输,相关核心载荷已经搭载在自研“空海跨域潜航器”上。 这种设备可以从空中进入水下,在海底光缆巡检、水下勘探、海洋牧场和应急搜救等场景中执行任务,再将现场画面传回。 从轻小型无人机直连卫星,到机器人跨城遥操作,再到浑浊水体中的视频传输, TeleAI 正在把同一套通信逻辑延伸到天空、卫星、地面和水下。 这些设备的形态各不相同,有的在空中飞,有的在地面走,有的需要潜入水底。但它们面对着一个共同问题: 怎样在带宽有限、网络不稳定的环境中,把真正有价值的信息传出去? 从比特流到词元流 这个问题的答案,就藏在智传网(AI Flow)对传输对象的改变里。 传统视频通信主要处理比特流。摄像头采集画面后,编码器分析连续画面中哪些像素发生变化、哪些内容可以压缩,再把处理后的视频数据通过网络传到接收端。 虽然在光纤、5G等带宽相对充足的环境中,这条技术路线已经非常成熟。不过一旦进入卫星窄带、远洋、水下和灾区,高清视频的数据量依然可能超过链路的承载能力。 智传网(AI Flow)的思路,是 让通信从“比特流”走向“词元流”。 发送端的神经编码器先对原始视频进行理解,从中提取场景语义、物体结构和运动状态等信息,再将其编码成Token序列。 这些Token通过卫星、5G或水下通信链路抵达接收端后,生成式模型结合Token与预训练阶段获得的世界知识,重建出连贯的视频。 如果用一个更简单的比喻来理解,传统视频通信更接近把一幅画切成大量小块,再尽可能完整地送到目的地。 生成式智能传输会先提炼构图、人物、动作和关键细节,再把这些高度浓缩的信息交给接收端,由模型完成重建。 网络少传一些数据,发送端和接收端多做一些计算。通信资源与计算资源之间由此发生置换,这就是 “计算换带宽”。 这种“计算换带宽”的实现,背后对应着 TeleAI 提出的信容律:通信资源与计算资源可以在一定条件下相互置换。当链路带宽受限时,发送端与接收端利用模型完成信息提取和生成式重建,以更多计算降低需要传输的数据量。 除了信容律,TeleAI的相关理论研究还延伸到了 正激励噪声 ——并非所有噪声都只会干扰模型,在一定条件下,噪声也可能成为促进模型训练和演化的正向因素。 那么,它究竟能省下多少带宽? TeleAI用一句话概括: 用发信息的带宽通电话,用通电话的带宽传视频。 此次发布的两组数据,正好对应这两步。 在音频传输中, 智传网(AI Flow)可以在0.266Kbps的极低码率下完成语音通话和音乐。根据此次发布信息,这一速率相比传统编解码方案降低约500倍,实现了世界最低速率的语音通话。 到了视频传输,数据量的差异更加明显。 在下面这个足球视频中,一边采用100Kbps码率,另一边的传统方案码率为3600Kbps。智传网(AI Flow)在较低通信速率下,传输并重建1080P@30fps的视频。 不同场景中的实际效果,还会受到信道状况、模型规模、设备算力和视频内容等因素影响。不过,这组数据已经能说明词元流
中兴通讯联合国产算力厂,拿下WAIC SAIL之星 ↗
原创 关注前沿科技 2026-07-18 15:45 北京 把超节点从概念做成产品 克雷西 发自 上海 量子位 | 公众号 QbitAI 今年WAIC的SAIL之星,依然颁给了超节点,依然颁给了中兴通讯。 中兴通讯这次在WAIC上,拿出了自己的版本,叫 OEX超节点。 基于OEX加dOCS架构的国产高性能Matrix超节点方案,同期 拿下了本届大会的SAIL奖,这是中兴通讯连续第二年拿到这个奖项。 超节点这条路,英伟达用GB200 NVL72蹚出来之后,已经成了大厂们扎堆冲的方向。 这条路被英伟达验证之后,中国已经开始把它基建化、工程化了。 同一个展台上,还摆着一部手机。 AI智能体手机 努比亚NaviX Ultra,由中兴通讯努比亚全链路主导打造,也在这次大会上第一次公开亮相。 一个是机房货架里的互联架构,一个是揣在兜里的手机,中间隔着的东西不少。 中兴通讯把它们放进了同一个展台,AI基础设施、AI应用、AI智慧家庭、AI智能体手机,四个展区挨在一起。 机架里的超节点、机房里的供电系统、手里的这部手机,说的其实是同一件事—— 怎么把算力从生产出来,一路送到用户能摸到的地方。 AI全链路,尽在一个展区 中兴通讯这次在WAIC上搭了四个展区,分别叫 AI基础设施、AI应用、AI智慧家庭、AI智能体手机。 AI基础设施展区里, OEX超节点 是重点。 同一展区里,还有中兴通讯的 AIDC算电协同方案和算力网络架构。 这两套方案,负责把算力从机架里稳定地送出去。 AI应用展区里,中兴通讯展示了 「新支点AIOS」,这套系统覆盖行业场景、家端产品、个人终端产品三大方向。 它的定位是端-边-云协同的智能生态体系,借此,中兴通讯想要让AI从单点能力走向系统能力。 同一展区里还展出了 企业级智能体平台Co-Claw。 在中兴通讯内部,它被用来打造「AI驱动型组织」,聚焦办公、研发、运营;对外,其具有的AI能力可以复制给工业、轨交、矿山、冶金、电力这些垂直行业。 同时,中兴通讯也展示了其 AI健康医疗方案,并摆出了几个具体数字——体检报告生成效率提升10倍以上,一份HTA (卫生技术评估) 报告能在1到5分钟内产出,心血管辅诊在万例临床验证里准确率达到96%。 这个展区里还有三款人形机器人组成的具身智能矩阵。 体重30公斤级的轻量仿生机器人—— 中兴星仔,负责商业服务场景;负载30公斤以上的双足重载机器人 中兴星擎 、轮式重载机器人 中兴星旺,瞄准的是则是工业制造场景。 它们身上装的自研星巧系列灵巧手,作业精度能到0.2毫米以内,负载15公斤以上,控制器用的是星核车规级主芯片。 AI智慧家庭展区,展示的是家庭终端产品矩阵,这个矩阵已经连续五年拿下全球市场份额第一,年发货量超过1亿台,AI中屏产品累计发货也超过了300万台。 AI智能体手机展区里,站着这次大会的重头戏之一——全球首款AI智能体手机 努比亚NaviX Ultra。 这款量产旗舰产品由中兴通讯努比亚全链路主导打造,核心卖点是「一句话,就能让AI跨应用复杂任务」,用中兴通讯自己的话说,叫「一句话,努比亚都包了」。 就在今天,中兴通讯还举办了一场「全栈智算生态论坛」,论坛上,AI基础设施展区里展出的「中兴OEX超节点」正式发布。 一组超节点,就是一个AI工厂 中兴通讯是业界第一个提出正交架构超节点设计理念的公司。 他们这次拿出来的产品,叫 OEX正交架构超节点。 这个超节点单柜能塞进128个GPU,集成度在业内排第一, 往上还能Scale up扩展到1.6万卡规模。 能做到这个规模,靠的是架构层面的一处硬创新。 传统机柜内动辄几千根线缆,通信损耗大,维护也麻烦。 OEX的解法,是把计算托盘和交换托盘垂直交叉连接,这也是「正交」两个字的来历。 整套设计因此做到了0线缆、无背板,机内GPU之间的信号路径变短,信号损耗更低,时延也更低,互联成本大幅下降。 线缆和背板解决的是硬件本身的问题,芯片之间怎么协同又是另一回事。 中兴通讯的协同思路,是依托CPU、机内机间互联、网卡、DPU这五类芯片的 协同感知技术,跟主流GPU厂商深度合作,按需精准匹配最优方案。 于是,OEX超节点里的组件便可以相互解耦,按需灵活更换、择优组合,避免了被某一家芯片厂商锁死。 另外,中兴通讯还自研了机内互联交换芯片,同时兼容工信部主导的CLink协议和博通的SUE协议,相当于给不同阵营的GPU都留了一扇门。 架构和协同打通之后,还有落地速度和运维效率这两个问题。 为此,中兴通讯采用了前置式开发模式,也就是在GPU芯片发布之前,就联合芯片厂商做仿真、做架构预适配、做算法的前置优化。 等芯片真正量产出来,配套的整机方案已经提前跑通。 除此之外,中兴通讯还统一定义了机柜形态、接口规范、互联协议,形成了一套可以复制的工程范式,产品落地周期因此 从1年以上压缩到半年以内。 围绕这套范式,中兴通讯给GPU厂商提供了即插即用的「算力集装箱」,厂商把芯片装进去就能用,不用再自己从头设计机柜和互联。 模块化设计还带来了另一个好处——机柜的安装时间从原来的天级,压缩到了分钟级。 规模上,这套架构没有停在单机柜。 造单机柜的基础上,中兴通讯用 电交换+光互联 的方式做灵活扩展,构建出规模最高可达16384个GPU的集群超节点。 这一整套打法,不是中兴通讯关起门来自己做的。 中兴通讯联合了曦智科技、壁仞科技、沐曦股份、燧原科技、天数智芯等芯片厂商,在OEX的基础上叠加了dOCS (分布式光交换) 架构。 这种架构,能根据算力任务动态调整节点之间的连接拓扑,不用固定死一套线路。 它帮助中兴和这些厂商实现了更好兼容,从而扩展出了Matrix超节点。 这套联合方案,拿下了今年WAIC的SAIL奖,这是中兴通讯连续第二年拿到这个奖项。 供电和散热,谁来解决? 除了OEX超节点,中兴通讯还面向大模型和高密智算时代,打造了一套算电协同、源网荷储一体化的 AIDC整体解决方案。 其中,800V高压直流方案将于今年9月投入商用。 这套方案主要解决两个问题,一个是供电损耗,一个是散热压力。 这两个问题,背后都有同一个诱因——由于智能算力需求的增长,机柜功率密度也随之猛增。 供电损耗这道题,卡在传统供电链路上。 传统数据中心用的是多级交流直流转换链路,从市电到UPS到服务器电源这一路转换下来,供电效率大约是94%。 机柜密度越高,损耗就越严重。 以一个10兆瓦级的数据中心算,传统供电模式下,单是电力损耗每年就要多花数百万元运营成本。 功率密度的增高,还会带出另一重麻烦。 同一电压下,功率的增高必然伴随着电流变大,于是铜排和电缆截面就得做得更粗,施工难度、占地面积、铜材成本一起往上走。 中兴通讯的思路也顺理成章,既然功率=电流×电压,那么不想让电流太大,就得把电压提上去。 于是,便有了中兴通讯的 800V HVDC方案。
同一个链接,你和同事打开的不一样:Claude让AI页面活了 ↗
ASI启示录 2026-07-17 21:03 北京 新智元报道 站会还没开始,故障已经快排查完了。 一位Anthropic工程师在开会前发起一次排查,Claude Code扒完日志,直接甩出一份Artifact:时间线、可疑提交、错误率曲线,全在上面。 她顺手把链接丢进群里。 到站会真正开始时,Claude已经跟着调查进展,把这个页面重新发布了两次。 所有人打开的是同一个视图、同一份上下文,谁也不用再追着问「你给我讲讲智能体到底查到了啥」。 注意,这位工程师分享的,并不是一张静态页面,而是一个能够自动更新、可交互的页面。 站会那一幕,靠的是Claude Code今年6月发布的Artifacts。7月16日,Anthropic又给它加了关键一手: Artifacts可以调用MCP连接器了。 按照官方的说法:你搭出来的仪表盘和应用,能给每个打开它的人,按需去取数据、执行操作。 同一个页面,面对不同的查看者,各自拉各自的数据,干各自权限内的活。 目前Pro、Max、Team、Enterprise四档都能用,唯一的限制是:公开分享出去的Artifact,享受不到这套能力。 看上去只是多了个数据接口,但真正的变化是过去AI生成的页面是死的,现在它开始「活」了。 过去,AI也能生成仪表盘,但那份数据几乎都来自你当时的会话,一分享出去,页面很快凝固成一张静态截图,别人打开只能看,动不了。 现在不一样。Claude Code生成的Artifact,能直接连上真实的工具和数据环境,读到活的数据。 再往前一步,页面上还能摆上会动手的控件,从一块看板变成一个能操作的界面。 就这么一点变化,AI从「生成内容」往「生成软件」,迈了一大步。 一次构建 每个人打开都不一样 今年6月,Anthropic推出了Artifacts。 它能把Claude Code一次会话的成果,直接变成一个实时、可分享的网页,链接常驻,随时打开。 6月18日,Anthropic宣布Claude Code支持Artifacts:把进行中的工作预览成实时、可交互、可分享的网页。 但那时候有个天花板:页面里的数据,是会话构建时那一刻抓的。你分享出去,别人看到的永远是那个截面,页面是静态的。 这次补上的,正是这块。页面现在能在有人打开它的时候,去调MCP连接器,连上当下的实时数据。 但这里有个反转:调用走的是查看者本人的账号,不是你的。 也就是说,两个人打开同一个看板,会因为各自账号能碰到的数据不同,看到不一样的东西。页面自己从头到尾看不到任何人的凭证,所有调用由claude.ai代为发起。 你搭一次页面框架,剩下的由每个查看者的身份去填:这才是真正的「一次构建、千人千面」。 Claude Code的Artifact查看器:分享菜单可选版本与可见范围,页面本身是含漏斗图、指标卡的看板。 要用上这个功能,Claude Code得升到v2.1.209及以上,Pro、Max、Team、Enterprise都支持。 它不只给你看 还给你一个能按的按钮 Artifact不是普通的文本输出,它是Claude Code把整段工作过程,直接转换成一个能交互的网页。 一次会话,左边在跑,右边的可交互页面同步成形。 官方随手举了几个例子:PR走查、系统说明页、能筛选能排序的Dashboard、会自己勾选的发布检查清单。 一次会话跑完,工作成果就变成一个页面,团队成员点开链接就能看。 它几乎能贴着每个岗位来。 比如,法务想要一份把所有依赖库许可证列全、还标出哪些是copyleft的审计表,一句话就能生成。 安全团队要的漏洞清单,每一条都能直接跳到出问题的那行代码。 管云账单的,想搞清楚每个月这笔云钱花在哪、哪块最烧钱,一句话就出。 最省事的地方,是你什么都不用先搭。 Claude Code是拿你整段会话的上下文来拼这个页面的:你的代码库、你连着的工具、这次对话本身,全是现成的原料。 一个故障页,能把出错的测试、它背后的函数、监控里冒出来的错误尖峰、还有这次会话里跑出来的根因推理,全汇到同一张纸上。 要在过去,这种页面你得自己接数据源、立一套基础设施才做得出来;现在你只管开口要,它从已经存在的东西里为你搭建。 只是能看到实时数据,那还只是个会自动刷新的看板。 真正让它再上一个台阶的,是它开始「动手」。 发一条Slack消息、更新一个issue,这类会真去改动外部系统的操作,能做成一个按钮直接放在页面上。 和取数一样,动作走的也是点按那个人自己的账号。 一张会呼吸的表,就这么迈向了一个能操作的界面。 当然,这里有个前置条件:授权。 每个查看者第一次触发调用前,claude.ai会先弹一次授权。点了拒绝也不要紧,刷新页面还会再问。没连对应连接器的人,页面照样打得开,只是那些实时区块空着。 官方还支了一招:让Claude在每个实时区块里写一句提示,告诉对方这块缺哪个连接器、去哪儿连上,省得他只看到一片空白,一头雾水。 查看者首次打开连接器页面时的授权弹窗;背后的指标区块空着,等待BigQuery连接。 页面自己会更新 最先省掉的是开会 这些页面是活的。 开篇那个站会的例子,就是这么来的:Claude跟着调查一路往前推,同一个页面被一次次刷新。 每次更新都是同一个链接下的新版本,还带着历史记录,随时能回滚。 最先被改掉的,其实是协作方式。 过去团队对齐一件事,靠的是有人把结论转述一遍,信息在传话里层层衰减。 现
从Token Capital到企业认知主权:别把大脑交给大模型公司! ↗
新智元 2026-07-17 21:03 北京 新智元报道 最近,微软CEO Satya Nadella和Palantir CEO Alex Karp几乎在同一时间,从不同角度提出了一个越来越尖锐的问题: 当人工智能开始深度参与企业的思考、决策和执行之后,企业究竟是在获得一种新的生产力,还是在逐渐把自己的知识、经验、判断和竞争优势交给外部模型公司? 这并不是一个简单的数据安全问题,也不仅是一个模型成本问题。它真正触及的是企业在AI时代最核心的权力结构:谁拥有企业的认知资产,谁控制企业的学习闭环,谁能够从每一次业务交互中持续进化,以及最终谁拥有企业的大脑。 从这个角度看,纳德拉近期的两篇文章和Karp的CNBC访谈非常重要。它们标志着全球顶级科技企业的讨论重点,正在从「模型能力有多强」,转向「企业如何避免失去自己的认知主权」。 佟佳睿(Richard Jiarui Tong)博士最近发布了一篇评论,将纳德拉的两篇长文、Karp的CNBC 访谈,与他本人更早提出的企业认知系统和认知主权框架放在同一条思想演进线上。 值得注意的是,纳德拉等公开提出的问题,正是佟佳睿博士更早在企业认知系统、ECS、NSEAP和KSTAR体系中已经开始系统设计和工程化解决的问题。 佟佳睿(Richard Jiarui Tong)博士担任IEEE人工智能标准委员会(AISC)主席,并领导IEEE P3394大语言模型智能体接口标准工作组, 在AI标准化与产业实践方面具有重要影响力。 纳德拉的第一层判断 2026年6月14日,美国东部时间上午11:33,纳德拉在X上发表长文 《A frontier without an ecosystem is not stable》。对应北京时间为2026年6月14日晚上11:33。 推文链接: 这篇文章中最重要的概念,是他提出的 Token Capital。 传统企业积累的是Human Capital,也就是员工、专家、组织经验、专业判断和管理能力。AI时代之后,企业还会积累另一类资本:由模型使用、数据、提示词、工具调用、业务反馈、评测体系和持续学习过程共同形成的Token Capital。 纳德拉强调,真正有价值的AI能力,并不是简单调用一个外部模型。任何企业都可以买到相似的模型,也都可以使用相似的API。 企业真正的差异化来自于,它是否能够围绕自己的业务建立一个学习闭环,并把每一次模型使用转化为组织自身的能力积累。 换句话说,模型本身并不是壁垒。 真正的壁垒是企业是否能够把自己的业务知识、专业判断、执行过程和反馈结果,持续沉淀为一种可以重复使用、持续优化和独立拥有的能力。 纳德拉实际上承认了一个非常关键的事实: 企业不能只拥有AI的使用权,企业必须拥有AI使用过程中形成的学习资产。 这已经比早期「购买大模型、部署Copilot、提高员工效率」的叙事向前走了一大步。 但是,Token Capital仍然只是一个资本层面的概念。 它指出企业需要积累AI能力,却还没有完全回答这些能力到底以什么形式存在、如何被管理、如何被验证、如何被更新,以及如何防止它们依附于某一个模型供应商。 而这正是佟博士提出企业认知系统的原因。 纳德拉的第二层判断 2026年7月12日,美国东部时间上午11:09,纳德拉又在 X 上发表了关于 Reverse Information Paradox,反向信息悖论 的论述。对应北京时间为2026年7月12日晚上11:09。 推文链接: 传统的Arrow Information Paradox指出:信息卖方如果不披露信息,买方无法判断价值;但如果先披露,买方可能已经免费获得了信息,因此不再需要购买。 纳德拉认为,AI时代出现了相反的情况。 企业为了获得模型服务,必须首先把自己的问题、上下文、数据、工作流程和判断标准暴露给模型。模型公司不再只是向企业出售知识,反而能够通过企业的使用过程,理解企业是如何思考、如何工作和如何创造价值的。 也就是说,企业不仅在支付 Token 费用,还在持续向模型系统贡献: 真实的业务问题; 高价值行业语境; 专家的判断方式; 任务分解路径; 决策偏好; 成功与失败的反馈; 结果评价标准; 以及企业内部尚未显性化的知识。 这些信息单独看可能只是一次提示词、一次模型调用或一次用户纠正,但积累起来,它们构成的并不是普通数据,而是一张企业的认知地图。 模型供应商可能逐渐看到: 企业关注什么问题,如何定义目标,如何评价答案,哪些建议会被接受,哪些会被拒绝,以及企业真正依赖的价值判断是什么。 这就是反向信息悖论的本质: 企业以为自己只是在购买智能,实际上也可能在向外部系统持续输出自身的智能。 企业原本最有价值的部分,并不一定存在于某一张数据库表里,而可能存在于员工如何解决问题、主管如何做判断、专家如何平衡风险,以及组织如何从结果中学习。 AI 系统恰恰能够从这些交互中提取这些隐性的认知资产。 Karp的愤怒 2026年7月1日,Palantir CEO Alex Karp 在 CNBC《Squawk Box》节目中接受采访。CNBC 随后在同日发布了访谈视频。 如果说纳德拉的表达仍然带有平台生态和产业结构的抽象性,那么 Karp 的表述则更加直接,甚至带有明显的愤怒。 Karp认为,当前大模型产业存在两个严重问题。 第一个问题,是企业正在支付大量Token成本,却没有获得相应的业务价值。 第二个问题更严重:企业可能正在把自己的数据、流程、业务逻辑和竞争优势交给模型公司。 他把企业区别于竞争对手的核心能力称为 Alpha。 Alpha不只是客户名单、财务数据或技术专利。它还包括企业知道如何运营、如何做决策、如何配置资源、如何识别风险,以及如何在复杂环境中实现结果的独特能力。 Karp要求每一家使用 AI 的企业都必须能够回答几个问题: 谁拥有这些数据? 数据被缓存在什么地方? 提示词是否受到保护? 交互产生的知识是否会被转移给供应商? 企业是否正在被模型公司理解、抽象,甚至复制? Axios后来将这一问题总结为:AI正在成为企业思考、销售和决策的操作系统,因此企业必须像保护自己的专有大脑一样保护 AI 系统。Axios 还将「Alpha」定义为企业区别于市场的知识,将「主权 AI」定义为企业对模型和连接专有知识的应用层保持控制。
刚刚,WAIC杀出国产「桌面超算」!150B大模型,放你桌上跑 ↗
ASI启示录 2026-07-17 21:03 北京 新智元报道 7月17日,上海,黄浦江畔,夏风滚烫。 2026世界人工智能大会(WAIC 2026)在上海世博、张江、西岸「三地四馆」同步引爆—— 超10万平方米展区、1100余家企业、3000余项展品、超300款全球首发产品集中亮相,9位图灵奖、诺贝尔奖得主参会。 这阵仗,用「盛况空前」都稍显克制。 而就在WAIC开幕的同一天上午,我们注意到一家国产芯片公司搞了一件大事。 此芯科技,一家成立于2021年、专注自研高性能智能体CPU的公司,在上海举办了一场以「芯聚无限 智启新元」为主题的发布会。 此次,他们正式发布了 AGX Agentic Compute 智能体计算战略——一把打通芯片、整机和操作系统,构建覆盖端、边、云的全域算力底座。 这步棋,下得正是时候。 DeepSeek掀起的国产芯片适配潮还在持续发酵,OpenAI和Anthropic相继官宣自研芯片,全球AI算力的版图正在被重新撕扯。 而在端侧,一个更深层的变化正在发生—— AI不再只是「聊天」,它开始真正「干活」了。 智能体(AI Agent)从概念走向落地,算力需求的重心也从「训练」向「推理与执行」急速迁移。 两条曲线撞在一起,一个被集体忽略的问题浮现—— 智能体,到底该跑在什么芯片上? 答案有多炸裂?发布会现场,一台办公桌大小的机器被抬上台——AGX Station。在配置相应AI加速卡后,可 本地推理70B至150B参数规模的大模型,多台设备还可级联组成桌面级算力集群。 算力的新货币,叫Token 今天上午,此芯科技创始人、CEO孙文剑登台,开口就扔出了一个判断: 我们正站在一个从「生成内容」到「完成工作」的范式跃迁的起点,而此芯科技,将是这场变革的核心驱动力。 这话乍听有点大。但顺着它的逻辑往下走,站得住。 过去几年,AI算力围着Scaling Law转,火力全部压在「训练」上训练是军备竞赛,但它只打一次。 模型训完了,真正烧钱的是接下来7×24小时永不停歇的推理账单。 但2026年风向变了。AI Agent不再是PPT上的愿景,而是真的开始拆任务、调工具、跑流程。Gartner预测,到2028年将有约三分之一的企业级软件内嵌智能体功能。 于是衡量算力的标准,从峰值算力转向任务完成效率,而 Token则成了智能体时代算力价值的新「货币」。 为什么偏偏是2026?孙文剑给了四个理由: 大模型迭代周期已经缩到「每几个礼拜」,能力撞上临界点; 工具链和框架把开发门槛按了下去,开发者蜂拥入场; 资本认定智能体是继大模型之后的又一个核心赛道; 而最关键的商业闭环,在过去半年内跑通了。 他顺手举了一个此芯自己的例子: 此芯的芯片是前年出来的,去年才和一批合作伙伴把底层硬件搭好——「那时候呢,其实还没有智能体。」 等智能体真的起来,他们回头一看,发现自己的硬件「非常适合做智能体」。这次伏笔被兑现了,机会留给了早有准备的人。 三大支柱:从一颗CPU 长成一张全域算力网 在孙文剑看来,智能体已经不是被动响应的知识库,而是能主动拆解目标、调用工具、执行任务的「任务执行者」。 它要真正规模化落地,卡在三件事上: 跑得稳、用得起、可持续。 正是基于这一洞察,此芯科技率先构建起AGI时代的智能体原生一体化平台。 发布会上,孙文剑正式发布AGX Agentic Compute战略。 围绕「跑得稳、用得起、可持续」三大命题,此芯科技确立了 三大战略支柱。 第一,聚焦智能体专用 CPU。 这是整个战略最硬的地基。 智能体的负载和聊天机器人完全不是一回事——它要连续思考,要频繁调用工具,要在长上下文里维持记忆。CPU不再是「打杂的」,而是任务调度与执行的中枢。 所以此芯的选择是: 从底层架构开始,为智能体重新定义一颗 CPU,而不是拿通用芯片凑合。 自研的此芯P1,就是这块地基石。 孙文剑在台上透露了一个细节: 五年前定义P1的时候,他们把高性能 CPU 、兼容性极强的 GPU,和一颗「前瞻性」的NPU捏在了一起。 「五年前我们对这个芯片,还怀着一个忐忑的心情。」五年后,这颗6纳米的芯片被产业界拿去,用进了各行各业,忐忑变成了底气。 第二,实现端边云全域协同。 智能体不会只活在云上,也不会只活在端上。 一个真实的业务流程,可能前一秒在本地拆意图,后一秒调云端大模型补脑子,再下一秒回到边缘执行。算力一旦被割裂在不同架构、不同生态里,协同就是句空话。 此芯的解法,是坚持了多年的「 一芯多用 」: 一颗高性能智能体CPU,配上不同的操作系统、不同的大模型和软件,打进消费、工业、车载、边缘四大计算场景。 再往前一步,就是这次战略里更大的那句话—— 以自研此芯P1为核心,打造覆盖端、边、云全场景的全域算力底座,真正实现
7月19日,和LingBot主创们聊聊2.0发布周的故事|WAIC具身派对 ↗
蚂蚁灵波科技 2026-07-17 20:06 北京 LingBot主创团队首次公开亮相! 过去一周,蚂蚁灵波连续发布和开源LingBot全栈2.0六款基础模型,并压轴发布业界首个具身原生世界动作模型LingBot-VA 2.0, “具身原生” 成为WAIC前夕行业最热议的话题之一。 你可能已经读过Paper、看过Demo视频,但一定还有很多想聊的: 为什么放弃“微调捷径”,选择从头预训练这条更难的路? 6款模型环环相扣的全栈布局背后,是怎样的技术判断? “具身原生”这条路线,接下来会把机器人带向哪里? …… 7月19日晚上,蚂蚁灵波联合量子位,在WAIC会场旁的世博天地AOKKA Coffee开一场专属After Party—— 这也是LingBot 2.0发布后,主创团队的首次公开亮相。 没有讲台、没有冗长汇报,一杯咖啡或特调,和他们围坐面对面,听发布背后的取舍、弯路与思考,也把你逛展时攒下的疑问当面抛给他们。 7月19日,周日,17:30-20:00 上海世博天地AOKKA Coffee 高品质、松弛感、轻量干货。 逛完WAIC的周日晚上,来续一杯,和最懂LingBot的人,聊聊发布背后的思考与故事。 *本文系量子位获授权刊载,观点仅为原作者所有。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 阅读原文 跳转微信打开
具身数采新方案:数字遥操作,现已开源,达摩院出品 ↗
关注前沿科技 2026-07-17 20:06 北京 RynnWorld-Teleop:用生成式世界模型替代真实机器人 RynnWorld-Teleop团队 投稿 量子位 | 公众号 QbitAI 往机器人身上装一台相机,自己戴上手套做动作,让机器人跟着动——这就是当前做机器人训练数据的方式:物理遥操作。 每一条数据,都得靠真人操作员、真实机器人、真实时间,一条一条“演示”出来。 慢。贵。累。 能否将操作员从真机中解放出来,使数据采集的边界取决于人的创造力,而非硬件的可用性? 阿里巴巴达摩院 的最新工作 RynnWorld-Teleop 对此给出的方案是:用生成式世界模型替代真实机器人。 操作员的手势驱动一个实时视频生成器,由“数字世界中的机器人”完成全部视觉演示,同时自动获得关节级的动作标签。该方案被称为 数字遥操作(Digital Teleoperation)。 在双臂灵巧手上的真机实验表明,仅用RynnWorld-Teleop生成的数据训练策略,就能在真机上实现有效的零样本Sim2Real迁移;把合成数据叠加到真实数据上,还能稳定提升成功率。代码、模型权重均已开源。 数字遥操作:以世界模型替代真实机器人 △ 物理遥操作(上)与数字遥操作(下)的对比。数字遥操作用RynnWorld-Teleop替换真实机器人,两条流水线都产出同步的(视觉观测,机器人动作)对。 数字遥操作与传统遥操作的本质区别,可以从数据链路上加以厘清。 传统物理遥操作的流程为:操作员通过遥操设备做出动作示范,真机实时跟随执行并同步录制关节状态,机载摄像头拍下画面,最终得到(视觉观测,关节动作)对。在整条链路中,真机是不可替代的环节。 数字遥操作则以生成式世界模型替代真机:人的手势驱动世界模型,世界模型实时合成“若机器人执行该手势,其第一人称摄像头将观测到的画面”,而手势本身通过retargeting直接转化为关节动作标签。最终输出同样是(视觉观测,关节动作)对,区别仅在于观测来自生成器而非真实摄像头。 这一替换在形式上简洁,但要真正成立,世界模型必须同时满足三个条件。 第一,以机器人为中心。 生成的画面必须是机器人第一人称视角,而非人手画面,否则下游模仿学习策略因视觉分布不匹配而无法使用。现有的动作控制世界模型 (如Hand2World、EgoSim等) 大多仍停留在以人手为中心的阶段。 第二,动作可回溯。 每一帧生成画面背后的底层动作信号,必须能够还原为具体的机器人关节角度。若动作仅是隐式的latent变量、缺乏对应的关节级标签,则生成视频只能观看而无法用于训练。 第三,实时可交互。 操作员需要在观测画面的同时进行操作,于闭环中完成复杂技能。当生成延迟超过200ms时,操作员将丧失对场景的控制感,采集数据的质量随之下降。当前多数DiT生成模型的推理速度处于2–10FPS,难以支撑实时交互。 RynnWorld-Teleop是首个 同时满足上述三个条件 的系统。为了满足这些需求,研究团队设计了多项核心技术。 三项核心设计:应对深度模糊、本体鸿沟与实时性 △ RynnWorld-Teleop总览。动作被渲染为深度感知骨骼视频并编码进隐空间;预训练视频DiT通过分布对齐的patch embedding分支引入手势条件;模型再被蒸馏为因果学生以支持流式自回归生成。 设计一:深度感知的动作特征,让2D骨骼承载3D信息 操作员的手势经手部追踪设备捕获,得到21个关节点的3D坐标;而世界模型的主干是2D视频生成器,无法直接将3D点坐标输入图像隐空间。 常见做法是将3D关节投影为2D骨骼图后再输入,其局限在于投影会丢失深度信息。人手在相机前方20cm与40cm处做同一抓取动作,2D投影可能几乎相同,而生成画面本应存在明显差异。 RynnWorld-Teleop采用深度感知骨骼渲染 (Depth-Aware Skeletal Rendering),将深度编码进骨骼图的视觉属性:每个关节的颜色与绘制半径随其到相机的距离动态变化,距离近者颜色偏暖、半径较大,距离远者颜色偏冷、半径较小。由此,尽管仍是一张2D图像,深度信息已被显式编码进颜色通道与尺寸通道,世界模型可通过学习从这些视觉线索中还原三维空间关系。 渲染后的骨骼序列被送入预训练VAE编码器,映射到与目标视频在空间和时间维度上对齐的隐空间。为避免该控制信号破坏预训练视频模型的分布,作者采用分布对齐的加性融合策略:先进行均值-方差对齐,再通过初始化为0的gate渐进注入。消融实验表明,该方案显著优于直接拼接——拼接会使FVD (衡量生成视频与真实视频分布差异的指标,越低越好) 从585恶化至1191。 设计二:渐进式跨域训练,先学人手物理,再迁移到机器人 世界模型需要生成的是机器人第一人称视频,但现实中带有精细骨骼标注的大规模机器人操作数据十分稀缺,而人类第一人称操作视频则相对充裕——EgoDex有7400万帧,VITRA有3070万帧。 RynnWorld-Teleop采用 渐进式跨域训练(Progressive Cross-Domain Training),分两个阶段进行。 阶段一:第一人称人类视频预训练。在大规模人类第一人称操作视频上训练,使模型掌握“手势到手-物交互视觉效果”的基本物理规律。该阶段数据量级超过1亿帧,覆盖大量不同物体与交互模式。此时模型尚不了解机器人的外观,但已习得物理世界中物体对手部接触的响应规律。 阶段二:机器人域适配。收集1800条配对的人机遥操作数据 (同步记录人手骨骼与机器人第一人称视角) 并在此基础上微调。该阶段数据量级较小 (约43万帧),但由于第一阶段已建立交互先验,模型能够快速适配机器人的视觉外观与运动学特征。 消融实验具有较强说服力:跳过阶段一、直接在机器人数据上训练,FVD从585升至2598——43万帧不足以让模型从零学会手-物交互的物理规律,却足以在1亿帧预训练基础上完成风格迁移。该路线的核心逻辑在于:先在大数据上学习物理规律,再在小数据上适配视觉外观。 △ RynnWorld-Teleop的生成效果展示。手势流可映射到人类与机器人两种本体;模型把大规模人类视频中的交互先验成功迁移到机器人操作,画面保持高保真与时序一致。 设计三:流式自回归蒸馏,从2.8FPS到40FPS的实时化 基于Wan2.2训练的模型是一个双向注意力的视频扩散Transformer,生成质量高但推理速度仅为2.8 FPS,而实时交互至少需要30 FPS,两者相差约一个数量级。 RynnWorld-Teleop采用流式自回归蒸馏 (Streaming Autoregressive Distillation),将双向教师蒸馏为因果学生——学生模型的注意力被约束为“仅关注过去” (因果掩码与KV Cache),使每生成一帧仅需一次前向推理,而无需重新处理全部历史帧。 蒸馏分两步进行:第一步为因果流匹配预热 (Causal Flow-Matching Warm-up),使学生模型先适应“仅关注过去”的约束;第二步为分布匹配蒸馏 (DMD),通过对抗训练使学生的输出分布逼近教师,并将采样步数从50步压缩至4步。 一个关键的工程细节在于:DMD阶段的梯度不仅在当前chunk内回传,还会跨chunk穿过KV Cache传播,从而保证相邻chunk之间的边界不出现突变,避免长视频生成中出现明显的接缝。 最终的因果学生模型在480×832分辨率下达到40FPS,每帧延迟约25ms。该延迟优于真实机器人相机30Hz的标准采集频率,意味着操作员在数字遥操作过程中 不会感受到可察觉的延迟。 从手势到训练数据:数字遥操作的完整流水线 世界模型仅是引擎,要将其转化为能够产出可训练数据的系统,还需要一条完整的流水线。RynnWorld-Teleop的数据生成流程分为三步。 Retargeting(动作映射): 操作员佩戴HTC Vive追踪器,系统实时捕获其6-DoF手部姿态,通过坐标系变换与阻尼最小二乘逆运动学求解器,映射为机器人的54维关节动作向量 (双7-DoF手臂与双20-DoF灵巧手)。该步骤确保人手的每个动作都有一一对应的机器人动作标签。 骨骼条件合成(Skeletal-Conditioned Synthesis): 以一张场景参考图为起点,操作员手势被渲染为深度感知骨骼序列,驱动世界模型实时生成机器人第一人称视频。该环节具备重要的扩展性:参考图不必来自真实场景,通过图像编辑工具替换其中的物体或背景,即可生成训练集中未出现过的场景数据。 分块重锚定(Chunked Re-anchoring): 纯自回归生成容易出现视觉漂移,即随时间推移生成画面逐渐偏离真实物理状态。RynnWorld-Teleop以81帧为一个chunk,在chunk边界处用真实帧重新初始化模型,以确保长时间演示的物理一致性。
量子位编辑作者招聘 ↗
关注前沿科技 2026-07-17 20:06 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至[email protected],邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
全球市占第一后,普渡在WAIC开始回答机器人下一场战争 ↗
原创 关注前沿科技 2026-07-17 20:06 北京 一脑多形,重构机器人产业新范式 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 如今,具身智能行业,是越来越务实了。 相比于造出一台更像人的机器人,业内更关心谁能让机器人长期运行在真实世界,并持续积累经验。 因为对于机器人而言,走出实验室只是第一步。 近日,国际权威咨询机构弗若斯特沙利文发布的《2025年全球具身智能与商用服务机器人独立市场研究报告》揭示了这样一个行业共识: 商用服务领域,正是具身智能规模化落地的“第一战场”。 在这个高频、刚需、ROI(投资回报率)清晰且极易实现全球化复制的赛道上,中国厂商不仅占据了主导地位,更在开启一场深刻的产业革命。 报告显示,从全球商用服务机器人收入、全球商用服务机器人出货量、全球商用清洁机器人收入、中国商用服务机器人出海四大维度评估, 普渡机器人 均排名第一。 该公司的产品已在全球85个国家和地区部署, 累计落地超过13万台机器人。 这些机器人正在餐饮、酒店、工业、仓储等大量真实场景中运行。 大规模部署不只代表商业成绩有多突出,更意味着其产品能持续获得真实世界反馈的能力。 这一点很重要。 当具身智能进入商业化阶段, 真正决定智能上限的,是它能否在一次次任务执行、环境交互和反馈中理解物理世界。 D7是普渡聚焦工业、零售等场景的类人形智能机器人。 和很多只展示单点能力的机器人不同,D7被放在了一个更大的问题里观察: 当机器人真正走向工业、零售、仓储等复杂环境,一次次工作的经历,如何沉淀为可复用的智能经验? 这些经验,又是如何被迁移到不同形态的机器人上的? 超13万台机器人冲在一线 正如PC、智能手机和智能汽车相继定义了不同的时代,机器人正成为Physical AI时代最重要的终端载体。 让机器人进入真实环境,也成了行业共识。 站在厂商角度, 真实环境已是兵家必争之地。 只因机器人和传统AI面对的是完全不同的数据环境。 大模型可以通过海量文本学习知识和语言规律,但机器人需要面对真实物理世界中的复杂变化。 它不仅要知道一个物体是什么,更要知道如何接近它、如何拿起它、如何适应变化中的环境。 这些能力,很难仅靠实验室里的训练或者有限的演示获得。 机器人必须进入真实场景,在一次次任务执行、环境交互和失败反馈中积累经验。 这也是为什么过去几年, 具身智能行业开始越来越重视「真机数据」。 但问题在于: 机器人想获得真实数据,首先要进入真实场景。而进入真实场景,本身又需要机器人足够成熟。 经典的「鸡生蛋」问题又出现了。 没有大量机器人部署,就没有足够真实数据;没有真实数据,机器人又很难快速提升。 少数企业正在尝试通过商业化部署打破这一怪圈。 过去十年,普渡持续将机器人投入餐饮、酒店、工业、仓储等真实场景。 目前,普渡机器人已经在 全球85个 国家和地区,部署 超过13万台机器人,覆盖餐饮、酒店、工业、仓储等16个行业。 这些机器人每天面对的,不是标准化测试环境,而是真实世界中的各种变化。 13万台机器人冲在各行业的一线,每一次运行,都在积累对于真实环境的理解。 △ 沙利文独立研究报告 据普渡方面披露,目前其每年 累计产生3650万小时 的导航数据、 1580万小时的操作数据。 但这些数据的价值,并不只是规模。更重要的是,它们来自机器人 第一视角。 过去,机器人厂商卖的是设备。 机器人完成一次任务,数据价值往往也就停留在这一次任务本身。 但未来的智能机器人,竞争逻辑会完全不同。 部署规模扩大,真实场景增加,数据不断回流,模型能力提升,机器人适应更多场景,进一步扩大部署。 以此形成真正的数据飞轮。 这也是为什么过去几年,越来越多企业开始争夺真实应用场景。 因为场景不是机器人商业化的终点,而是智能进化的起点。 不过,单纯依靠真实数据还不够。 AI模型可以通过不断训练快速迭代,但机器人每一次真实世界中的错误,都可能对应真实的时间成本、设备成本和安全风险。 如何让这些数据被高效地利用,是未来机器人竞争的关键。 一个经济又实用的方案是:真实世界提供经验,虚拟世界扩大训练规模。 普渡也认可这两者的结合,引入 「虚实双闭环」机制。 机器人可以先在World Simulator仿真环境中进行大量训练。 在虚拟世界里,机器人能够反复尝试不同任务组合,提前学习各种可能出现的情况。 然后,再通过真实环境中的Human-in-Loop反馈进行校准。 仿真负责扩大训练规模,现实负责提供真实反馈。 当机器人开始学会迁移经验 仅凭几十条人工示范轨迹,就能让机器人快速适配全新作业任务,训练机器人已经如此简单了么? 数字背后,或许真正值得关注的,是 机器人终于跳出「从零学起」的模仿模式,具备了沉淀、迁移、复用通用物理经验的能力。 在此之前,由于不同机器人形态差异大,单独训练成本太高,整个行业长期困在「一机一模、一场一训」的低效范式里。 无论是餐饮配送、商超清洁还是工业搬运,只要更换机器人本体、切换作业场景,研发团队就要重新搭建采集环境、人工录制上万条操作轨迹、从零训练专属模型。 耗费大量人力、时间不说,关键是采到的数据无法跨机型、跨场景流通复用。 本质问题还是,机器人只会机械复刻记录下来的固定动作,无法理解动作背后的物理逻辑与因果经验。 这也是传统机器人泛化能力薄弱、落地适配成本居高不下的根源。 针对导航与操作协作断层、机器人缺少物理直觉、不同机器人形态之间数据割裂的问题,普渡机器人自研了 具身智能大模型PuduFM。 它并非传统算法的简单迭代升级,而是支撑普渡「一脑多形」战略的核心技术底座。 PuduFM有三个关键组件。 PIM物理预言家 它给机器人植入人类同款「物理直觉」。 人看到一个湿滑的杯子,会下意识知道需要轻一点拿。 但传统机器人做不到。它只能识别画面像素,无法读懂图像背后的物理关系。 PIM(Physical Intuition Model)采用因果注意力Transformer架构,不走市面上多数机器人「死记画面像素」的老路。 它不盯着图片表面,而是进入潜空间内,提炼物体运动背后的动力学逻辑,把重力、摩擦力、物品变形、重心偏移这些现实里的物理规则,转化成机器能看懂、能计算的数据特征。 机器人当下的位置、姿态,加上它准备做出的动作,都会传给PIM。 它能提前预判这么做会产生什么物理结果,算出抓东西会不会打滑、移动会不会撞上障碍物,给后续动作划定安全边界。 简单来说,这一步用来解决机器人「看得见,但不理解」的问题。 VLA多模态对齐 这是打通导航与操作的认知壁的关键。 以前机器人是各干各的,看画面、听懂人话、走路、抓东西分成几套互不连通的系统。 经常出现听懂指令、走到目标跟前,却抓不稳物品、动作衔接不上的情况。 VLA相当于把视觉、语音、机器人移动、机械臂操作全部整合到一套统一的思考逻辑里。 同时接入PIM给出的物理预判,先读懂任务需求,再看清周边环境,最后生成符合物理规则的连贯动作。 不管是远距离行走,还是近距离抓取操作,全部一套大脑统筹。 不同款式的配送、清洁、工业机器人都能共用这套能力,解决过去机器人“走得到,但做不好”的问题。 World Model仿真引擎
逛完WAIC 2026我悟了:国产AI芯片的真对手,根本不是英伟达的GPU ↗
关注前沿科技 2026-07-17 20:06 北京 发布芯片只是拿到了入场券 允中 发自 凹非寺 量子位 | 公众号 QbitAI 比英伟达GPU更难跨过去的,是 CUDA。 这是逛完 WAIC 2026 之后,关于 国产AI芯片 的一个越来越清晰的感受。 过去,大家围着国产芯片问的是,峰值算力多少?制程多少纳米?和英伟达相比差多少? 走到 清微智能 的展位前,你会发现一件有意思的事:这里摆的不只是芯片。 可重构芯片、4K超节点、 RAISA软件栈 、行业应用,被放在一起呈现——像是在回答所有国产芯片厂商都绕不开的问题: 芯片发布之后呢?模型怎么跑起来?算力怎么扩展?客户凭什么把核心业务迁过来? 这个问题背后,是国产算力竞争逻辑的一次切换:从发布会上的参数对比,转向能否形成稳定、易用、可规模部署的系统能力。 国产算力真正要替代的,也不只是一颗英伟达GPU,更是CUDA背后经过多年积累形成的 开发习惯、工程标准、迁移成本和生态信任。 所以,发布芯片只是拿到入场券。 让客户敢迁、能用、愿意长期使用,才是真正的国产替代。 造出芯片只是第一步 CUDA早已不只是一套编程接口。 英伟达官方对CUDA Toolkit的定义包括加速计算库、编译器、运行时,以及调试和性能优化工具,并覆盖嵌入式设备、工作站、数据中心和超级计算机。 换句话说,客户采购的不是一颗孤立的GPU,而是一套已经运行多年、经过无数开发者和应用验证的生产体系。 因此,国产算力要解决的核心问题,不只是芯片能不能算,而是 “客户能不能低成本地换、稳定地用、持续地扩”。 本文以国产创新架构AI芯片代表—— 清微智能 为样本,从架构、芯片、软件栈、超节点和算力网络等多个维度展开观察。 可以看到,在当下更强调确定性、易用性和经济性的产业环境中,清微智能并未局限于追求单颗芯片的参数领先,而是走出了一条贯通底层架构、软硬件系统与产业应用的完整生态构建之路。 过去,AI芯片企业选择几个核心参数与英伟达进行横向比较,这种比较并非没有意义。 峰值算力、显存容量、功耗和价格,都会决定一款产品能不能进入客户的初步评估名单。 但参数解决的是“能否上桌”,无法直接回答“能否部署”。 一套算力系统真正进入生产环境,至少要同时具备四种能力。 第一层是 芯片和计算卡,决定基础性能与能效; 第二层是 驱动、编译器、算子库和开发工具,决定模型能否迁移; 第三层是 服务器、超节点、网络和集群管理系统,决定算力能否规模化聚合; 第四层是 模型适配、解决方案和行业案例,决定客户是否敢于采购。 或许清微智能目前试图搭建的,正是这条完整链路:底层以可重构计算架构形成差异化,中间通过芯片、服务器、超节点和RAISA软件栈完成系统封装,上层再进入智算中心和金融、能源、教育、医疗等行业。 笔者从清微智能官网看到,其已建设超过 10余个 可重构算力中心,算力卡累计订单超过 4 万张,适配上线模型及应用超过 200个。 公司同时将RAISA软件栈、FlagOS生态协同和主流模型Day-0适配,列为当前生态建设的重点。 制程受限,用架构效率来破局 国产高端算力芯片面对的第一个现实约束,是 先进制程和高端供应链能力。 如果完全沿着传统GPU路线竞争,后进入者不仅要追赶芯片设计,还要同时追赶制程、存储、先进封装、互联和软件生态。 任何一个环节落后,都可能在最终性能上被放大。 而 清微智能的 可重构架构,选择的是改变问题的解法: 不把全部性能增长寄托在晶体管数量和制程升级上,而是尝试提高已有晶体管的有效利用率。 传统固定架构像一座提前划分好车间的工厂。无论当天生产什么产品,机器的位置、生产线和工序都相对固定。一旦计算任务发生变化,部分硬件资源就可能闲置,或被用于并不适合的任务。 可重构架构则试图让计算资源根据任务动态组合。面对矩阵计算、卷积、稀疏计算或不同模型结构时,芯片可以通过软件重新组织数据流和计算单元,让硬件形态更接近当前任务。 清微智能官方技术页面显示,其可重构技术已从1.0、2.0演进至3.0,并将“软件定义硬件”作为核心特征。 公司同时布局三维存算融合与Torus-X算力网格,希望分别解决计算效率、数据搬运和大规模互联问题。 按清微智能在智源大会期间披露的口径,传统架构的有效晶体管利用率不足40%, 可重构数据流引擎可将这一指标提高至70%以上。 其逻辑不是让芯片拥有更多晶体管,而是让更多晶体管在具体任务中真正参与计算。 等同于最终业务性能。客户真正关心的仍然是 大模型吞吐、单Token成本、时延、精度和集群稳定性。 但它提供了一种不同于单纯追逐先进制程的竞争思路:当物理条件受到限制时,通过架构提高资源效率,可能比单纯增加晶体管数量更具现实意义。 以集成超制程,算力瓶颈解题思路 芯片的计算单元变快之后,下一个问题很快就会出现: 数据来不及送到计算单元。 大模型推理和训练不仅需要计算,还需要不断从存储系统中读取权重、缓存中间结果,并在不同芯片之间传输数据。很多时候,计算单元并没有真正满负荷工作,而是在等待数据。 这就是所谓的内存墙。 清微3.5D异构堆叠与三维存算融合技术,试图缩短计算芯粒和存储芯粒之间的物理距离。 按照公司给出的比喻,传统二维芯片的数据传输更像一条“单车道”,三维堆叠则相当于将道路扩展为立体的“四车道”。 △ 可重构数据流优势 相关方案采用Chiplet和3.5D异构堆叠,将可重构计算芯粒与DRAM存储芯粒进行高密度集成,把部分信号传输距离从毫米级压缩到微米级,以提升带宽并降低数据搬运带来的延迟。 这条路线的意义在于,国产算力竞争的重点开始从单颗芯片能完成多少次计算,转向 整个系统能否持续向计算单元供应数据。 但这同样是一项工程挑战。 3.5D堆叠涉及散热、封装良率、供电、芯粒互联和测试体系。 概念模型能够证明技术方向, 量产成本、可靠性和长期交付能力,才决定它能否真正转化为产品优势。 为何说单卡再强也会折损在集群? 大模型时代,算力竞争的基本单位正在从单颗芯片,变成 超节点和算力集群。 △ 可重构架构芯片示意图,兼顾通用与高效的算力 一张计算卡性能再高,也无法独立承担万亿参数模型、大规模训练和高并发推理任务。 芯片必须通过高速互联组成服务器,再由服务器组成超节点和千卡、万卡集群。 此时, 系统损耗 会迅速成为核心问题。 芯片之间的数据同步、通信等待、网络拥塞和任务调度,都会让理论峰值算力在集群中不断折损。 客户真正获得的,不是计算卡参数相加后的数字,而是扣除通信和调度损耗后的有效算力。 清微智能在WAIC 2026中提到的 4K超节点方案,通过可重构芯片和Mesh网络组织4096颗芯片,其互联成本较国外同类方案 降低约90%。
没有符合当前条件的资讯。