DAILY BRIEF
Monday
次日 03:00 补充更新
28 itemsWho’s Afraid of Chinese Models? ↗
Who’s Afraid of Chinese Models? Interesting proposal from Ben Thompson that both addresses the hypocrisy of labs outlawing distillation against their models despite training on unlicensed data, and could help US open models compete more effectively with their Chinese counterparts: The U.S. should pass a law that (1) makes explicit that collecting data for training models is fair use, and (2) bars terms of service that forbid distillation, for U.S. companies at a minimum. Stopping distillation — which is literally just querying the API — is nearly impossible; the U.S. should go the other way and lean into a new copyright policy that both indemnifies the labs and also guarantees that what they learned fuels further innovation for everyone else. Ben also theorizes that Alibaba's decision to release Qwen 3.8 Max as open weights - a reversal from their decision not to release Qwen 3.7 Max in May - may have been influenced by a recent speech by Xi Jinping, who said: We should seize this rare, historic opportunity to encourage open source, openness, collaboration and sharing. Via John Gruber Tags: ai, generative-ai, llms, training-data, qwen, ai-ethics, ai-in-china
Safety and alignment in an era of long-horizon models ↗
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
FlashRT:用于引导智能体部署实时多模态应用的智能体驾驭工具 ↗
Real-time multimodal applications, including voice agents and interactive video generation, compose heterogeneous models into pipelines whose efficient deployment requires application-specific decisions about placement, streaming, and intra-model parallelism. Existing serving systems and auto-parallelism compilers commit to limited transformations and fixed workload assumptions, so achieving high performance on a new application requires hand-crafting an efficient implementation. We present FlashRT, an agent harness that guides coding agents to lift simple developer-written reference implementations into optimized multi-GPU deployments that flexibly weigh target metrics like latency and throughput. Using a new chain-of-program paradigm, FlashRT directs a generic coding agent through a multi-pass transformation process where an agent transforms the reference into an intermediate representation (IR) to capture data dependencies and persistent-state scopes, validates this IR via a sequential interpreter, and performs static analyses to identify candidate transformations. Then, the agent iteratively implements, verifies, and benchmarks each candidate under a measurement-gated optimization loop to produce effective deployments that span different hardware budgets. Across various applications, including video world models and multimodal LLMs, FlashRT converts reference implementations into highly efficient deployments, delivering up to ~70x latency reduction and 2.8x throughput improvement on NVIDIA B200 GPUs. On AMD MI355X GPUs, FlashRT matches the peak latency reduction while increasing peak throughput improvement to 3.6x, demonstrating that agent-driven optimization can be more scalable on platforms with less mature expert optimization. In fact, for Qwen3-Omni text-to-audio inference, FlashRT reduces response latency by 65% compared to the expert vLLM-Omni implementation on AMD MI355X.
LLM作为教练:面向不可验证任务的体验式学习 ↗
Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.
分布偏移下用于忠实生成的令牌级离策略学习 ↗
We propose Token-Level Off-Policy Labeling (TOPL), an off-policy training paradigm that reframes post-training as a token-level correctness prediction task. Our key intuition is that by training the model to distinguish good and bad tokens in a response, we naturally guide the model towards generating good tokens, while avoiding the pitfalls that come with directly training the model to generate off-policy tokens. Experiments on document summarization tasks show that TOPL achieves strong out-of-distribution generalization across 11 datasets against a diverse set of sequence-level and token-level baselines. We further demonstrate that TOPL transfers effectively to machine translation, suggesting that its benefits generalize across different faithful generation tasks. Through ablation studies, we confirm that our token-level learning signal is critical to good performance; sequence-level analogues do not confer similar benefits. Finally, we show that TOPL induces interpretable model updates: the LoRA adapters learned through TOPL function as linear classification heads and steering vectors.
RynnBrain 1.1:迈向更强大且具泛化能力的具身基础模型 ↗
We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.
HOMIE:通过多模态智能增强实现以人物和物体为中心的视频个性化 ↗
Human-object centric video personalization (HOCVP) is a core task within subject-driven video generation. However, existing methods suffer from two key limitations. First, most approaches focusing on inter-subject personalization still struggle to strike a balance between high subject fidelity and accurate interaction patterns between humans and diverse objects, especially when objects represent abstract concepts such as logos. Second, while intra-subject references (e.g., OCR maps, multi-view inputs) are expected to enhance subject fidelity, most existing works lack mechanisms to understand such latent correspondence. To address both challenges, we propose HOMIE, an HOCVP framework that tackles both inter- and intra-subject input settings in a unified manner. Compared to previous approaches, HOMIE proposes a better MLLM integration strategy to extract knowledge of reference-level relationships without compromising the controllability of text encoders or incurring costly re-alignment. Specifically, we introduce global multimodal guidance within self-attention to better align MLLM-derived semantic features with VAE tokens. Furthermore, we propose modality-reference embedding to differentiate tokens from MLLM features and VAE tokens and associate intra-subject reference image tokens. Extensive experiments validate that our method achieves state-of-the-art performance across various HOCVP tasks. Project Page:
SWE-Pruner Pro:代码LLM已经知道该修剪什么 ↗
Pruning long context for coding agents has been a vital technology for efficient context management. While existing context pruning methods such as SWE-Pruner realize this by attaching a separate code classifier, we find the agent itself encodes internal representations indicating the relevance of code context when reading tool output. Based on this finding, we propose SWE-Pruner Pro, which prunes tool outputs directly inside the agent. Concretely, a small head turns the agent's own internal representations into a keep-or-prune label for each line, with a length-aware embedding keyed to each tool output's line count. Across two open-weight backbones and four multi-turn benchmarks, SWE-Pruner Pro saves up to 39% of prompt and completion tokens while preserving task quality, with bounded inference overhead. Notably, on MiMo-V2-Flash SWE-Pruner Pro additionally raises the SWE-Bench Verified resolve rate by +3.8% and the long-context Oolong accuracy by +2.2 points.
DiFA:扩散模型的推理时前向过程对齐 ↗
The prevailing inference framework for diffusion models formulates generation fundamentally as a problem of numerical integration. This perspective casts the model as an exact estimator, neglecting the inherent statistical uncertainty of the denoising process. In this work, we propose Forward-Process Aligned Diffusion prediction (DiFA), a training-free framework that reframes inference-time data prediction refinement as a sequential state estimation problem. Rather than reusing past outputs solely for numerical integration, DiFA treats iterative data predictions along the reverse trajectory as correlated observations to build a forward-aligned temporal consensus. Inspired by Kalman filtering, this consensus aggregates historical predictions according to structural consistency and noise-level compatibility. To counteract the over-smoothing tendency of temporal consensus, we introduce a deviation guidance mechanism to adaptively preserve residual details. Empirically, DiFA yields significant improvements on CIFAR-10 and ImageNet across the evaluated metrics, including FID, IS, and FD-DINOv2, demonstrating that aligning inference with the forward statistical structure substantially improves generative fidelity.
TimeLens2:基于多模态LLM的通用视频时序定位 ↗
Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video lengths, domains, query forms, and viewpoints. Existing training strategies are misaligned with this set-valued task: long-video labels often rely on brittle one-pass annotation, while reinforcement-learning rewards either fail to distinguish non-overlapping predictions or require fragile segment matching. TimeLens2 treats temporal evidence as an interval set throughout supervision and optimization. TimeLens2-93K constructs reliable multi-span supervision through caption-derived proposals, independent localization, cross-agent consensus, semantic verification, and boundary refinement. Our temporal Wasserstein reward computes exact one-dimensional \(W_1\) between uniform distributions over merged interval supports, providing dense, matching-free feedback under unequal cardinalities and equivalent fragmentation; temporal IoU complements it with precise-overlap feedback. Across seven benchmarks, TimeLens2-2B outperforms all size-matched baselines on every benchmark, while the 4B and 8B variants achieve state-of-the-art performance, surpassing open-source models with up to 397B parameters. The 2B, 4B, and 8B variants improve over their Qwen3-VL backbones by 14.2, 13.0, and 18.1 mIoU points, respectively.
EvolvingWorld:用于交互式文学世界中角色扮演智能体与世界模型协同演化的开放模式框架 ↗
This paper introduces EvolvingWorld, a framework and benchmark for character and world co-evolution in interactive literary worlds. Existing systems either treat interactive literary simulation as static persona imitation or isolated scene generation, failing to capture how characters and worlds evolve together over time. To address this, EvolvingWorld models literary simulation as a long-horizon process where characters interact, scenes progress, and character and world states are persistently updated. Unlike prior systems relying on fixed schemas, EvolvingWorld adopts an open-schema framework to support simulation across diverse literary worlds. The framework consists of two coupled modules: a Character Agent for multi-character role-play and persistent profile evolution, and an LLM-based World Model for global and location/entity-level state maintenance and scene progression. Based on this architecture, we formulate 7 trainable tasks for scene initialization, interaction generation, and state update. We construct a dataset from 57 books, producing 138,596 supervised training samples and 222 snapshots for testing. Furthermore, we introduce a trajectory-level LLM-as-Judge evaluation protocol spanning 10 dimensions and 20 metrics. Experiments show that EvolvingWorld can improve long-horizon simulation by effectively maintaining persistent, coherent character and world development.
面向LLM后训练的蒸馏强化学习 ↗
Large language model (LLM) post-training is essential for improving reasoning, adaptation, and alignment. Existing methods mainly follow two paradigms: reinforcement learning (RL) and on-policy distillation (OPD). However, RL relies on coarse-grained outcome supervision, resulting in difficult credit assignment and limited capability to acquire new knowledge. OPD, meanwhile, unconditionally matches teacher logits through KL divergence, which creates a dilemma: similar teachers provide little new knowledge, while substantially different teachers often yield ineffective guidance, largely restricting OPD to within-family distillation. We propose Distilled Reinforcement Learning (Distilled RL), which integrates teacher supervision into the RL objective to provide fine-grained guidance, selectively transfer new knowledge and avoid unconditional imitation. Distilled RL contains three components: reverse importance sampling with clipping, negative sample reset, and sequence-level geometric normalization. Through a concise and interpretable case study, we demonstrate that Distilled RL can effectively transfer previously unavailable knowledge from a teacher model to a student model. Extensive experiments across both within-family and cross-family distillation settings show that Distilled RL substantially outperforms standard RL and OPD in terms of both pass@1 and pass@k. Our code is available at
23:00 更新
21 itemsagency-agents ↗
触手可及的完整 AI 代理机构——从前端魔法师到 Reddit 社区忍者,从奇思妙想注入者到现实审查员。每个智能体都是具有个性、流程和经过验证的交付物的专业专家。
Ontology-Playground ↗
免费、开源的 Web 应用,用于学习本体和 Microsoft Fabric IQ。浏览预构建本体目录,可视化设计自己的本体,导出为 RDF/XML,并分享交互式图表。零后端,完全静态。
OmniRoute ↗
永不停歇地编码。免费 MIT 许可的 AI 网关:一个端点,268+ 提供商(50+ 免费),500+ 模型——Claude、GPT、Gemini、Kimi K3、GLM、DeepSeek。兼容 Claude Code、Codex、Cursor、Cline 和 Copilot。配额感知自动回退,RTK+Caveman 压缩可节省 15-95% tokens,支持 MCP/A2A、多模态、桌面/PWA。由 500+ 贡献者打造。
不会代码也能做产品,这是一份从0开始的Vibe Coding保姆级教程。 ↗
原创 数字生命卡兹克 2026-07-20 08:08 北京 Agent就是我们最好的老师 最近,国产大模型也都起飞了。 基本都达到了半步Fable 5境界。 2.8T的Kimi K3,2.4T的Qwen 3.8 Max,而在未来,肉眼可见的,还有马上上线的DeepSeek V4正式版,还有Seed、GLM、MiMo、LongCat等等要到来的更大规模的版本。 我觉得,这就是所有在国内,想用AI搓一个自己的产品、所有想把自己想法变成现实的人,最好的黄金岁月。 现在,你不需要捏着鼻子用海外的模型了,考虑到对面封号、考虑到魔法、考虑付费等等,你可以直起身来,用我们自己的模型,来做你自己想做的东西。 包括我自己搓的产品AIHOT,从5月发布开始,到今天,2个多月的时间,最近一周的周活终于过了30万,月活也正式过了60万。 所以,我觉得今天,我也可以分享一下,作为一个纯外行,如果你想从0开始,用国产模型,徒手搓出一个完全属于自己的产品,应该需要哪些步骤和流程,还有一些乱七八糟的坑。 先叠甲一下,下面这套流程,是我自己作为非专业者,目前跑得比较舒服的一条路径,主要面向完全不懂代码、想先把第一个产品做出来的人。不同类型的产品,可以选择不同的托管平台,工程团队也会有不同的开发规范。 这里讲的是一条足够简单、能够从零走到正式上线的方案,完全不代表唯一的标准答案。 那,让我们开始吧。 1. 买一个国产大模型的Coding Plan套餐。 你需要一个能帮你写代码的AI。 Kimi、GLM、Qwen等等都无所谓,能买到哪个就用哪个,差距没有你想象的大。 2. 去下载各家官方的Agent编程产品。 买了Coding Plan之后,去下载各家官方的Agent编程产品。 ZCode、Qoder、Kimi Code等等,你买了哪家的Coding Plan就用哪家的,因为未来肯定是自家的Agent更适合自家的大模型,可以提前用了。虽然现在很多的Harness还是不如Claude Code,但是我觉得会很快的补上。 3. 想好你的产品名字。 很多人觉得名字随便起一个就行了,做完再改。 但不是这样的,你后面所有的东西,logo、域名、备案、小程序名称、App Store上架,全都跟名字绑定,改名的成本比你想象的大一百倍。 名字简短、好记、最好有一点辨识度,起名的时候顺便在微信搜一下公众号、小程序有没有同名的,在App Store和各大应用商店搜一下有没有撞车的。 这一步花十分钟,能省你后面很多麻烦。 4. 注册一个域名。 名字想好的那一刻,立刻去注册域名。 去火山引擎、腾讯云、阿里云啥的都可以,去域名注册页面,搜你想要的域名。 我自己就是在这一步吃了亏,AIHOT当时真的就是随便取的,然后后面没想到这玩意做起来了,结果一查,AIHOT.com这个域名,是我可能永远都买不起的程度。。。 5. 买一台服务器。 你的产品做出来之后,它得有一个地方运行,不能跑在你自己电脑上,你电脑一关,全世界都访问不了了。 为了让整套教程拥有一条统一、直观的路径,所以我们下面都以以云服务器为例,部分静态网站和轻量产品也可以使用Serverless、云开发或托管平台啥的,不一定需要自己维护服务器。 不过现在维护服务器因为有了Agent之后,维护已经很简单了。 买服务器这里,推荐一下腾讯云上的服务器,新客一般都有大优惠,一年一个轻量的可能才99或者199,轻度产品使用足够了,不知道配置怎么选,就直接截图问你的AI,告诉它你想做什么产品,让它帮你挑。 当然,最好的方式,就是让Agent操控你的浏览器,直接帮你选。 6. 同步去做ICP备案。 这一步非常重要。 在中国大陆,你的域名如果要对外提供服务,必须做ICP备案。不备案,域名解析直接被运营商拦截,用户打不开你的网站。 在你买服务器的那个云平台上找到“备案”入口,按指引提交身份证、域名信息、网站名称,然后等审核,一般一到两周。 一定要跟开发同步进行,别等产品做完了才想起来备案。 如果你做的是出海产品,那就无所谓了,但出海的话记得买海外服务器,比如新加坡或者美西的节点,离你的目标用户近一些。 7. 新建一个你的项目文件夹。 OK,准备工作全部做完了。域名有了,服务器有了,备案提交了,AI编程工具也装好了。 现在,在你的电脑上新建一个文件夹。 就这样。起一个跟你产品名字一样的文件夹名,放在你喜欢的位置。 这个文件夹,就是你接下来整个产品的家,你的所有代码、所有配置、所有文档,都会在这个文件夹里。 8. 在这个项目文件夹下,启动你的Agent,开始开发。 打开你第2步装好的Agent编程产品,把工作目录指向你刚才建的那个文件夹。 具体怎么操作,每个产品不太一样,但大致都是"选择一个工作目录"然后开始对话。 从这一刻开始,你的AI就驻扎在你的项目里了,它能看到你的文件,能帮你创建新文件,能帮你写代码、跑代码、调代码。 9. 注册一个GitHub账号。 GitHub是全球最大的代码托管平台。 你的代码不能只存在你自己电脑上,万一硬盘坏了、电脑丢了,你什么都没了。 所以,可以注册一个GitHub账号(免费的),让Agent帮你连接上你的GitHub账号,然后把你的代码推到GitHub上的一个私有仓库里,注意是私有仓库,不是公开的。 整体告诉你的Agent一句话就行了。 “初始化Git仓库,连接我的GitHub账号,创建一个私有GitHub仓库,并提交第一个初始版本。” 现在,你和Agent你们两两个的协作,正式开始。 10. 开启Plan模式,说清楚你要做什么。 大多数Agent编程产品都有一个Plan模式(或者叫规划模式),用人话告诉AI你想做什么,它会先帮你理清楚需要做哪些事情,列出一个计划清单,别直接开始执行。 你在这一步要做的事情就是,用最简单直白的语言,描述你的产品。 注意,不要想太多,你不需要画原型图,不需要写需求文档,不需要列所有功能,就说你最核心想要的那个东西,后面的功能可以慢慢加,但第一版可以比较简单。 先看到那个产品出来的正反馈,比什么都要强。 AI会根据你的描述生成一份规划文档,你看一下是不是你想要的方向,确认了就进入下一步。 11. 让Agent根据Plan文档,开始执行开发。 确认了Plan之后,告诉Agent开始执行。 它会自动创建项目结构、写代码、装依赖等等,你什么都不用管,看着它干活就行,过程中,它做完一块会问你要不要看看效果,或者有没
围观WAIC模型「读心术」!现场火火火火火 ↗
关注前沿科技 2026-07-19 18:18 北京 一个对抗LLM结构性缺陷的模型架构 允中 发自 凹非寺 量子位 | 公众号 QbitAI 如果你走进2026 WAIC的现场,最直观的感受可能只有一个“卷”字。 1100多家企业、10万平米的展区,目之所及,几乎每家展台的屏幕上都闪烁着 Agent 这个 词。 但“智能体”喊得越响,行业的焦虑就越明显:算力内卷到头了,Agent到底怎么进企业、怎么帮核心业务赚钱? 在一片技术喧嚣中,一个新解法吸引了我们的注意—— 主观世界模型(Subjective World Model,SWM)。 △ “主观世界模型”登上央视新闻直播间 为了搞懂这个新架构,我们顺着人流挤进了 特赞科技 的展位。 在硬核的技术拆解面前,我们不得不承认,过去指望靠大模型(LLM)去猜测 消费者心思 的路子,可能从一开始就走错了。 因为, LLM从根本上不适合用来建模人的决策。 架构设计的核心判断 SWM的设计起点是一个认知心理学上的已知事实:人的“自我报告偏好”和“真实决策权重”之间存在系统性偏差,这个偏差是可测量的,也是可建模的。 基于这个判断,SWM选择了四层异构数据协同训练的路径—— 每一层针对不同类型的“理解人”子任务,使用不同数据源、不同建模目标、不同验证机制,推理时四层联合打分。 Layer 1:表达层Expression Layer 数据: 数十亿条社交平台原生语料 目标: 构建语言风格向量 → demographic/psychographic特征的高维映射 技术本质: 这是一个有监督的representation learning任务。输入是用户的历史文本序列,监督信号来自用户画像标注 (年龄/地域/职业/消费层级等)。训练收敛后,相同demographic cluster的用户,其语言表征在embedding空间中会自然聚集——这个embedding作为后续层的persona anchor。 表达层本身不是壁垒——社交数据可以规模化采集。 它的价值在于为Story Layer的稀疏深访数据提供“扩散基底”:通过persona anchor将深访persona的特征迁移到更大范围的社交用户群。 Layer 2:叙事层Story Layer 数据: 数万小时一对一深度访谈语料,单次访谈1-2h,产生5k-20k字非结构化文本 目标: 建模行为动机的时序因果图 (causal graph of purchase motivation) 技术本质: 这是一个序列因果建模任务,而非分类或生成任务。训练目标不是预测“下一句话是什么”,而是识别访谈叙述中的trigger event → consideration formation → decision point → post-purchase rationalization的完整因果链,并将其结构化为有向因果图。 为什么合成数据在这一层完全失效: 真实受访者的叙述具有跨情境的因果一致性 (causal consistency) ——同一个个体在描述不同购买场景时,其核心动机结构会以不同表现形式反复出现,形成可识别的“动机签名”。 LLM生成的模拟访谈数据没有这个属性,原因是LLM在每个token步骤独立预测,没有维护跨情境一致的内在状态。 合成语料在Cognition Layer和Behavior Layer的交叉验证中会系统性失败——相当于一个内置的抗合成机制。 Layer 3:认知层Cognition Layer 数据: 行为判断问卷、Schwartz Value Survey、Big Five Inventory等标准化量表 目标: 个体的价值权重向量 (value weight vector) 和风险偏好系数 技术本质: 这一层的核心是建模stated preference和revealed preference之间的gap——即“消费者说他在意什么”和“消费者实际决策时权衡什么”之间的差值函数。训练目标是在Story Layer提供的行为叙述和量表测量结果之间建立校正映射,输出个体的真实价值权重向量。 Layer 4:行为层Behavior Layer 数据: 经济博弈实验数据 (ultimatum game / public goods game / trust game) + 真实交易记录 目标: 行为经济学参数估计——loss aversion coefficient λ、hyperbolic temporal discounting rate δ、social norm sensitivity γ 技术本质: 基于prospect theory的参数化个体建模。这些参数在跨情境行为预测中起关键作用:当模型遇到out-of-distribution场景 (历史数据中没有见过的产品类别或购买情境),需要通过这些基础参数外推反应,而非依赖历史pattern匹配。这是SWM能在新产品研究中有效工作的底层原因。 四层协同推理:如何输出AI Persona 四层训练完成后,SWM对每个目标persona维护一组联合状态:表达层的语言风格嵌入 + 叙事层的动机因果图 + 认知层的价值权重向量 + 行为层的经济学参数。 推理时,给定一个新的研究prompt (如“你对这款新包装设计有什么看法”),四层联合打分:表达层决定语言风格和情绪色彩,叙事层调用相似情境下的动机结构,认知层校正自我报告偏差,行为层注入跨情境稳定的行为倾向参数。 输出的AI Persona在连续追问下维持一致的内在状态——这是和LLM直接生成persona的本质区别: LLM的persona是stateless的,每次回答独立生成; SWM的persona是stateful的,有一个跨prompt持续存在的内在状态。 量化结果: 行为模拟准确率85% (对比真人深访基准)。30万+AI Persona (社交数据扩散),1万+高精度AI Persona (深访语料直接训练),交付<30分钟。 注:atypica是基于主观世界模型构建的智能体,Gamelab是atypica为了确保AI模拟准确性的核心Evals手段,通过让真人和AI Persona完成相同的经济学行为实验,对比两者的决策数据,以此量化校准AI Persona对真人的模拟准确度,目标是让AI Persona和真人的数据无限接近。 如何从理解侧到执行侧? SWM是“理解消费者”的模型,特赞的团队更进一步,研发了 GEA(Generative Enterprise Agent)企业级智能体架构 ——是“执行面向消费者任务”的架构。 两者在特赞的技术栈中构成理解-执行的完整链路。 GEA的编排层由特赞自研发散推理模型 (Creative Reasoning Model) 驱动——这是 中国首个备案的发散推理领域的大模型,核心设计是在收敛前先穷尽发散可能性,而非直接走beam search到最优解。 这个特性在创意内容生成、方案设计等需要探索解空间的任务上有显著优势。 执行层调用400+模块化Agent Skill,单次任务可协调30+基础模型。 Context System作为企业知识的持久化存储层,将品牌DNA、历史洞察、产品库、素材库等结构化为智能体可检索的上下文,解决多轮任务中的上下文漂移问题。 目前,其已在内容营销、洞察研究、产品创新、设计创作等业务场景跑通并实现大规模部署,月均Token部署量超100亿,覆盖全球50+国家和地区。 △ 特赞的展位,H1-C135,观众们在了解主观世界模型 企业AI下半场,一个技术判断 SWM的竞争壁垒不在于架构设计的复杂度——四层协同建模的框架本身是可以被复制的。 壁垒在于 Story Layer的数据积累:十年间真实深访语料的堆叠,加上内置的抗合成机制,使这个数据壁垒具备了自我保护能力。 当合成数据路线在Cognition/Behavior交叉验证中系统性失败,后发竞争者就只有一条路:从头开始做真实深访,追赶十年的数据积累。 这个差距不能用算力缩短。 过去两年,企业AI的主要竞争逻辑是“接入”——接哪个大模型、能不能快速上线一个Copilot。 这个阶段基本过去了。大模型API已经是商品,工程接入能力不再形成壁垒。 下半场真正拉开差距的,是 对业务场景
逛了趟WAIC,我只想说,AI在物理世界都快卷疯了…… ↗
关注前沿科技 2026-07-19 18:18 北京 小机器人开始在物理世界狠刷「经验值」 梦瑶 发自 凹非寺 量子位 | 公众号 QbitAI 太!火!爆!了! 还得是WAIC,还得是AI圈春晚—— 哪怕到了展会第三天,依旧人挤人人人人,火爆热程度堪比上海这两天的天气。 (doge) 甚至,据说,连黄牛票…都炒到3000块钱一张了!? 真不怪大家这么热情,主要吧,还是展会现场太有看头了—— 这边机器人模拟药房 拿药取药 、那 边 机器人组团开 演奏会,还有各种长进真实硬件里的Agent和操作系统。 具身智能、世界模型、AI Coding、Token经济、AI硬件 ……过去一年最火的技术概念,今年几乎全都被搬到了现场。 如果说去年逛展大家聊得更多的,还是AI还能做点啥,那到了今年,一个非常非常非常明显的变化是—— AI已经从屏幕里走了出来,开始往工厂、家庭、药房、穿戴设备和各种真实生产场景里「疯狂流动」了: 在一众展商中,我也看到了一个咱非常之熟悉的玩家: 京东。 只不过吧,这次,这家厂商亮相的方式确实有亿点不一样。 此前,京东就官宣要打造 全球最大的物理世界运营中心,没想到这么快就把最新成果搬到了WAIC现场—— 首次集体亮相的JoyAI全系列大模型、具身数据采集与训练链路,还有以JoyInside为底座打造的京东AI Home,全都来了: 逛完今年的WAIC,我们会发现AI的能力边界,真的开始从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。 而过去停留在屏幕里的智能概念,如今已经开始进入工厂、家庭和各类终端设备,真正参与现实世界的现实运行了。 看得见、听得懂、还能执行,面向物理AI的模型全家桶来了 这两年,大模型已经进入密集发布期。 今年走进WAIC主场馆,我们会发现图像、视频、语音、交互、具身等不同方向的模型几乎覆盖了所有热门赛道。 但不得不承认的一点是,在真实的物理环境中,单一模型给出判断,只是整个AI任务执行流程的「起点」。 后续的路径规划、设备控制、动作执行与结果反馈,可以说每个环节都直接影响一个任务能否真正形成完整闭环!! 也正因如此, 物理AI对模型能力的要求,也从单项能力的突破进一步延伸至感知、理解、决策、执行的系统协作。 △ AI生成 就在今年WAIC现场,京东直接端上了一整套面向物理世界的JoyAI模型「全家桶」。 从语音、图像、视频、实时交互、到具身智能,可以说是把物理AI需要的模型能力统统梭哈了…… 对物理AI来说, 视觉能力 决定了AI能否建立对现实环境的连续认知。 毕竟一台机器人真正开始行动前,需要先弄清周围有什么、物体位于哪里,以及彼此之间存在怎样的空间关系。 而京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,刚好对应了 视觉能力 向物理世界延伸的不同维度—— JoyAI-Image-Edit 实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素进一步走向理解空间结构。 △ JoyAI-Image-Edit JoyAI-Echo 通过跨模态记忆维持长视频的一致性, JoyAI-VL-Interaction 则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。 值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型 JoyAI-Video-Edit。 具体来说,用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。 从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。 △ JoyAI-Video-Edit 视觉模型让设备看懂周围环境,但当设备真正进入家庭和零售场景,还要面对一个更难处理的变量——人的指令。 毕竟,大家都懂,现实交流很少按照标准格式发生。 语气、习惯和表达方式同样因人而异,对于物理AI来说能否真正听懂指令,直接决定了后续动作会不会跑偏。 在今年WAIC上,京东不仅亮相了语音生成基础模型 JoyAI-Voice,还同步发布了新的语音交互模型: JoyAI-Talker ~ 其能够识别用户的情绪与真实意图,根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断能力。 这意味着,人与物理AI的交互能够从一次性下达指令,变成持续沟通:设备可以在执行过程中接收反馈、暂停动作、理解新的需求,再及时调整接下来的行动了!! 能看懂环境、理解人的意图,物理AI还要跨过最后一道门槛——让真实设备把模型的判断变成动作。 而京东的 JoyAI-RA 移动操控基础模型,解决的正是这段从决策到行动的转换。 通过统一训练框架,让不同机器人与人类操作经验能够在同一套动作表达中完成对齐,再结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差。 由此,物理AI在模型能力上,才真正完成了从感知、理解、决策到行动的完整闭环。 小机器人们,开始在物理世界狠刷「经验值」 机器人在模型里学会了看、听、理解和规划,真到了现实世界,还是可能被一只摆歪的杯子「难住」。 毕竟,模型给出的更多是智能上限。 这些能力能否迁移到物理世界的真实任务中,很大程度上还是取决于小机器人们在物理世界中攒到的 经验。 读万卷书不如行万里路,这个道理放在小机器人身上,同样成立。 于是, 随着机器人走向现实环境真实作业, 一个越来越关键的环节被推到了台前,那就是 「具身数据采集」。 △ AI生成 与大模型的语料训练相比,机器人学习所需的真实经验,其实要比文本数据难攒得多,而且哪怕数据规模上去了,机器人也可能被「教坏」。 京东就做过一组很直接也很直观的实验—— 他们分别用1万小时高质量数据和1万小时存在瑕疵的数据训练模型,结果发现, 有瑕疵的数据即使继续往上堆,模型效果也未必提高,甚至还会越练越差。 所以在京东看来,数据时长只能反映采集规模。真正决定训练价值的,是动作、轨迹、任务结果和场景变化能否被准确记录和理解,背后还牵涉标注模型、算法精度与数据处理等一整套技术链路。 由此形成的 「数据采集—模型训练—真机验证—反哺采集」 数据采集闭环,则是物理AI真正走进现实世界的关键。
不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半 ↗
关注前沿科技 2026-07-19 18:18 北京 奇异摩尔亮相WAIC 允中 发自 凹非寺 量子位 | 公众号 QbitAI 7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海世博、张江、西岸“三地四馆”同步启幕。 作为行业领先的AI网络全栈式互联产品及解决方案提供商, 奇异摩尔 首次亮相WAIC 2026。 大会期间,公司成功举办“智联为擎 合一共进——AI网络前沿生态论坛”,为AI网络互联生态的协同创新搭建了深度对话平台。 上海人工智能实验室、香港科技大学(广州)、商汤科技、壁仞科技、九章云极、曦望科技、科华云、图灵量子、图灵芯擎等知名研究机构和企业,以及多家产业链上下游生态伙伴与行业嘉宾齐聚一堂。 在本次论坛上,国产超节点生态共建倡议行动正式启动,并重磅发布《共封装光学(CPO)技术白皮书》,进一步彰显奇异摩尔推动产业协同的前瞻布局。 此外, 奇异摩尔还携国产化超节点互联全栈解决方案、与壁仞科技联合打造的国产GPU直通国产RDMA网卡通信技术IBGDA Demo以及下一代光互联合作成果等核心技术及产品集中亮相,全面展示公司在算力网络互联领域的技术突破与生态成果,向全球观众呈现了中国AI算力生态的自主创新力量。 奇异摩尔创始人兼董事长田陌晨 在论坛致辞中表示,连片成林,方能御风守固。正是基于对“连片成林”的深刻认知, 奇异摩尔自创立以来,始终致力于成为AI网络互联生态的积极建设者与连接者。我们深知,网络互联是打破算力孤岛、让单个强点连成高效系统的关键脉络。 没有哪一家企业能够独自走完从底层芯片到顶层应用的全链条;只有把生态做大,企业才能更强。 全国产化超节点互联全栈方案首次亮相,打通系统级协同脉络 当前国产算力面临的核心困境,并非单芯片性能的落后,而是“单点强、系统弱”的结构性失衡。 各家芯片性能虽不断突破,但片内、片间、网间、集群间各层互联各成体系,缺乏统一的全栈视角与系统级协同。 这种长期割裂直接导致系统级性能无法随芯片数量的增加而线性释放,算力资源被严重碎片化。 在以互联为核心的超节点时代,该短板会被无限放大。 奇异摩尔长期深耕AI网络互联领域,目前产品布局覆盖从Scale-Out网间互联、Scale-Up超节点XPU间互联到下一代光互联的全栈式解决方案。 针对上述行业现状,在本届WAIC上,奇异摩尔国产化超节点互联全栈解决方案 首次亮相,并以超节点机柜直观呈现国产AI算力基础设施从“单点芯片突破”迈向“系统级协同优化”的跨越式发展,为大规模国产AI算力集群建设提供了自主可控的全栈互联底座。 奇异摩尔联合创始人兼产品及解决方案副总裁祝俊东 指出, 这套全栈方案的核心价值,在于为国产AI算力提供了一套可演进、可协同、不绑定的系统级基础设施。芯片厂商可基于统一底座灵活构建超节点系统,上层应用可无缝获得横向扩展能力,产业生态得以从各自为战走向合力突围。 国产算力正处关键历史节点,互联已不再是配角,而是决定系统整体效能的核心命脉。奇异摩尔愿以开放、高效的全栈互联技术,为国产AI产业铺就通往未来的路。 IBGDA DEMO:国产GPU与RDMA网卡的深度协同 前述全栈方案覆盖了从片内互联到网间互联的多个层面,而其中一项最具实战意义的技术验证,便是 国产GPU与国产RDMA网卡之间的直连通信——这正是本次奇异摩尔与壁仞科技联合展示的IBGDA解决方案。 在MoE模型的典型训练或推理中,专家并行通信包含两个核心阶段 (Dispatch和Combine),每个阶段都涉及海量的小粒度数据交换。 传统跨节点通信中,GPU须经由CPU中转指令,由此产生额外延迟与CPU开销。 IBGDA技术通过绕过CPU处理环节,显著降低指令中转等待时间,充分释放GPU在并行计算中海量线程的吞吐优势,在All-to-All通信场景中实现吞吐提升与延迟压降的双重收益。 在国际方案与国产方案的对标中,英伟达凭借其GPU与ConnectX系列网卡的深度协同,率先实现了IBGDA方案,为大规模AI推理场景提供了成熟的延迟敏感型通信能力。 而国产集群要实现同等能力,国产化GPU需先满足对类NVSHMEM编程及最新NCCL通信库,以及DeepEP等集合通信库的支持,并与国产RDMA网卡在软硬件层面完成适配,方能实现GPU直通网卡的高效通信。 然而,目前国产GPU对IBGDA的支持主要停留在与英伟达网卡的适配上, 国产GPU直通 国产RDMA网卡的规模化落地案例仍相对罕见,这一环节成为制约国产化集群通信效率提升的短板。 这一局面正在被打破。奇异摩尔推出的单通道400G RDMA ASIC引擎,基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库 (对标DeepEP),并原生支持IBGDA (GPU直接发起通信) 机制。 本次WAIC大会上,奇异摩尔携手壁仞科技,联合展示了国产GPU直通国产RDMA网卡的IBGDA解决方案。 该IBGDA Demo测试平台对标英伟达IBGDA测试数据,实测结果达到相应水平。 测试结果表明:IBGDA相较传统IBRC在小包、高频、强同步场景下呈现出代际优势。 单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现质的跨越;All-to-All通信延迟大幅缩短,接近翻倍提升; 尤为关键的是,传统方案小消息时延,远超大消息的“小包惩罚”被彻底消除。 值得强调的是,该方案基于开放的以太网生态构建,继承以太网部署灵活、成本可控优势的同时,为国产算力集群提供了一个兼具高性能与自主性的Scale-Out网络选择。 这一联合演示极具含金量,通过软硬件的深度协同,绕过繁琐的协议转换,大幅降低通信延迟,显著提升AI推理集群的整体处理效率。 这是对“国产芯+国产网”最佳实践的生动诠释,更以实测数据证明了国产算力生态已具备底层互通、系统级协同优化的实战能力。 布局OSU超节点互联芯粒,锚定下一代光互联技术路线 本次论坛的另一大核心亮点,是《共封装光学(CPO)技术白皮书》(以下简称“白皮书”)的发布。 《白皮书》由香港科技大学(广州)发起,奇异摩尔携手曦望Sunrise、壁仞科技、图灵量子、奇点光子等单位共同参与编写,凝聚了产学研各界的集体智慧。 《白皮书》系统梳理了CPO的技术路径、产业挑战与未来演进方向,为国内光互连技术标准化落地与规模化、产业化发展提供权威指引与实践参考。 面向未来,光互联正成为下一代超节点系统的基石。 传统电互联受限于铜缆物理极限,带宽密度与能耗已难以支撑下一代算力需求;而光互联在Scale-Up空间内几乎没有通信距离焦虑。 当前主流光互联以可插拔光模块为主,光引擎仍停留在主板边缘。 为满足Scale-Up对低功耗、低延迟的要求,光引擎必须向计算核心持续收敛,由此形成清晰的演进路径:可插拔光模块 → NPO → CPO → OIO,最终目标是“光内生”——将光互联功能直接集成于计算芯片内部。 路径越短,收益不止于物理距离的缩短。更近的互联可省去DSP,有效降低延迟,同时简化系统设计、降低功耗与成本,最终提升整体算力利用率。 CPO技术能够有效缓解单节点I/O能力对系统扩展的制约,突破铜互连的物理极限。 然而,该技术主要解决的是物理层的高速数据传输问题;在协议层,Scale-Up复杂的网络拓扑与流控机制仍对计算核心造成巨大负担。 为组建更大规模的Scale-Up网络,计算核心不得不牺牲相当一部分芯片面积和计算资源用于处理网络事务。 互联I/O芯粒的出现恰好补齐了这一关键短板,在智算集群的高性能计算芯片中,I/O芯粒扮演着语义对齐与协议承载的核心接口角色。 奇异摩尔基于在网络互连及芯粒技术领域的长期积累,已前瞻性地布局——OSU(Optical Scale-Up)IO芯粒产品与未来CPO迭代方案的融合路径。
量子位编辑作者招聘 ↗
关注前沿科技 2026-07-19 18:18 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至[email protected],邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
15:00 更新
65 items100 亿次下载破纪录:工信部亮出开源半年报,OpenHarmony设备已超13. 5 亿台 ↗
一份来自国新办发布会的半年报,把中国开源生态的体重直接量了出来。7月20日上午10时,国务院新闻办公室举行新闻发布会,工业和信息化部总工程师王卫明、运行监测协调局局长陶青、信息通信管理局局长谢存一并出席,介绍2026年上半年工业和信息化发展情况并答记者问。在这场发布会上,陶青给出的一组数字,让外界 第一 次看清了基础软件、工业软件与开源生态同时发力的现实轮廓。 先是一张稳稳的基本盘。今年1到5月,我国软件业务收入超过6.2万亿元,同比增长10.3%,延续了稳健增长的态势。在这张盘面之下,软件业今年主要呈现出四条清晰的发展脉络。 第一 条脉络是基础软件加速成势。操作系统、数据库等基础软件持续突破,一批创新成果陆续冒头,开源鸿蒙操作系统已经全面覆盖手机、电脑、汽车、家电等终端设备,生态设备累计超过13.5亿台,电鸿、仪鸿等基于开源鸿蒙的行业发行版超过100款。一个原本从零起步的国产开源系统,如今悄悄长进了亿万级设备的身体里。 第二条脉络是工业软件广泛应用。工业软件已经形成覆盖重点行业的产品体系,在关键领域加速部署、持续迭代,为千行百业的数字化转型注入动力。截至今年6月底,重点工业企业数字化研发设计工具普及率达到86.3%,关键工序数控化率达到69.5%,两张渗透率同时站在了高位。 第三条脉络是人工智能全面赋能。主管部门引导软件企业抓住AI带来的产业变革机遇,加快使用代码大模型、智能编程工具等提升研发生产效率,让产品功能更丰富、交互体验更自然、内容创作更高效,智能测试、智能运维等创新应用也在加速落地。 第四条脉络,也是这场发布会最具分量的一笔——开源生态加速壮大。全国性开源基金会已吸纳50余个开源项目进入孵化阶段, 国家级 人工智能开源社区汇聚用户1100余万、托管模型超过7万个,覆盖基础软件、大模型及应用的全栈开源方案正在加速构建。最为醒目的是,我国人工智能开源大模型的全球累计下载量已突破100亿次。从一行行开源代码到百亿次被全球开发者拉取,中国大模型的影响力 第一 次以如此具象的刻度被摆在台面上。 陶青在会上还勾勒了下一步的落子方向。工信部将按照国家软件发展战略部署,持续增强关键软件产品与服务的供给能力,加快出台人工智能+软件行动方案,推动软件开发向智能化转型、软件产品及服务向智能化升级,并培育智能体软件这一新业态。与此同时,开源基础设施在项目孵化、供应链安全治理、新兴场景探索、海外市场落地等方面的能力会被持续抬升, 国家级 人工智能开源社区将被加速推向外延,成长为新兴技术的创新策源地与软硬产品落地的重要场景。当100亿次下载与13.5亿台设备同时成为基线,中国开源这盘棋,显然才刚刚进入中盘。
首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放 ↗
近日,阿里通义千问团队正式发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,推动语音合成从“能说话”迈向“会表达”。其Plus版本已在全球 权威 榜单Artificial Analysis的Speech Arena中斩获全球 第一,综合表现超越Gemini3.1TTS、ElevenLabs v3等主流模型。 本次发布包含双版本:Flash版主打实时交互,首包延迟约300ms,适配智能助手等低延时场景;Plus版聚焦高质量生成,自然度与音色还原度更优。 核心能力实现四大突破: 一是多语种与方言覆盖升级,支持16种语言,Plus版在全部16种语言上的平均说话人相似度达82.75,位列行业 第一;同时支持20种中文方言,避免“方言特色弱化”问题,更贴近母语者表达。 二是支持Free-style自然语言指令,无需专业标注,用“温柔客服语气”“带货主播风格”等自然语言即可精准生成对应语音。 三是细粒度标签控制,支持[gasp]、[angry]等结构化标签,可精确调控呼吸、笑声等非语言细节,适配游戏、有声书等场景。 四是复杂声学鲁棒性强,即便参考音频存在高噪声、高混响,也能自动过滤杂音、保留音色,合成质量稳定。 配套精品音色库覆盖指令、方言、小语种等多类音色,支持48K高清音频输出(预计7月24日开放),单次合成最长支持3分钟长文本。目前模型已在阿里云百炼平台全面开放,开发者可接入体验,共同探索语音交互新可能。
一行GitHub代码出卖了AMD:Anthropic被曝成其新客户,算力去英伟达化加速 ↗
一行原本不该暴露商业机密的公开代码,把Anthropic的下一手芯片布局捅了出来。据芯片行业分析机构SemiAnalysis解读,AMD AI业务 高级 总监在GitHub上公开发布的代码里,明确留下了Anthropic将作为AMD客户的痕迹。这桩非官方、非媒体报道的泄露,指向一个清晰的信号:Anthropic正在主动拓宽芯片来源,把算力供应商从单一名单里解放出来。 周一,SemiAnalysis在社交平台X上抛出分析帖,结论正来自对AMD那位 高级 总监公开代码的专业拆解——代码内容直接涉及Anthropic作为AMD客户的相关信息。该机构表示,后续还会进一步解释代码细节与背后背景。若这一判断属实,AMD将拿下一块此前由英伟达与谷歌牢牢把持的高端AI训练市场的新阵地,而Anthropic的算力基础设施,也由此向多元化方向再踩一脚油门。 这次信息的流出路径颇为特殊。它没有走官方公告,也不是记者挖到的猛料,而是源于AMD内部高管亲手推到GitHub上的代码。SemiAnalysis把这堆代码读出了名堂,再搬到X平台上公开结论。在科技行业,这种靠公开代码库意外泄密的戏码并不鲜见——GitHub天然可被检索,而发布者又是AMD AI业务的 高级 总监,两相结合之下,信息的可信度反倒不低。SemiAnalysis在帖文中承诺,会继续把代码逻辑一层层拆开,给市场一份更完整的解读。 事实上,在AMD这条线曝光之前,Anthropic的算力采购早已不是独木桥。谷歌的TPU(张量处理器)是其重要算力来源之一,这与谷歌对Anthropic的战略投资密不可分;此外,三星也已经被纳入它的供应商体系。既有的布局说明,Anthropic从一开始就不是单点押注,而是在刻意织一张多元化的供应商矩阵,AMD的加入,只会让这张网在英伟达GPU之外,再多出一块高性能算力的选择。 对Anthropic而言,把AMD拉进阵营有多重战略分量。随着模型训练与推理规模持续膨胀,单一芯片供应商带来的供应链风险、被压制的议价能力,以及技术路径被锁死的后患,都日益刺眼。同时拥抱谷歌TPU、三星与AMD,它得以在成本控制、供应稳定和技術灵活性之间,重新寻找更优的平衡点。对AMD来说,拿下Anthropic则是一次标杆性的胜利——这家公司近年来持续重注数据中心AI芯片,其MI系列GPU被视作英伟达H系列产品的主要竞争对手之一;一旦Anthropic正式入账,AMD不仅能在 顶级 AI实验室的客户群里刷出更强的存在感,也为数据中心AI芯片业务带来实实在在的增量收入。 Anthropic的这一步,折射的是整个行业的系统性转向。当OpenAI、谷歌DeepMind、Meta AI等头部机构对算力的渴求节节攀升,AI公司正在不约而同地评估并拓展芯片供应来源,只为避开把鸡蛋放进同一个篮子里的风险。这种集体转身,客观上为AMD、英特尔等英伟达的追赶者,撬开了一道进入核心AI客户供应链的缝隙。
腾讯WorkBuddy6月访问量超2000万,领跑AI办公智能体市场 ↗
最新 发布的《2026年Q2中国办公智能体平台市场洞察报告》显示,腾讯WorkBuddy在国内PC端AI原生办公智能体市场保持领先,2026年6月单月访问量达到2097万次,超过第二、第三名总和。 报告显示,6月中国PC端AI原生办公智能体市场总访问量突破6000万次,行业规模持续扩大。腾讯旗下AI编程智能体CodeBuddy也保持头部位置。 作为AI效率办公智能体,WorkBuddy支持用户通过自然语言指令完成任务规划、文件处理和结果交付,可在PC、微信小程序、App等多端使用。 自2026年3月发布以来,WorkBuddy持续升级,已接入混元、DeepSeek、智谱GLM、Kimi等主流大模型,并上线技能中心、专家模式、自动化任务、资料库等功能,同时支持微信、企业微信等渠道连接,并通过中国信通院可信认证。 随着AI智能体逐渐从内容生成走向任务执行,办公领域成为大模型落地的重要场景。WorkBuddy的增长也体现出市场对AI原生生产力工具需求的快速提升。
打破 15 秒魔咒:智象未来发布全球首个无限时长创作智能体vivago R1,商业可用率拉到85% ↗
2026盛夏的黄浦江畔,世界人工智能大会如期拉开帷幕,智象未来(HiDream.ai)在这场聚光灯下把一枚重磅新品推到了台前——全球首个无限时长内容创作多模态智能体vivago R1。一同落地的,还有它与中科类脑等机构组建的一带一路Token出海联盟,以及与飞捷科思等发起的物理智能创新联合体倡议。这家公司试图用技术创新与生态协同双轮,把AI从工具推向能并肩工作的智能伙伴。 在大会期间由中国信息通信研究院主办的论坛上,智象未来创始人兼CEO梅涛以《迈向世界模型:原生全模态推动智能体能力跃迁》为题发表主旨演讲,系统梳理了大模型与智能体双向并进、走向世界模型的态势。他的判断很清晰: 顶级 模型的智能水平已经迈入人类天才区,但从基础大模型到真实场景之间,仍横着落地难、适配弱、不可控的产业鸿沟。智能体天生带着自主记忆、逻辑规划、工具调度和多端协作的本事,恰好能把基础模型的生成与推理优势,翻译成标准化、可验证、可交付的产业能力。基础模型叠加智能体,正成为AI赋能千行百业的核心范式。 梅涛进一步点破了一个现实困境:在复杂任务面前,单个智能体存在明显的能力 天花板,跨链路、高精度的创作任务它独木难支,唯有让多个智能体像专业团队那样分工协作,才能啃下真正的产业硬骨头。而要让这支智能体集群稳定、高效、有序地运转,一套名为AgentOS的智能体操作系统是绕不开的地基。为此,智象自研了HD-AgentOS,用资源层、系统层、能力层三层耦合架构撑起整套产业落地体系:资源层提供智能体可调用的基础资源与原子能力,是执行的底座;系统层包揽全流程运维、风控、监控与安全治理;能力层则把模型、工具、知识和流程封装成领域技能。有了这套操作系统,多智能体协作便能突破单打独斗的局限,组建成一支可感知、会推理、可执行、能进化的专业团队。 vivago R1正是架在这套核心技术之上的产物,也是全球首个具备无限时长视频生成与编辑能力的多模态创作智能体。它的出现,标志着AI在创意生产领域的一次范式转移——从只会辅助生成单点素材,进化为能够自主规划、调度并完成长链路创作的智能搭子。智象把它的核心优势概括为长、长、稳三个字,精准对准行业长期存在的时长受限、逻辑混乱、效果不稳三道痛点。 第一 处长,是无限时长、全场景无限制适配。当下主流AI视频产品大多被锁在15到30秒的短镜头里,根本喂不饱长周期商业创作。vivago R1直接掀翻了这道时长壁垒,支持任意时长的视频连续、连贯生成,从短剧、专题片、品牌宣传片到影视成片,全品类长周期创作场景都能接住,把行业长视频创作的空白补上了。第二处长,是长任务思考,保障创作逻辑连贯统一。长视频从来不是短镜头的简单拼接,它需要完整的叙事逻辑、统一的画面风格、稳定的人物IP与场景设定。vivago R1具备长任务思考能力,能自主完成精细化逻辑构思、镜头排布与风格校准,把画面跳变、人设崩塌、叙事断层、风格割裂这些老毛病一一按住。第三处的稳,是高稳定生成,赋能商业规模化交付。传统大模型带着概率性输出偏差,成片可用率低,企业调试成本居高不下;依托AgentOS的全流程调度与治理,vivago R1把创作全链路变成可控可校准,将内容有效可用成功率提升到85%,远高于行业平均,反复修改调试的时间与人力被大幅砍掉,生成内容能直接走进商业制作、品牌传播与市场化交付。 这种能力在社媒创作、商业营销这类持续性长链路场景里尤其见功力。一个看似简单的分镜生成,既要依据剧本画出画面,又要吃透镜头语言、叙事节奏、情绪表达,甚至要分清短视频vlog、短剧、商品素材短片对分镜的差异化要求——这种深度的行业理解,绝不是直接调一个大模型API就能交差的。vivago R1用多智能体协同机制,把理解任务、构思故事线、创作分镜脚本、生成核心素材、生成超长视频这条完整链路做了原子化封装与专业化调度,让叙事、镜头、角色、风格、声音和审美有机统一,真正完成了从单点工具到全链路创作系统的跨越。 产品之外,智象在WAIC期间还落下了两步生态大棋。它与飞捷科思等创新企业和 顶尖 科研机构共同发起物理智能创新联合体倡议,意在聚拢产学研多方力量,共筑原生全模态世界模型的产业协同新格局。与此同时,智象与中科类脑等机构达成战略合作,签约组建一带一路Token出海联盟,以Token无国界、AI无孤岛为核心理念,推动中国原生全模态AI能力跨越山海,连接全球智能新基建,助力和共建一带一路国家和地区的智能化升级与数字生态互联。 行业的竞争维度早已全面升维。过去那场单一的大模型参数竞赛正逐步归于理性,取而代之的是基础模型加智能体系统的全方位生态较量。智象打造的1+1+3商业模式,正是对这道新命题的回应——在底座模型上保持全球领先竞争力,在用户最渴求智能释放的垂直赛道里扎到最深。从vivago R1的发布到双联盟布局,智象以多点突破的方式,在这场规模空前的WAIC上集中展示了 最新 成果,也为AI从工具演进为智能伙伴探了一次路。接下来,它要持续推动多模态技术向原生全模态、向世界模型深度进阶,用硬核创新与全球化协同,把人工智能产业推入规模化、商业化的新时段。
Hugging Face披露AI智能体攻击事件,采用GLM5.2完成日志取证分析 ↗
全球 最大 的AI开源社区Hugging Face近日披露,其服务器遭遇黑客AI智能体攻击。事件发生后,安全团队首先尝试调用一家美国商业前沿大模型API,对超过1.7万条与攻击相关的日志进行分析,但由于模型未能准确区分事件响应人员与攻击者,其安全防护机制误判相关请求并拒绝提供分析支持。 随后,Hugging Face在自有基础设施上部署中国开源模型GLM5.2,对海量安全日志展开取证分析,并顺利完成事件调查工作。 此次事件反映出,随着AI智能体逐渐参与网络攻击,安全分析对大模型的理解能力、推理能力以及部署方式提出了更高要求。相比依赖云端商业API,本地部署的开源模型能够在数据安全、权限控制和任务定制方面提供更高灵活性,也避免了因平台安全策略导致的分析中断。
8800 万美元加注开源:Ollama跑进85%财富 500 强,喊出"全体上车" ↗
一条命令就能在本地拉起开源大模型,这个让无数开发者摆脱API密钥和天价账单的工具,刚刚拿到了通往下一程的燃料。 7 月 9 日,Ollama在官方博客中宣布完成 8800 万美元融资,投资方阵容横跨 顶级 风投与开源世界的老将:Benchmark的Peter Fenton、Theory Ventures的Tomasz Tunguz、8VC的Alex Kolicich共同领投,Docker创始人Solomon Hykes、ClickHouse CEO Aaron Katz、GIMP联合创建者兼Cockroach Labs联合创始人Spencer Kimball、Amp CEO Quinn Slack、思科董事会成员Marianna Tessel、Twitter前工程主管Michael Montano,以及Y Combinator、Garage Capital、Pace Capital、49 Palms、GTMFund等一众天使跟投。 这家公司的创始人杰夫与迈克尔,十年前就在做同样的事。两人在大学相识,创办了让Docker运行变得极简的Kitematic, 2015 年被Docker收购,他们的工作成果后来化为 2016 年推出的Docker Desktop,如今被全球超过一千万开发者使用。十年之后,他们把那套让复杂技术变得人人可用的执念,又押到了AI上——Ollama的目标,是让开发者以最轻松的方式启动并运行开源模型。出乎他们最疯狂的想象,这个平台已经服务了 890 万开发者,并且被85%的《财富》 500 强企业采用。 在Ollama的叙述里,开源模型正在为AI开启一次个人电脑式的时刻:当年PC把算力从大型机机房搬上每个人的桌面,供人拥有、定制和构建,如今开源模型正做着同样的事。几年前,强大而免费的开源模型已经出现,但要让它们真正跑起来却障碍重重,能力明明在场,却像被锁在门后,开发者无法像调用专有模型API那样顺手使用。Ollama给出的解法是一款可下载到电脑上的应用,一条命令就能启动 最新 开源模型,再通过简单的API在其上构建,把运行开源模型变得和运行任何普通软件一样简单——不需要权限,不需要API密钥,也不需要昂贵的服务器硬件。你的模型,你的机器,你的数据。 它围绕三条原则搭建产品:所有权、可负担性与隐私。所有权意味着开源模型归使用者所有,可以随时保留、定制和优化,永远不会被锁死在某一款自己智能体或应用所依赖的模型之外;可负担性来自模型跑在自己的硬件上,不再有失控的按token计费账单,实验、迭代和发布都不必担心每一条提示词都在加价;隐私则让数据永远不必离开本地机器,即便真的需要上云扩展,也能把同一份信任一并带过去。 开源模型早已不是实验室里的玩具。Ollama云成了访问 最强 大开源模型最便捷的一站,GLM、Nemotron、DeepSeek、Kimi、MiniMax等都在其中,而它的token用量平均每月增长超过一倍。最初只是个人电脑上 第一 次跑通模型的乐趣,如今已经扩张成去啃那些曾经专属于闭源模型的硬骨头。 这笔 8800 万美元,被Ollama定位成推动生态前进的燃料。它正处在开源模型生态的核心位置,资金将投向三件事:无缝的混合推理、在新开源模型发布当天就提供支持,以及一个能让任何开发者及其团队用上 最强 大模型、却不牺牲所有权与隐私的云服务。杰夫与迈克尔在结尾写道,他们曾站在类似变革的开端,押注开放与易用终将胜出,如今再次倾尽所有。当85%的财富 500 强已经悄悄把开源模型搬进内部系统,这趟开源列车的下一节车厢,显然还空着不少座位。
DeepSeek V4正式版实测曝光,或于下周一发布剑指Kimi K3 ↗
在全球AI圈目光聚焦于Kimi K3热度之际,国产大模型厂商DeepSeek传来新动向。近日,DeepSeek V4正式版的测试视频与实机演示在社交平台悄然曝光,多方消息指出,该模型有望最早于下周一(7月下旬首个周一)正式发布,时间点恰好承接K3刷屏之后,引发行业高度关注。 据流出的测试信息与海外博主反馈,DeepSeek V4正式版在多项核心指标上表现惊艳。实测性能初步达到Claude Opus4.8的水平,尤其在3D方向的生成能力上远超Opus4.8,代理(Agent)行为表现与编码稳健性亦有显著提升。更有激进观点称,在特定测试(如游戏代码生成)中,V4正式版已压过Fable5与GPT-5.6一头。一位博主展示的《鱿鱼游戏》小游戏编码测试中,V4生成3000行代码总成本仅0.12美元,凸显了其令人难以置信的性价比优势。 除了硬性能的提升,V4在交互体验上也迎来微调。测试者注意到其思维链(CoT)风格更加接近Claude,不再堆砌代码墙,而是以“编写核心功能”、“编写主要场景代码”等总结性步骤呈现,可读性大幅增强。有分析认为,V4可能提炼了Fable的编码风格,输出观感更为简洁。 回顾DeepSeek过往节奏,其一贯以“闷头干活、价格屠夫”的策略突围。若V4真能以低一个量级的价格逼近当前顶流模型水准,势必将掀起继V3之后的“DeepSeek时刻2.0”。目前官方曾预告为7月中旬发布,下周一的时间线合乎预期,最终定档尚需等待官方官宣。
字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作” ↗
近日,字节跳动正式推出音频创作模型Seed Audio1.0,标志着AI音频生成技术从单一语音合成阶段,迈入完整声音场景创作的崭新阶段。该模型目前已上线火山方舟体验中心,向创作者开放测试。 长期以来,影视级音频内容生产依赖多模型分别生成人声、音效与环境声,再通过人工繁琐拼接与混音,流程冗长且难以保证整体叙事一致性。Seed Audio1.0的核心突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可服务于叙事的“完整声音作品”。 据官方介绍,Seed Audio1.0具备三大核心能力。首先是精准的时空编排,支持以100毫秒的精度按时间线控制对白、音效的入场时机,完美适配视频配音与广告制作。其次是稳定的音色演绎,支持零样本生成与长音频延展,在保持角色音色一致性的同时,能自然呈现愤怒、喜悦等不同情绪,甚至允许同一音色演绎多个角色。第三是地道的多语种支持,覆盖包括中文、英语、日语在内的20余种语言,确保声音在不同语种下都能符合本土的表达节奏与重音习惯。 评测数据显示,该模型在九大类常见创作场景中的音频可用率已超过90%,多语言生成的自然度MOS评分普遍达到4分以上(优秀水平)。 从“会说”到“会创作”,Seed Audio1.0的发布降低了高质量音频内容的制作门槛。未来,团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可听见的作品。 项目主页: 体验入口: 火山方舟 体验中心 - 登录 - 选择语音模型 - 语音合成 - Doubao -音频生成-1.0
Quoting Sam Altman ↗
We have been having extensive discussions around open source strategy. We will discuss it more at our next board meeting, but one thing we’d like to do soon is to create a language model with the approximate capability of GPT-3 that can run locally on consumer hardware and release that. We’d like to do it soon, before Stability or someone else does. In general, we think this helps discourage others from releasing similarly-powerful models, and makes it harder for new efforts to get funded. — Sam Altman, Email to OpenAI's board, October 1, 2022 - exposed in Musk v. Altman (2026) Tags: ai-ethics, sam-altman, generative-ai, openai, ai, llms
喊出"再来两周"的用户赢了:腾讯混元Hy3 限免延长到 8 月 5 日,295B MoE模型白嫖期续命 ↗
一款刚开源不到半个月的大模型,靠着用户一句"再来两周"的呼声,硬是把免费期从两周拉长到了近一个月。7月20日,腾讯公关总监张军在微博上透露,混元大模型Hy3的两周限免活动临近收官时,公司收到了大量用户希望延期的强烈反馈,为此腾讯决定,针对WorkBuddy和CodeBuddy用户,把Hy3的限时免费活动延长至8月5日。 这场限免的主角Hy3,是腾讯在7月6日刚刚开源发布的新一代模型。它最鲜明的身份,是一个快慢思考融合的模型——既能快速给出直觉式回应,也能沉下来做深度推理,两种节奏被揉进了同一套架构里。技术底座上,Hy3采用MoE(混合专家)架构,总参数规模达到295B,激活参数则为21B,相当于每次推理只点亮其中一小部分专家,用相对克制的算力开销撬动庞大的知识容量;它 最大 支持256K的上下文长度,足以一口气吞下长篇文档或整段代码库而不丢失前情。 据腾讯方面介绍,Hy3在preview版本的基础上,进一步提升了后训练数据的质量与多样性,并扩大了强化学习阶段的算力规模,最终在推理、智能体、长上下文等任务上取得了显著进步,效果已经能比肩国内外那些参数规模往往是它2到5倍的旗舰模型。换句话说,一个激活参数仅21B的模型,靠着训练策略和架构设计,把和数倍体量对手的差距压到了肉眼难辨的程度。当用户的呼声把免费窗口续到了8月5日,这场关于效率与性价比的较量,也给了更多人亲自上手验货的时间。
马斯克称2万亿参数大模型即将完成训练,或挑战Kimi K3性能 ↗
月之暗面发布新一代开源大模型Kimi K3后,特斯拉CEO马斯克表示,其旗下2万亿参数规模大模型预计将于下周完成初步训练,并称该模型整体性能将超过此前的1.5万亿参数版本,甚至可能超越Kimi K3。 此前,马斯克曾在相关评测报道评论区评价Kimi K3“令人印象深刻”。7月18日,他进一步透露新模型训练进展,引发业内对超大规模模型竞争的关注。 据悉,Kimi K3拥有2.8万亿参数规模、100万词元上下文窗口,并支持原生视觉理解能力,是目前全球参数规模 最大 的开源大模型之一。模型发布当天,其在Arena AI前端编程排行榜中以1679分登顶全球 第一,超过Claude Fable5、GPT-5.6Sol等海外主流模型。 随着大模型竞争进入新阶段,参数规模、推理能力、上下文长度以及开源生态成为厂商争夺的重要方向。马斯克旗下AI公司xAI近年来持续推进大模型研发,此次公布2万亿参数模型训练进展,也显示出全球AI企业正在围绕下一代基础模型展开更激烈的技术竞争。
别再数Token了:OpenAI甩出AI时代记分卡,用"有用智能每美元"给CFO算清ROI ↗
当全世界的首席财务官都在追问同一个问题时,OpenAI决定亲自下场把这笔账算明白:我们从人工智能的投入里,到底换回了多少价值?过去十几年,软件行业习惯了用采用率衡量成败——卖了多少席位、有多少活跃用户、续费了多少许可证。但到了AI这里,这套尺子失灵了。真正的刻度,应该是模型到底干完了多少活。 OpenAI在7月17日发布的这篇长文里,把企业 领导者 面对的核心经济命题摊开:人工智能完成的工作,其价值增长是否快过了生产它的成本增长?要回答这个问题,光看每token成本远远不够。一个便宜的模型,token单价或许低,但为了得到好结果,可能要反复试错、耗费更多时间、叠加更多人工审核;一个昂贵的模型,token单价高,却可能一次就把任务做对。真正的成本,是产出一个成功结果的完整代价,再拿它去对照这个成果创造的价值。 于是OpenAI给出了AI时代的 终极 记分卡——有用智能每美元。这个指标要回答四件事:人工智能是否在完成有意义的工作?每一项成功任务的成本是多少?人们能否信赖它的结果?随着用量增长,每投入一美元的人工智能,是否创造了更多价值? 先说 第一 项,完成了多少有用工作。价值只在token变成人们能直接使用的实际产出时才被创造出来。模型越强,能扛下的任务就越长越复杂:它开始保持上下文、做多步推理、跨工具协作,并在过程中不断调整适应。最务实的切口,是先锁定一个具体工作流,定义清楚什么叫完成,然后在工作实际发生的系统里去度量这个结果。对支持团队,完成意味着一个客户问题被解决;对工程团队,是一笔通过测试的代码变更;对法务团队,是一份被准确且及时审查的合同。OpenAI举了一个财务团队为预测评审做准备的例子:在最终决策之前,要去找 最新 预测、把数据导进Excel或Sheets、识别变化、核对标签页、重建幻灯片、检查所有数字是否吻合,这一连串杂活大部分都可以交给ChatGPT Work,团队因此腾出精力去想真正重要的事——发生了什么变化、为什么、下一步该怎么办。这就是每一美元在实践里换来的有用智能。 第二项,一个成功任务实际花了多少钱。AI任务的成本天差地别,一句快速回答消耗的计算极少,而编码、研究、财务类工作流往往涉及深度推理、工具调用和大量操作,它们吃更多算力,也创造更大价值。在模型层面,单次成功任务的成本由价格、实际用掉的计算量以及得出正确结果的概率共同决定;对企业而言,总成本还要叠上员工时间、人工审核、重试和返工。算法很简单:把完成工作的总成本加起来,除以达到质量标准的任务数量。这正是每token 最低 价未必换来每结果 最低 成本的原因——即使对常规请求,如果一个前沿模型能一次给对答案,省下的重试、延迟、审核和总计算量,反而可能让它成为最划算的选择。 OpenAI刚发布的GPT-5.6正是按这个逻辑设计的三个层级:Sol是旗舰,Terra在性能与成本间取平衡,Luna最快也最省。这套分层给了客户优化公式的起点,但OpenAI强调,最终该用哪档模型,要看整笔任务的经济性——高吞吐流程用Luna,需要深度时用Terra,当更强推理能以更少尝试换来 最好 结果时用Sol。训练GPT-5.6时,OpenAI的目标就是让每个token产出更多有用成果:在Artificial Analysis编程智能体指数上,开启 最大 推理的GPT-5.6Sol创下新的 最优 水平,同时比另一款领先模型少用了54%的输出token;在DeepSWE v1.1长周期工程任务里,GPT-5.6Sol达到72.7%的新高,高于Claude Fable5的69.9%,预估API成本还降低了36.2%。每一代模型都该在两方面同时进步——更高效率让旧任务更便宜,更强能力让全新类型的工作成为可能。 第三项,AI正确完成工作的频率有多高,也就是可靠性。人工智能的采用通常会分阶段深化:先是辅助起草,接着在工具和数据之间找上下文、做推理,再往后开始主动采取行动、处理异常、跑完整个工作流,而人只在必要时给出判断和控制。每一步都创造更多价值,也对系统提出更高要求。可靠性本身就是钱——当结果准确、来源可靠、前后一致且能恰当地升级处理,人们花在审查、纠正和返工上的时间就少了,成功任务的成本随之降低,组织也更有底气把AI用进更重要的流程。 OpenAI建议团队追踪三种结果来衡量这一点:可直接使用、需要修正、需要升级处理,这比单纯的模型准确率更能说明AI是否真的减少了完成项目所需的工作量。可靠性还需要清晰的边界:在AI从起草走向行动之前,组织必须定义系统能访问哪些数据、可以使用或更改哪些系统、何时需要人工审查或批准某个操作。安全、保障、隐私和控制构筑了深度使用的基础,而ChatGPT Work正是建立在ChatGPT Enterprise的安全、合规与工作区管理之上,让组织在保持监督的同时,给AI接入更有价值的流程。能力带来 第一 次使用,可靠性才让AI成为完成工作的组成部分。 第四项,随着使用量增长,每一美元AI投入能否完成更多工作。企业可以长期追踪同一工作流来度量:统计达到质量标准的任务数、完成它们的总成本、以及每项成功任务的成本,如果完成的工作量增长快过总成本、质量还保持不变或提升,那么每一美元就产出了更多价值。算力处于这个等式的核心——它驱动着研究,也驱动着AI完成的每一项任务,决定了产品质量、速度、可靠性、可用性和成本。训练算力构筑未来能力,推理算力交付当下的价值,两者最终都要转化为更好的客户成果。 更优的模型、更高效的推理、专用硬件、更高利用率、更聪明的路由和更强的产品设计,都能抬升算力的回报。客户从体感上接住这些改进:答案更准、响应更快、修正更少、产品更可靠、完成所需工作的成本更低。这些收益会自我累积——更好的基础设施加速研究,研究催生更强更高效的模型,模型改进产品,产品推动采用、学习与收入增长,而这又反过来支撑对下一代研究、算力、部署和安全的持续投入。OpenAI用一个统一的智能平台把所有这些要素收拢:用户通过ChatGPT和ChatGPT Work使用,开发者通过Codex和API构建,企业把它部署进真实工作发生的系统,任何一层改进,所有产品和客户都随之受益。 把四项指标合在一起,这张记分卡其实在回答一件事:每单位成本换来的有用智能,是否在持续上升。有用产出告诉我们AI能产生什么,每项成功任务的成本告诉我们达成结果要付什么,可靠性告诉我们人们可以放心使用多少成果,规模化价值则告诉我们随着时间推移,每一美元和每一单位算力是否实现了更多成效。OpenAI把它自己的职责,归结为让这个等式在每一代模型上都变得更好——更强的模型、更快更可靠的结果,以及为客户真实所需的工作压低的成本。当AI开始用每美元的有用智能说话,而不是用token的流水账,价值这回事,才算真正被算清。
阿里云百炼上线HappyOyster1.0:支持实时交互的开放世界模型开启灰测 ↗
今日,阿里云百炼正式上线开放式世界模型产品HappyOyster1.0(快乐生蚝1.0),该模型支持实时构建、探索和交互式生成AI数字世界,目前已开放Android、iOS及Web三端SDK,并在阿里云百炼启动灰度测试。 据介绍,HappyOyster1.0区别于传统文生视频模型的单向生成模式,其核心训练目标是学习“当前状态/动作”到“下一状态/动作”的世界状态转移规律。模型通过分析海量自然视频,学习人物、物体与环境的演变过程,能够推演动作产生的反馈关系,并维持数字世界中人物、场景以及音视频内容的长期一致性。 该模型提供“世界探索(Adventure)”和“实时导演(Directing)”两种模式。世界探索模式下,用户输入文字或上传图片即可生成可互动数字世界,并通过移动、跳跃、攻击、驾驶载具等操作改变场景发展,支持最长1分钟连续实时位移与镜头控制,生成内容可导出原片。 实时导演模式则支持用户在剧情任意节点暂停、回溯,并通过新的提示词调整故事发展方向。该模式可生成3分钟以上的480p或720p实时画面,并支持视频导出。 阿里云表示,HappyOyster1.0正在探索下一代多模态互动内容形态,可应用于开放世界游戏原型、互动短剧、虚拟陪伴以及沉浸式文旅体验等场景。开发者可通过Open API管理世界状态,通过客户端SDK完成实时通信、视频渲染和交互控制,快速构建可玩的AI世界应用。 业内认为,世界模型正在成为生成式AI发展的新方向,其核心能力从“生成内容”进一步转向“理解和模拟世界”。HappyOyster1.0的推出,代表国内企业开始探索实时交互式AI环境构建的新路径。
阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线 ↗
7月19日,阿里正式发布Token Plan个人版,并同步开放Qwen3.8-Max-Preview体验。该模型参数规模达到2.4万亿,在代码工程、专业办公等场景中展现出较强能力,正式版本预计将于近期发布并开源。 据了解,Qwen3.8-Max-Preview目前可通过Token Plan抢先体验。为降低用户使用门槛,阿里推出限时优惠方案,其中个人版Lite套餐售价39元/月,Standard套餐139元/月,Pro套餐499元/月;团队版则提供标准、 高级 和尊享三类席位,价格分别为150元、550元和1398元/席位/月。 针对Qwen3.8-Max-Preview,阿里同步推出限时体验活动,白天Credits消耗降至1折,个人版Token Plan用户夜间使用还可在此基础上享受进一步折扣。 除Token Plan外,阿里旗下AI编程产品Qoder和QoderWork也已首发支持Qwen3.8-Max-Preview,千问PC端用户可免费体验该模型能力。 随着大模型竞争从单纯性能比拼转向模型能力、成本控制和生态建设的综合竞争,阿里通过Token Plan、开发工具及开源策略进一步扩大Qwen系列模型应用范围,加速大模型在开发、办公等生产力场景中的落地。
谷歌升级Gemini Enterprise:优化界面并推进Workspace连接器重构 ↗
谷歌正在推进企业级AI助手Gemini Enterprise的新一轮更新,平台主提示栏已采用与消费者版Gemini应用一致的炫彩视觉设计,进一步统一企业与个人用户的产品体验。这一变化也体现出谷歌希望让企业AI助手与数亿用户使用的Gemini生态保持一致的发展方向。 此次更新中,更受关注的是Google Workspace连接器升级。部分用户收到通知称,连接器更新后可能需要重新授权才能继续使用。虽然谷歌尚未公布具体技术细节,但这一调整可能涉及权限扩展或底层架构优化。 近年来,Gemini Enterprise持续扩展企业数据连接能力,目前已支持Slack、Microsoft Teams、Notion、Linear、Jira、ServiceNow等多种办公工具,并逐步增加创建页面、更新工单等操作能力。连接器架构的优化,将直接影响AI助手读取企业数据、执行任务以及调用外部服务的稳定性。 此外,谷歌在5月I/O大会期间公布的智能代理功能Gemini Spark,目前已出现在Gemini Enterprise功能设置中,但仍处于隐藏状态。谷歌表示,Spark未来将向企业客户开放,并可通过SharePoint、OneDrive和ServiceNow等连接器执行后台任务。 业内认为,此次Gemini Enterprise更新并非简单的界面调整,而是谷歌为企业级AI代理能力扩展进行的基础设施建设。随着企业AI助手逐渐从信息查询走向任务执行,数据连接、安全权限和系统兼容能力将成为决定产品落地效果的关键因素。
腾讯混元Hy3限免活动延期至8月5日,WorkBuddy和CodeBuddy用户继续免费使用 ↗
腾讯混元大模型Hy3限时免费活动迎来延期。腾讯表示,原定为期两周的Hy3免费体验活动临近结束后,收到大量用户希望继续使用的反馈,因此决定面向WorkBuddy和CodeBuddy用户延长限免期限,活动将持续至8月5日。 此次延期主要覆盖腾讯旗下AI办公与编程相关产品用户,开发者和企业用户可继续体验基于混元Hy3模型提供的智能辅助能力。此前,Hy3通过限免活动吸引用户测试其在代码生成、开发辅助以及工作流场景中的应用效果。 随着AI大模型逐渐从通用问答向专业生产力工具演进,代码生成、智能办公等场景成为模型竞争的重要方向。通过延长免费体验周期,腾讯希望进一步扩大Hy3在真实业务环境中的使用规模,并收集用户反馈优化模型能力。 业内来看,大模型厂商正在通过免费试用、开发者计划等方式降低用户体验门槛,加速模型在办公、编程等高频场景中的落地。随着竞争加剧,模型性能、使用成本以及生态整合能力将成为影响用户选择的重要因素。
BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头 ↗
搜索智能体到底有多强,过去一年基本是BrowseComp说了算。但这个标尺正在失灵——它在10个月内就把模型成绩从30%一路推到了90%,基准测试本身的意义正快速被刷没。7月17日,美团LongCat抛出了一块更硬的试金石LoHoSearch,意图把搜索智能体重新逼回爬坡区。 LoHoSearch的难题不是人写的,而是从一个囊括762万个实体的维基百科知识图谱里自动生成的。正因为这种机器生成的出身,它在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计出的难度上限。换句话说,过去的基准靠人脑出题,题目再难也有 天花板;LoHoSearch把出题权交给图谱,难度 天花板 被彻底掀开。 结果相当刺眼。在11个前沿模型的测试中, 最佳 成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批 顶尖 模型在BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上, 最好 的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点——这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。 这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。
杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源 ↗
大模型训练的地基,正在被一家中国公司悄悄撬动。在GTC2026的演讲How We Scaled Kimi K2.5中,月之暗面CEO杨植麟没有只讲K2.5这一个产品,而是把过去一年多公司想清楚的一件事摊开了:当开源模型要逼近闭源前沿,除了继续堆参数和算力,还有另一条路——把Transformer时代沿用了近十年的三个基础组件,各自重新做一遍。优化器Adam(2014年提出)、注意力机制(2017年)、残差连接(2015年),月之暗面给这三个地基组件各递上了一个替代方案,而且全部开源。 杨植麟把整条技术路线拆成三个方向:让每个Token更值钱、让更长的上下文真正有用、让多个Agent同时协作。除此之外,他还抛出了两个重要进展:视觉训练如何反哺文本能力,以及月之暗面刚公布的下一代架构Attention Residue。 先说最现实的一道墙:高质量数据快不够用了。互联网上有价值的文本本就有限,模型越做越大、要的数据越来越多,大家迟早撞上数据墙。既然数据很难翻倍,月之暗面的思路是让模型从同样的数据里学到更多,给出的答案是MuonClip,用来替代已经用了十多年的Adam优化器。它基于Muon优化器,在更新参数时尽量让不同方向的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。实验结果是:用同样数量的数据,MuonClip的训练效果接近把数据量增加一倍,既压低了训练成本,也推高了模型能力上限。杨植麟打了个比方:手里若有50万亿个高质量Token,效率提高一倍,就等于又多出50万亿Token,在优质数据越来越稀缺的当下,这种效率提升比单纯加算力更关键。 不过Muon有个麻烦:模型扩展到万亿参数后,注意力层里的数值容易失控, 最大 logit会突然飙升到1000以上,而正常范围通常只有50到100,数值继续膨胀训练曲线就会发散、整个训练可能直接崩掉。月之暗面为此设计了QK-Clip,在模型前向计算时实时检查每个注意力头的 最大 logit,一旦超过安全范围就同步缩放Q和K的投影把数值压回来,它不改变收敛效果,只负责维持数值稳定。靠着QK-Clip,Muon被成功扩展到万亿参数规模,训练了超过15万亿Token,整个过程没出现过一次loss spike。 第二个方向是让长上下文真正发挥作用。杨植麟引用了Scaling Law论文作者Jared Kaplan等人的实验:LSTM读到一定长度后效果就难再提升,而Transformer上下文越长、预测通常越准,且难见明显饱和点。这个特性在Agent时代尤为要紧——复杂任务可能持续几天甚至几周,模型得记住之前做了什么、得到过哪些结果、哪些方向已经失败,长上下文若不能持续提供有效信息,任务链条很容易断掉。麻烦在于标准全注意力的计算量随上下文长度平方增长,扩大十倍计算量可能增加一百倍,到百万Token级别训练和推理成本都高得吓人。月之暗面的解法是Kimi Linear,核心是名为KDA(Kimi Delta Attention)的线性注意力机制,它让模型学会哪些信息长期保留、哪些快速忘掉。传统线性注意力只有一个全局衰减系数,像所有内容共用同一个遗忘按钮;KDA把一个衰减系数拆成多个,不同信息通道可用不同遗忘速度,慢衰减的通道保留长距离信息,快衰减的通道及时腾出空间吸收新内容。实际使用中,Kimi Linear按3比1的比例把线性注意力层和全注意力层混合,杨植麟称这是 第一 个在短上下文、长输入和长输出任务上都能全面超过全注意力的架构,上下文扩展到百万Token甚至更长时,效率优势更明显。 第三个方向是从一个Agent变成一支Agent团队,月之暗面称之为Agent Swarm。它的组织方式像一家公司:一个主Agent充当CEO,负责理解目标、拆解任务并分配给多个子Agent,子Agent可以分别扮演研究员、程序员、数据分析师和事实核查员,完成后由主Agent汇总。 最大 价值是把串行任务改成并行,过去一个Agent要依次搜索、阅读、分析、编码、核查,现在几十甚至几百个Agent可以同时开工。训练这种协作并不容易,月之暗面设计了三种奖励:实例化奖励鼓励主Agent创建更多可并行子任务、避免退化回串行;完成奖励要求子任务真正做完、防止为刷奖励批量开空任务;最终结果奖励判断任务是否真正解决。三种奖励的权重随训练动态变化,前期重任务拆解与并行化,后期转向最终结果。从演示看,Agent Swarm能同时下载阅读几百个信息源完成研究、并行撰写上百页文献综述的不同章节、同时分析十个数据集。Kimi K2.5发布时它已支持最多100个Agent并行、任务最多执行1500个步骤,而今年4月发布的K2.6把并行上限提高到了300个。 一个意外收获出现在视觉与文本的融合上。K2.5与前代K2的关键区别是改用早期融合训练:过去很多开源多模态模型走后期融合,先用约20万亿文本Token训出语言模型,再用约2万亿多模态Token把视觉能力贴上去;K2.5则从训练一开始就把视觉和文本数据混在一起,在K2文本基座上又训练了约15万亿混合Token。这带来了两个让杨植麟兴奋的结果。其一是只训练视觉任务也能提升文本推理:研究团队只让模型数数、识图、做视觉问答,没加数学或编程训练,文本推理能力却也变强了,换言之模型在练看的同时,想的能力也提升了。其二是反向的,如果文本基座足够强,模型甚至不一定需要专门的视觉SFT数据——K2.5采用零视觉SFT方案,所有监督微调数据都是纯文本,再通过文本与视觉联合的强化学习获得视觉能力,最终在视觉任务上仍接近 最先 进水平。杨植麟认为,这种双向迁移来自早期融合:当文本和视觉进入同一表征空间,一种模态学到的能力才有机会迁移到另一种,这也是K2.5能看图写代码的根基。 演讲末尾,杨植麟介绍了月之暗面刚发布的新研究Attention Residue(注意力残差),论文发表于3月15日,距离演讲仅两天。残差连接是2015年由何恺明等人提出的深度网络基础技术,如今是Transformer的标准组件,它让每一层既处理上层结果、又保留一条直接传递信息的通道,使深层模型能稳定训练。杨植麟援引Ilya Sutskever的说法,把残差连接理解为旋转了90度的LSTM——LSTM在时间维度上传信息,残差连接在深度维度上传信息。既然Transformer已经用注意力替代了LSTM在时间维度上的循环,那么深度维度是否也能同样替换?Attention Residue就是这个思路的产物:标准残差主要用上一层输出,而它允许当前层查看所有前序层输出,再通过注意力决定哪些历史信息保留、哪些忽略,让模型从被动接收上层结果,变成主动从整个计算历史中挑选信息。为控成本,实际采用分块版Block Attention Residual,每16层组成一个块,块内仍是标准残差,块间才用注意力残差,实验显示约8个块就能拿到大部分收益。它带来了约24%的Token效率提升,按杨植麟的算法,50万亿Token效率提高24%等于额外增加12万亿Token,在GPQA、MATH、HumanEval等推理、数学与编程测试上提升尤其明显。 把三件套摆在一起看,月之暗面的替代清单清晰得近乎挑衅:Adam换成MuonClip、全注意力换成Kimi Linear、残差连接换成Attention Residue,分别对应怎么从有限数据学更多、怎么更高效用超长上下文、怎么让深层网络更灵活传信息。三者都能相对独立地替换现有组件,且都已开源。这些技术能否直接叠加、增益能否简单相乘,目前还没经过完整验证,但它们至少说明了一件事:很多被认为已经足够好的基础组件,可能远没有到达终点。在优质数据越来越少、训练成本越来越高的当下,重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。这也正是杨植麟整场演讲想表达的核心——开源模型不能只是开放,还必须足够强。
嫌whisper.cpp和ONNX不够用?Handy作者开源transcribe.cpp:60+转录模型、GPU加速、即插即用替代 ↗
本地语音转录这块,开发者长期被困在一个尴尬的夹缝里:要么用whisper.cpp,要么用ONNX,想上苹果设备还得再塞一个MLX,等于同时维护两套引擎、为每个引擎各移植一遍模型。7月19日,知名语音转文字应用Handy的作者和维护者sebjones,把他在分发跨平台应用时踩过的坑,直接炼成了一个新库transcribe.cpp,并发布v0.1.0版本。这是一个基于ggml的语音转录库,支持当下所有 最新 的转录模型,且handy-computer这个Hugging Face组织下发布的每一个模型,都经过了数值验证和词错率(WER)测试,确保与官方参考实现一致。作者也坦承,这是0.1.0版本,难免有他一个人发现不了的粗糙之处,欢迎社区报告一起修。 催生transcribe.cpp的,是一连串憋屈的现实。sebjones直言,用现有的ASR推理栈去分发跨平台应用,体验非常糟糕。市面上虽有一些零散库声称支持大量模型,但作者不明、测试不清,留给他的是一连串疑问:这个库什么时候会停更?作者有没有考虑过官方绑定,让你能在真正的桌面或移动应用里用?它本质上是不是只是演示代码?做过基准测试吗?比ONNX快吗?作为一个需要把语音功能塞进Handy的人,他想要的是一个能下载模型文件就直接跑推理、且推理结果能和参考实现对得上的库;推理要跑在GPU上拿 最佳 性能,要能轻松嵌进Handy,而不是背上一个庞大的PyTorch;必须同时兼容Mac、Windows和Linux。几经比较,ggml成了他眼中 最好 的前进方向,既有强大社区,分发能力也出色。 落到具体能力上,transcribe.cpp给开发者交付的是一个又快又准的推理引擎,外加极其广泛的模型覆盖。它支持16个ASR模型族、合计60多个模型,更多模型还在路上。加速方面,它通过Vulkan、Metal、CUDA和TinyBLAS四条路径把推理搬到GPU上,作者尤其把Vulkan当成任何本地推理应用的底线,并为每个支持的模型在Fedora系统的Ryzen4750U(CPU加Vulkan)以及自己的M4Max上做了基准测试。每个模型都经过数值验证与完整的WER扫描,意味着它们被数千条语音片段反复打磨,输出与参考实现非常接近甚至完全一致,这些验证结果同时公开在transcribe.cpp仓库和Hugging Face对应模型页面里。功能层面,它支持流式转录与批量转录,并且基本可以作为whisper.cpp的即插即用替代方案——Handy原本就跑在whisper.cpp上,作者正是要用transcribe.cpp发一个更新把它换掉,为此他特意保持了对whisper.cpp随Handy发布的流行.bin文件的兼容,transcribe.cpp能直接运行这些文件;虽然部分标志和功能尚未对齐,但绝大多数用例下其whisper实现足够可靠,性能也大致相当。 真正让这个库有望走进真实产品的,是它从 第一 天起就把语言绑定当成了重点。库本身用C/C++写成,作者不仅需要Rust绑定,也清楚要让本地语音转录被广泛分发,至少得有像样的官方绑定撑场面。他挑了四种覆盖度最具代表性的语言:Python、JavaScript与TypeScript、Rust,以及Objective-C与Swift。他也欢迎社区在愿意承担维护的前提下贡献更多绑定。这些决策很大程度上由Handy的诉求驱动,而Handy本身的高人气,也让作者有了持续维护这个库的动力。 在作者看来,transcribe.cpp的 终极 目标是让本地ASR变得更易用。语音转录在绝大多数设备上都能跑出 极高 准确率,根本没必要把声音传到云端。他举了一个硬核例子:RK3566这块性能羸弱的芯片,用transcribe.cpp在CPU上就能以快于实时的速度跑模型,而用上 最先 进模型做快于实时的转录,功耗也只有几瓦。他判断,未来出于各种原因,会有更多推理发生在本地,分发问题因此变得至关重要;transcribe.cpp虽然远没从整体上解决它,但希望是向前的一小步。 在致谢里,作者点名了多位助力者:Mozilla AI及其BiR项目与工程师Davide在该项目还只是个模糊念头时就决定支持他;ggml及其贡献者是整个项目的地基;Modal提供了用于WER测试和CUDA验证的算力积分;Blacksmith扛起了部分CI/CD;Hugging Face则既是本地AI社区的支柱,也为handy-computer组织提供了模型存放的私有空间。至于是否有AI辅助开发,作者回答得很干脆:当然有,一个人靠ggml在几个月内从零写出这种规模的引擎是不可能的,但眼前这些文字没有一行是AI写的,全部出自他自己的口和手。 原文链接:workshop.cjpais.com/projects/transcribe-cpp
昆仑万维把 2026 定为世界模型元年:Matrix-Game 3. 5 单卡实时生成,5B模型跑出20FPS ↗
世界模型这条赛道,今年被一家中国公司正式写进了自己的时间表。在2026世界人工智能大会(WAIC)上,昆仑万维董事长方汉宣布,2026年就是世界模型元年,并一口气发布了Matrix-Game3.5世界模型、Mureka v9.5与O3音乐模型三款新品。 最受关注的是Matrix-Game3.5。昆仑万维给这套世界模型塞进了Patch级记忆注入能力,让模型在生成过程中能够携带并调用画面片段的记忆,从而把交互推向实时。性能数字相当亮眼:一个5B参数的模型,在720p分辨率下,单张显卡就能跑到20FPS的实时生成速度。更关键的是,其核心架构已经开源,这意味着做游戏和具身智能的开发者,可以直接把它拉下来试手。 音乐侧的两款模型则把AI创作做成了更明确的工具形态。Mureka v9.5与O3把AI音乐推向版本化创作,用户可以在不同版本之间迭代、比较和取舍,工具感比以往的生成式玩法强出不少。 从世界模型的实时交互,到音乐创作的版本化管理,昆仑万维这次的发布提纲,是把2026年定义为一个模型开始真正理解并生成可交互世界的起点。 开源地址:
Epoch AI测试三大AI文本检测器:模仿人类文风后最高近三成内容漏检 ↗
Epoch AI 最新 研究显示,主流AI文本检测器能够几乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,检测准确率明显下降,科学写作成为最难识别的场景。 研究团队测试了Pangram(3.3.2)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)三款主流AI文本检测器,并构建包含495篇人类原创文本的测试集,覆盖博客、小说和科学写作三类内容,所有样本均创作于ChatGPT于2022年11月发布之前,以避免训练数据污染。 测试结果显示,对于普通AI生成文本,三款检测器漏检率 最高 仅0.7%;在人类文本识别方面,Pangram和GPTZero未出现误报,而Originality.ai误将19篇人类文本判定为AI生成,误报率为3.8%。 研究进一步让Claude Opus4.8、GPT-5.5和Gemini3.1Pro学习作者提供的5篇真实作品,并按相同文风生成新内容。在297篇风格模仿文本中,平均约13%未被检测器识别,其中Pangram漏检率为10%,GPTZero为11%,Originality.ai达到18%。 科学写作成为检测器表现最弱的领域。Pangram、GPTZero和Originality.ai对学术风格AI文本的漏检率分别达到25%、24%和29%。个别模型组合表现更差,例如Pangram漏检了48%由Gemini生成的学术文本,Originality.ai则漏检了39%由GPT-5.5生成的学术内容。 尽管三款检测器采用神经网络、文本可预测性分析和统计模式识别等不同技术路线,但均暴露出相似短板。研究表明,随着大模型越来越擅长模拟人类写作风格,现有AI文本检测技术在教育、科研等依赖学术写作真实性的场景中,仍面临较大的识别挑战。
Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破 ↗
Google DeepMind近日发布新模型GenCeption,该模型基于预训练视频生成模型构建,用于解决深度估计、图像分割、3D姿态估计等经典计算机视觉任务,并在多项基准测试中达到接近或超过当前领先水平。值得关注的是,GenCeption所需训练数据规模远低于传统专用视觉模型。 当前计算机视觉领域仍以任务专用模型为主,例如用于分割任务的Segment Anything、用于深度估计的Depth Anything等,不同任务通常采用独立架构。DeepMind研究团队认为,大型文本到视频模型在训练过程中学习了场景空间结构、物体运动规律以及语言与视觉之间的关联,可能具备成为通用视觉基础模型的潜力。 GenCeption基于阿里巴巴开源视频模型Wan2.1开发,通过简化架构实现一次前向传播即可完成视觉任务预测。模型能够根据文本提示,从同一段视频中生成深度图、表面法线、分割掩码以及姿态估计结果,并通过可训练模块支持3D关键点等非图像输出任务。 在训练数据方面,GenCeption主要使用包含7500个视频的合成数据集,由800个人体模型结合200组动作序列,并通过Blender渲染生成。研究显示,该模型在深度估计、表面法线预测、3D姿态识别以及语言引导分割等任务中均取得优异表现,训练数据量仅为部分现有模型的七分之一至五百分之一。 此外,GenCeption展现出较强泛化能力。尽管训练数据主要来自单人合成人体视频,但模型能够处理真实世界中的多人场景、动物以及人形机器人等未见类别,并生成包含细节的视觉预测结果。 不过,研究团队也指出,联合训练多个任务可能影响部分复杂任务性能,同时模型推理速度仍需优化。目前,大模型处理81帧视频约需6至10秒。 GenCeption的发布表明,视频生成模型正在从内容生成工具向视觉理解基础模型方向拓展。未来,如何让生成式模型获得更可靠的物理理解和现实反馈能力,仍是AI研究领域的重要挑战。
面壁智能开源MiniCPM-Robot:1.5B的VLA模型完整放出,个人开发者也能在真机器人上跑操作 ↗
具身智能这场仗,过去基本是巨头和实验室的专属游戏——模型太大、门槛太高,普通开发者连真实机器人都摸不着。7月19日,面壁智能(OpenBMB)把这扇门直接踹开了。它开源了首个具身AI模型系列MiniCPM-Robot,把1.5B参数的视觉-语言-动作模型完整放出,让个人开发者也能在真实机器人上跑操作与目标跟踪,这种开放程度在具身领域相当罕见。 这套系列包含三个核心组件。主角之一是MiniCPM-RobotManip,一个1.5B参数的通用视觉-语言-动作(VLA)模型,专门负责机器人操作。另一位是MiniCPM-RobotTrack,一个面向现实世界目标跟踪的紧凑型模型。两者之外,面壁还一并发布了高性能推理框架PhyAI,专为具身模型构建,目标很直白:让机器人真正具备理解、记忆与行动的能力。三者合力,把高效、实用且开放的具身智能,从论文和演示一步步推向现实世界的机器人。 对开发者而言,最实在的是伸手就能拿到。模型权重与代码已托管在GitHub仓库github.com/OpenBMB/MiniCPM-Robot,MiniCPM-RobotManip与MiniCPM-RobotTrack各自的权重也分别在Hugging Face开放下载。做机器人的人,现在可以clone下来直接跑。 当1.5B的VLA模型不再被锁在实验室里,具身智能的下沉速度,或许会超出很多人的预期。 项目地址:
Claude Fable5使用权限大调整:部分用户失去访问权,Anthropic加速扩容 ↗
Anthropic宣布调整Claude Fable5模型的订阅访问策略,自7月20日起,Max和Team Premium套餐用户仍可继续使用Fable5,但使用限额将大幅降低。其中,奖励使用阶段结束后,常规使用额度将减少33%,Fable5的实际可用额度仅为调整后限额的50%。 与此同时,Pro和Team Standard套餐用户将失去Fable5访问权限,Anthropic将向这些用户提供一次性100美元使用额度,后续需按照API价格进行付费。由于高频调用成本较高,该额度可能较快消耗完毕。 Anthropic表示,公司正在持续投入资源提升计算产能,并承认Fable系列模型需求增长超出预期,对用户体验造成了一定影响。据悉,Anthropic此前曾考虑将Fable完全移出订阅套餐,此次调整被认为是其在算力压力与市场竞争之间做出的平衡。 行业分析认为,Anthropic调整策略的背后也受到竞争环境变化影响。随着OpenAI推出GPT-5.6Sol等新一代模型,部分模型在性能接近的情况下价格更具优势,同时来自中国市场的AI产品也持续推动价格竞争,使中高端模型服务面临更大的成本压力。 此次权限调整反映出当前AI行业进入规模化应用阶段后,模型需求增长、算力供给以及商业化模式之间的矛盾正在加剧。如何在保持用户体验的同时控制推理成本,已成为各大AI公司面临的重要挑战。
神珍科学多模态基础模型在沪亮相: 110 亿参数打通六类科学数据,一个模型读懂DNA到气象场 ↗
7 月 19 日,上海科学智能研究院在 2026 世界人工智能大会的科学智能开放论坛上,揭开了一个承托多领域科学智能研究的底层 超级 大脑——神珍科学多模态基础模型。这个名字取自《西游记》里的天河定底神珍铁,团队希望这套开放模型以相对精炼的形态承载多样科学任务,也让更多研究者参与检验、使用与共建。它是今年 3 月初面世的系统级科研智能体大圣的 超级 大脑。 在技术上,神珍立足物质科学、生命科学、地球科学等多元学科场景,阶段性实现了跨领域科学知识的统一表征与多模态融合理解。模型总参数约 110 亿,面向DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在一个统一模型中同时支持科学理解与多类结果生成。它的共享主干选用Qwen3-VL-8B,并为六类科学数据各设专门的数据处理通路,在接入共享模型之前分别保留序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节。更实用的是,神珍能直接生成RNA序列、可供计算机读取的分子表示SMILES、全球气象场以及医学影像分割结果,相当于把理解与生成两套能力捏进同一个框架。 开源与开放是这套模型的关键姿态。上智院已经放出了模型权重、推理代码、示例脚本与使用文档,研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台上汇聚的 1500 余个科学模型和工具组合使用;也可以在Hugging Face下载权重、在GitHub获取代码,一同共建开放的科学智能社区。 这场发布发生在WAIC2026 科学智能开放论坛的舞台上。论坛由世界人工智能大会组委会办公室指导、复旦大学和上智院联合主办,聚焦AI原生时代的科学闭环发现,汇聚了诸多知名科学家与一线青年产学研代表,深度探讨人工智能如何从方法论底层重构科学发现的全流程,谋一个开放协同的科学智能新生态。四位重量级科学家发表了主旨演讲,从不同维度打开理解科学智能的视角。 诺贝尔化学奖得主、香港中文大学深圳教授阿里耶·瓦谢尔强调,AI必须建立在可靠的物理机制之上。图灵奖得主、蒙特利尔大学教授吉勒斯·布拉萨德对量子计算在新材料发现等领域的潜力寄予厚望,并建议青年研究人员追随兴趣而非业界时髦,因为当下的研究发现有可能在十年之后才真正落地应用。 之江实验室主任、中国工程院院士王坚的分享围绕科学基础模型与科学作为一个整体展开。他指出,科学智能不在论文文本而在数据,但今天的基础模型仍建立在文本之上,未来需要让科学数据成为科学智能的原住民,也就是把各学科数据词元化,纳入同一表征空间。他判断AI正变得像数学一样基础,科研范式也将从STEM走向STE+MAP,即数学、AI与公共设施的结合,让科学重新成为一个整体。 美国国家科学院院士、普林斯顿大学教授范剑青以智能科学和社会为题,把AI概括为统计学习与优化决策的动态循环,并用社会经济测度、金融风控和大模型应用举例,阐释AI如何将数据转化为社会洞察。他强调AI服务于经济社会发展,在推动智能体与科研创新的同时,也必须持续回应就业结构变化、教育转型、伦理安全以及人类能否保持有效控制等问题。 巅峰 对话环节,与会嘉宾达成共识:AI原生时代的原始创新,一大关键在于人、数据、模型、实验与学术判断能否形成崭新的协同发现机制,这既需要科研基础设施的系统性升级,更需要一代科研工作者思维方式和能力结构的根本性重塑。 复旦大学特聘教授、上智院院长漆远点出了这场变革的终局想象。他表示,AI要从预测下一个Token走向发现未知的规律,而AI发现未知科学规律将是 超级 智能的开始。这一进程的核心,在于通过压缩从高维空间运用和发现简洁的机理,以及科学验证的高效闭环,这将促进数字与物理世界的结合与新的模型架构产生。他提醒,真实的科研是包含文献、假设、数据、模型、仿真、实验及反馈的长链条过程,科学智能领域正在着力发展能够组织复杂研究流程的系统能力。 当 110 亿参数的神珍把六类科学数据收进同一个大脑,科学发现的形态,或许正被悄悄改写。
Netflix5.87亿美元收购本·阿弗莱克AI电影制作公司InterPositive ↗
Netflix近日在提交的监管文件中披露,公司已以5.87亿美元现金完成对AI电影制作初创公司InterPositive的收购。该交易此前于3月宣布,但双方当时并未公布具体金额,彭博社此前报道称交易规模可能接近6亿美元。 InterPositive由演员兼导演本·阿弗莱克共同创立,专注于利用人工智能技术辅助影视制作流程。阿弗莱克表示,公司希望通过AI工具“保护人类创造力的力量”,帮助电影制作团队在后期制作阶段提升效率,尤其是在解决现实拍摄过程中的素材缺失、背景替换以及光线调整等问题方面。 根据Netflix此前公布的信息,InterPositive团队将在收购后整体加入Netflix,阿弗莱克将担任 高级 顾问,继续参与相关技术与创意方向的推进。 与此同时,Netflix在 最新 财报中透露,目前已有约300部影片采用生成式人工智能技术。此次收购进一步显示,Netflix正在加速布局AI驱动的影视生产体系,通过技术手段优化内容制作流程,同时探索人工智能与传统影视创作之间的融合路径。 随着生成式AI在视频生成、后期制作、 特效 处理等环节持续成熟,影视行业正迎来制作模式的深层调整,AI辅助创作能力也逐渐成为流媒体平台竞争的重要方向。
Kimi因算力紧缺暂停C端新用户订阅,全速推进集群扩容 ↗
7月19日深夜,Kimi发布公告称,由于近期用户请求量快速增长,现有算力集群承载压力接近极限,团队决定暂停C端新用户订阅,并启动算力扩容计划。 Kimi表示,过去48小时内,用户请求量大幅超出此前预估,当前算力资源已接近集群 最大 承载能力。为保障已有订阅用户的服务体验,Kimi将优先调配现有算力资源,确保已订阅用户权益不受影响。同时,团队正在全速推进算力扩容,待新增算力陆续到位后,将逐步开放更多订阅名额,直至恢复正常订阅服务。 在订阅体系调整方面,Kimi计划对后续新用户权益进行拆分,将“Kimi主权益”和“Kimi Code权益”分别管理。其中,Kimi主权益覆盖Kimi Web、Kimi APP以及Kimi Work等产品服务,Kimi Code则面向代码相关使用场景,以实现算力资源更精准匹配,提升整体服务稳定性。 此次暂停新增订阅反映出AI应用快速增长背景下,模型服务商面临的算力供给压力。随着大模型应用规模持续扩大,算力基础设施、资源调度能力以及用户增长之间的平衡,正在成为AI企业商业化运营的重要挑战。
阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源 ↗
大模型的开源节奏,正在被国内头部厂商越拉越紧。 据悉,阿里 最新 一代大模型千问3. 8 即将发布并同步开源,这意味着通义千问家族在开源赛道上又向前迈出一步。 新模型的体验窗口已经悄然打开。目前,Qwen3.8-Max预览版已率先上线阿里云Token Plan、Qoder以及QoderWork三个平台,用户现在就能提前摸一摸这一代新模型的能力边界。按照阿里的规划,Qwen3.8-Max的正式版将于近期正式推出并开源,届时完整的模型权重将向开发者开放。 在国产大模型密集发力的当下,阿里选择让预览版先行、正式版紧随开源,既提前释放了产品信号,也把模型能力放进真实用户场景里接受检验。千问3. 8 正式版开源的那一刻,开源大模型阵营的 天花板,大概率又要被重新丈量一次。
发布仅三天就踩下刹车:Kimi K3 用户请求爆表,月之暗面算力顶到天花板 ↗
一款大模型上线三天就不得不暂停新用户入口,这种事在行业里并不多见,但月之暗面刚刚就这么做了。 7 月 19 日,Kimi官方发布公告称,由于Kimi K3 上线后用户请求量快速增长,为保障现有订阅用户的使用体验,即日起暂停C端新用户订阅,把现有算力优先投入已订阅用户服务,确保他们的会员权益不受影响。 这纸公告背后,是一组超出团队预期的数字。Kimi团队表示,自 7 月 16 日发布Kimi K3 以来,产品获得了远超预期的用户支持,但过去 48 小时内,用户请求量已大幅超过此前的预估,并逼近现有算力集群的承载极限。在算力完成扩容之前,平台将暂时停止向C端开放新的订阅名额。公告同时给出承诺:月之暗面目前正全速推进算力扩容,随着新增算力陆续上线,平台会逐步恢复新用户订阅,直至全面恢复正常开放。 与暂停订阅同步抛出的,还有一项权益拆分计划。Kimi宣布,未来面向新订阅用户,将把Kimi主权益与Kimi Code权益拆开。其中,Kimi主权益覆盖Kimi Web、Kimi App和Kimi Work,平台称此举旨在更精准地匹配算力资源,保障不同产品的使用体验。换句话说,越来越吃算力的编程能力,将被单独拆出来核算成本。 把时间拨回三天前的发布日。Kimi K3 于 7 月 16 日正式发布,是月之暗面目前能力 最强 的大模型,拥有2. 8 万亿参数和 100 万Tokens的上下文窗口,主要面向长程编程与端到端知识工作。根据Kimi开放平台公布的信息,K3 采用按量计费模式,输入价格为每 100 万Tokens2 元(缓存命中)或 20 元(缓存未命中),输出价格为每 100 万Tokens100 元。 更值得玩味的是商业侧的反馈。 7 月 18 日,Kimi总裁张予彤表示,K3 将于近日开放模型权重。她同时透露,数据显示,在 7 月 17 日K3 发布节点,公司年化收入(ARR)创下了历史 最大 单日增幅。一边是收入曲线被需求瞬间拉出尖峰,一边是算力基础设施被真实流量顶到了极限——这次暂停订阅,恰好把大模型从发布PPT走进真实生产环境后最尖锐的矛盾,赤裸裸地摆在了台面上。 当一个2. 8 万亿参数的巨兽撞上用户的真实热情,算力扩容的速度, 第一 次成了比模型参数更紧迫的考题。
Kimi正式发布2.8万亿大模型K3,这是属于我们的荣光。 ↗
原创 数字生命卡兹克 2026-07-17 06:08 上海 大就是好 今天凌晨,Kimi K3,终于正式跟大家见面了。 2.8万亿参数,百万上下文。 而且,官宣7月27号,全面开源。 没啥可说的,让我们此刻一起欢呼吧。 月之暗面昨天下午就发了预告,片子也非常的艺术,在他们心中,这是一个能证明自己、将整个月之暗面,带向新一个时代的模型。 如果说智谱是做后训练的神,把GLM-5系列带到了一个全新的高度。 那在我心中,其实国内做预训练的扛把子,一直都是Kimi。 而且一直都是大参数的代表。 K2是几个月前国内第一个把模型推到1T级别的。 过去还有很多人说,大模型的Scaling Law要见顶了,要失效了。 可如今发现我们发现,大依然就是好,大依然就是牛逼,大依然就是智能。 就像我至今依然觉得Claude Opus 4.6是我心中最水桶级别的白月光,写作创意认知Agent代码能力都极强,因为那可是个5T的模型啊。 后面Opus 4.7和4.8就强化学习一路强化歪了,Coding能力确实提升了,但是创意和规划能力拉完了,非常明显的一路下滑,口碑一路崩塌。。。 至于现在最牛逼的Claude Fable 5的参数量,目前没人知道,但是跟一些朋友讨论和猜测,可能到了10T级别,因为现在Grok内部训得最高参数量的模型也是10T级别,感觉应该差不多。。。 再把眼光放回到国内,Kimi之后,DeepSeek V4 pro和美团的LongCat 2.0也都迈入了万亿级别,逐渐的,万亿参数模型,已经快成了标配。 而今天,Kimi K3来了。 这一次,他们把模型的参数量推到了2.8T级别,这是国内的第一个3万亿参数级别的模型,而且更是全世界,第一个面向所有人开源的3万亿参数级别的模型。 开心,为Kimi感到自豪。 老规矩,再看下Kimi K3的跑分。 先看AA给的智能分数,Kimi K3来到了第三,仅次于Fable 5和GPT-5.6 Sol,超过了其他所有的模型。 这一下,kimi代替Google,成为新一代御三家了。。。 然后再看Coding。 也正好趁着这个机会,我想用这些评测集来结合我的体感,简单给大家看看一个模型的性格和特点怎么理解。 每个模型其实都是有自己擅长和不擅长的,强如Falble 5,其实也有短板,只不过它的短板的高度,比很多模型的长板甚至还要长。 先说Coding这块,一共六个评测,其实我们可以把它们分成两类来看。 第一类,我自己喜欢叫它精准执行型评测,大概就是测模型能不能精确地完成一个明确的任务,不多不少,不漏不错。 你可以理解成老板给你一个非常明确的任务清单,上面写得清清楚楚要改什么。这种任务考验的就是精准度和执行力,你得理解需求、定位问题、精准修改、不引入新bug。 DeepSWE和Terminal Bench 2.1这两个就是比较典型的,一个更偏纯执行,一个更偏综合性的执行。 GPT-5.6 Sol在这两个评测中都拿到了第一,它在需求理解、环境操作、调试收敛和最终交付方面确实就是最稳的,跟我日常使用的体感是一致的。 至于Opus 4.8,幻觉率太高,我骂了很多回了,这个位置跟我体感也是一致。 而Kimi K3,在执行的精准度上,在DeepSWE上仅次于Claude Fable 5和GPT 5.6 Sol,而在Terminal Bench 2.1上,甚至拿到了第二名。 第二类评测就反过来了,我叫它方案规划型。 比如FrontierSWE,这个测的是前沿级别的、特别难的软件工程问题,需要创造性思考、深度理解复杂系统才能解决的问题。 Fable 5基本没啥可说的,断崖式领先所有的,GPT系列大家都知道创新型任务还有方案设计做的一直都很差,比Fable 5差了很多,是GPT系列的短板,而这次,Kimi K3直接一脚插在了Fable 5和GPT-5.6 Sol之间。 从这个就可以看出来Kimi K3的定位了,可以说非常的中庸之道。 也就是各方面都不错,一个非常全面的水桶模型,在每一个领域里,虽然都打不过那个最强的,但是总能排到第二或者第三。 坦诚的讲,这样的水桶模型,在日常使用中,反而体验感可能会更好一些,我现在经常就是Fable 5和GPT-5.6 Sol来回切换,一边做方案,一边做执行,确实是目前最强组合,但是也麻烦啊。。。 更别提国内,有多少人用不上Fable 5的了。 海外还有人说,Kimi又是靠蒸馏啥的,但是讲道理,这个级别已经不是蒸馏能蒸出来的了。 兰伯特都看不下了,直接是这么怼的。。。 我觉得非常有代表意义。 再来看很多人更看重的Agent能力,这个玩意主要跟Work强相关。 BrowseComp,测的是在浏览器环境下的复杂信息理解和处理,其实就是深度研究。你可以理解成“给模型一个浏览器,让它自己去网上找信息、理解内容、完成任务”,K3拿了91.2,全场第一,GPT-5.6 Sol以90.4紧随其后,Fable 5是88.0。 这个是kimi一贯的拿手好戏了,用过Kimi集群的应该都感受过它的威力。 Automation Bench,测的是自动化任务的执行能力,把一系列操作串起来自动完成,K3也是第一,
分享一下我现在随时随地让Agent干活的远程操控方案。 ↗
原创 数字生命卡兹克 2026-07-16 08:12 北京 在哪都能Coding 昨天那篇文章,我说了一下我现在用Agent的日常。 为了不浪费Agent的时间和Token,我几乎不管在路上、在外面,都在让Agent干活。 然后评论区居然有好几个朋友问教程。 那自然,是有求必应。 所以今天我觉得可以给大家分享一下,我自己这一整套远程使用Agent干活的组合和流程,而且支持多设备协同,你完全不需要考虑什么.md文件、Agent记忆、Skill同步之类的问题,我自己觉得特别适合我自己,也安利公司小伙伴所有人在用。 且不止是Vibe Coding,其实用Agent干所有的日常任务,比如知识处理、数据分析等等的所有任务,都可以让你远程拿着手机处理掉一切,完全没有任何问题。 核心其实就是两个东西,Codex主力操控 + UU远程兜底(我对天发誓这不是UU远程的广告,是它真的很好用)。 这两个东西的定位不太一样,我一个一个说,但是组合起来,是真的无敌。 Codex自带的远程控制功能,能够同步你所有设备的开发任务。 在我家里有一台Mac Mini,24小时不关机,永远开机状态,这就是我的Agent干活专用电脑。 平时我出门或者出差的时候,会通过手机和Macbook Air,远程操控这台电脑,不管我人在哪,都能使用这台Mac Mini。 这样做最省心的地方就是,我所有的规则、配置、Agent的记忆、Skills等等,全部都在家里那台Mac Mini上。 我的MacBook也好,手机也好,都只是它的遥控器,直接省掉了多机维护这个破事。 有多设备协同的朋友一定懂我的这个痛点。 昨天评论区里还有人问能不能让不同主机上的Agent对同一个项目统一管理。 我的建议就是别折腾了,直接沿用我这套远程操控的思路。 首先是Codex作为主力远程操控,有一说一,Codex的远程控制的体验实在是好用的没朋友了。 连接方法也很简单。 在你所有的电脑和手机都下载好ChatGPT的App。 链接在此: 装好之后,在电脑端打开设置,左边栏找到连接,先把允许连接打开,然后点下面的添加。 用手机打开摄像头扫一下电脑上弹出来的二维码,就能连上了。 连上之后,打开手机上的ChatGPT的App,在左边的侧边栏你会看到一个Codex的入口,点进去。 进去以后就能看到你电脑上的项目列表了,连上之后你平时的对话和项目是完全同步的。 你也可以点击右下角,随意的新建会话,这个是我觉得比Claude那个远程控制好用的多的多的地方。 发新任务的时候,还可以选择工作区和工作树,能将你的任务进行隔离。 在过程中,可以用手机实时看进度,项目做完了或者需要你确认什么的,都会有提醒。 还有一个设置记得打开,就是在连接页面最下面的让这台Mac保持唤醒状态。 接下来说一个很多人不知道的隐藏玩法,就是你可以在Codex里,用一个台电脑控制远程另一台电脑上的Codex。 流程也跟连接手机差不多。 首先在你的Agent主力机上,打开设置里连接,在控制这台Mac这里点添加,它会生成一串8位的代码。 然后切到你的另一台电脑上,同样打开设置里的连接,点控制其他设备,再进行授权。 它会弹出一个输入框,把刚才主力机上那串代码输进去就行了。 [
平均每天Vibe Coding 16小时后,这是我觉得Fable 5和GPT-5.6时代最好用的AI开发流程。 ↗
原创 数字生命卡兹克 2026-07-15 08:02 北京 大道至简 最近两周,因为Claude Fable 5回归、GPT-5.6上线再加上Tibo义父疯狂的重置。 以及AIHOT月活用户,最近也正式突破了50万。 所以导致,我现在每天Vibe Coding的时间,几乎惊人的达到了16个小时。 我现在每天Vibe Coding到早上6、7点,然后睡一觉到中午12点起床收菜,然后去公司,路上用UU远程+Codex继续Coding。 我几乎不会让AI闲着,他们闲着的每一秒,我用不完的每一个token,都感觉是对Tibo义父的不尊重。 每天真的就是不眠不休,感觉自己染上了Coding的瘾,主要还是创造和学习知识的快感,实在是太爽了。 昨天回复一个人的评论我还是这么回复的: 那种爽感我一直不知道怎么描述。 直到前天打车去机场,时间感觉要赶不上的时候,我跟司机说,求求你快点,然后司机一脚油门,那一瞬间我知道该怎么形容这种爽感了。 这是一种属于时代的推背感。 它在不断推着你向前、向前、再向前。 而因为Claude Fable 5和GPT-5.6 Sol在智力和执行上的飞跃,我跟Agent协同开发的流程相比于Opus 4.8时代,也有了比较大的转变。 前期我把巨量的Token都消耗在了一个地方,那就是优化我的整体测试流程上。 在Vibe Coding中,开发的流程已经被大幅加速,写代码已经不再是瓶颈了,瓶颈专业到了测试、验证,还有你对方案的评审上。 测试覆盖率目前做到了还算是比较舒服的区间。 然后因为现在高频提交、Agent自动开PR、反复跑测试的开发方式,为了节省测试和部署的时间,我甚至单独去腾讯云上搞了一台便宜的服务器来做CI,没用GitHub的托管Runner了,然后做了很多任务类型的路由来保证测试全面性和准确性的情况下,节省整体的时间。 哦对了,这里可以提一句,其实Vibe Coding到后面,当你项目越来越大的时候,像Codex的所谓的1.5倍快速模式有的时候并不快,开着没啥意义。 因为大量的时间都是消耗在了确定性测试流程上,Agent提测,测试要大概5分钟时间,然后被测试打回,修复,继续提测,又是5分钟。 整体缩短的时间其实相当有限。 整体测试流程优化的差不多了之后,你会发现,你的想法,终于可以肆意的挥洒了,因为,你大概率无需担心实现不了或者出现BUG,只要你能提出来,那大概率能稳定且完美的实现。 那最大的难点就来了,前期如何设计你的方案,如何自动化的交给Agent进行开发,同时省心省力,上线的效果还有保障。 这两周跟这两顶级模型协同下来,我觉得最好的流程,就是Claude Fable 5做研究出方案初版,GPT-5.6 Sol来纠错和优化,然后在Codex中开起目标模式全自动化执行,之后,你就可以放手去睡觉,等着起床收菜就行了。 就是这么简单。 大道至简,重剑无锋,你根本不需要什么奇奇怪怪的技巧,直接说话就行。 举个新鲜的例子。 还是我的AIHOT。 最近在史诗级强化了防御、优化了Agent接入机制、上线了UI 2.0、解决了用户收不到Skill更新通知的问题、大幅重置了详情页、更新了精选算法、优化了聚簇的算法、还有一堆更新之后,我又想把之前一直想做的一个新功能给大幅重构和加强了。 就是全网AI热点,也就是现在当前热点那个位置。 判断什么东西很热是一个很有意思的话题,我对它的理解特别简单,就两个指标: 有多少人正在讨论它,它的数据趋势怎么样。 这两者合并,基本就能看出一个事件的热点程度了,如果一个事件,讨论的人越来越多,总数据越来越大,那基本就可以看出来这是一个正在大幅增长的热点。 如果人数越来越多,但是数据增长趋势一般,从而两者形成了剪刀差,那可能就是营销投放或者别的原因。 如果人数不咋多,但是数据一直在大涨,那可能就是平台推荐算法的随机漫步,或者是跟具体的人相关,而不足以成为破圈性的热点。 所以,我想用这个机制,来做一个功能,去抓取整个互联网,可能上万个以上的信源,来去找到并监控AI行业,真正正在爆发的热点。 现在AIHOT上的当前热点其实做的非常的粗糙,就是看看目前监控的200多个信源有多少人正在讨论,在24小时这个生命周期的衰退里,这个数字是多少,然后排个大小。 但是要升级成真正的全网AI热点,那肯定不能这么干的,肯定要解决我刚才提到的两点里面的第一点,要监控更多的账号,甚至可能是上万个账号。 而且这些账号,整体是要跟精选体系里监控的账号分开的,这上万个账号,只贡献热度,但是不会被精选,在我的体系里,一般称为热点信源。 大概就这个目标,然后,我就把这一通需求,第一步,先发送给了Claude Fable 5,让它给我出一个方案。 我发过去的字就不用干了,直接豆包语音输入法瞎BB的,非常乱,但是大概的意思表达清楚了就差不多了。 你相信我,在如今这个时代,Claude Fable 5在做方案的初版设计上,在先进程度和优雅程度上,就是当世独一档,越是大型的方案越能体现出它的智力程度。 在大概20分钟之后,这个方案出来了。 但是注意,这个方案是不能直接用的,这也是为什么我说Claude Fable 5的方案只能是初版的原因,因为Claude家族一向的特性,就是丢东西,不细致也不细心。 所以接下来是第二步,把我们的需求和Claude Fable 5的方案,直接复制粘贴给Codex,选中模型为GPT-5.6 Sol极高。 然后说,这是隔壁同事做的,你详细审查一下。 GPT-5.6 Sol经常能挑出Claude Fable 5方案的问题,而且是比较严重的问题。 比如这一次,它花了6分钟,找到了个原有方案里非常关键的隔离问题,甚至会影响我们其他的流程管线和架构。 最后问了我一个问题。 回答完以后,它就给了我最终的方案。
How Canada uses Claude: Findings from the Anthropic Economic Index ↗
Le français suit. Key findings Based on the latest release of the Anthropic Economic Index, Canada is at the forefront of Claude adoption. Canada represents 2.6% of global Claude.ai traffic and ranks 8th overall by total volume. Usage per capita is more than four times higher than would be expected given the size of its population. Canada’s high adoption rate is generally consistent with its high-income economy, but still stands out within its peer group. Among the top ten countries that collectively represent more than half of all usage, Canada is second only to the United States in usage per capita. Within Canada, adoption is regionally concentrated. Ontario accounts for 43.9% of conversations. Together with Quebec, British Columbia, and Alberta, the four largest provinces account for roughly 94% of national usage. Per capita, British Columbia leads at 1.4x more than expected based on population, followed by Ontario at 1.1x; every other province has below-parity rates of adoption, with Newfoundland and Labrador at 0.2x. In contrast to global, cross-country patterns, provincial income per capita does not appear to explain the gap. Instead, industrial composition appears more important: provinces with large professional, scientific, and technical services sectors use Claude the most. This aligns with other evidence that model capabilities matched to workforce composition determine overall adoption levels within high-income countries. Usage patterns in Canada are largely uncorrelated with adoption rates: Work accounts for 34–40% of conversations in every province, coursework for 13–18%, and personal use for 44–51%. We find evidence that specific use cases coincide with local economic characteristics. Translation requests track public administration employment shares across provinces, likely reflecting Canada's policy of official bilingualism in federal services and communications: New Brunswick, Nova Scotia, and Quebec have both the highest rates of public administration employment and the largest shares of conversations devoted to translation. Document translation is also the most distinctive Canadian use case relative to Anglosphere peers. More generally, Canadian usage tilts toward academic and early-career usage: academic coursework, coding assistance, and resume drafting are all overrepresented, while professional communication and everyday personal tasks are underrepresented. Canada is at the forefront of Claude adoption Adoption of Claude is high in Canada. Based on a sample of Claude.ai conversations in February 2026, 2.6% of global traffic is in Canada. Adjusting for population, its Anthropic AI Usage Index (AUI) is 4.4, which implies that usage per capita is more than four times higher than would be expected based on its working-age population. Among the top ten countries that lead in terms of overall Claude usage volume, Canada has the second-highest AUI, just behind the United States (Figure 1). Figure 1: Usage share and per capita adoption among top ten countries by global Claude.ai use Bars show each country’s share (left panel) and the Anthropic AI Usage Index (right panel) based on 1M conversations sampled from Claude.ai in February 2026. Canada highlighted in blue. The Anthropic AI Usage Index (AUI) measures whether Claude usage is over- or under-represented in a country relative to its working age population. Canada accounts for 2.6% of global Claude.ai consumer use, ranking eighth globally, and second by AUI. Sources: Anthropic Economic Index, February 2026; World Bank. In part, this reflects the fact that Canada is a high-income country. Among advanced economies, as defined by the IMF, there is a clear link between usage per capita and GDP per working-age capita. But Canada’s adoption exceeds what would be expected based on its income (Figure 2). In this sense, Canada appears further along on its AI adoption curve as compared to peer countries, perhaps reflecting its highly educated workforce and proximity to the US technology frontier. Figure 2: Anthropic AI Usage Index (AUI) and GDP per working-age capita This plot shows the bivariate relationship between each country’s AUI and GDP per working-age person among IMF advanced economies with at least 200 conversations in our sample. The dashed line shows the line of best fit. Canada highlighted in blue. Sources: Anthropic Economic Index, February 2026; IMF; World Bank. Within Canada, adoption is concentrated and tracks workforce composition Just as global adoption of Claude is disproportionately concentrated among a small number of countries, usage within Canada is unevenly distributed across provinces
聊聊今年涌进Anthropic的N个巨佬,他们押注的是下一个十年。 ↗
原创 数字生命卡兹克 2026-07-14 08:11 北京 史上最豪华打工天团 昨天,又看到一个新闻,又有一个新成员官宣加入Anthropic。 Tom Blomfield宣布从YC请假,加入Anthropic。 给我一下子整不会了。 不是,为什么这么多巨佬,都选择加入了Anthropic啊。 这个名字如果你在国内没听过很正常,但在英国金融科技圈,他是标志性人物。 他联合创办了Monzo,英国最大的数字银行之一,用户覆盖英国10%的人口,在那之前他还联合创办了GoCardless,做银行支付的基础设施,两家公司都做到了独角兽,估值超过10亿美元。 2019年英国女王授予他OBE勋章,表彰他对银行业竞争和普惠金融的贡献,后来他去了YC当合伙人,这是全世界最顶级的创业加速器,孵化过Airbnb、Stripe、Dropbox等等等等。 现在他放下了这一切,去Anthropic当了一个MTS(Member of Technical Staff)。 而且说实话,他这样的巨佬,已经不是个例了。 我回过头去,扒了扒今年上半年加入Anthropic的巨佬,不扒不知道,一扒吓一跳,这个身份之多远,身份地位之高,还是会让我有些诧异。 我从里面挑了9个我觉得非常有意思的人,给大家扒一扒,也能从他们身上,看出这些最聪明的人,对于这个时代的选择。 第一个,自然得从上半年那个最出圈的说起。 一、 Andrej Karpathy 今年5月19日,Andrej Karpathy在X上发帖宣布加入Anthropic。 发出去几个小时阅读量就破了百万。 如果你对AI这个领域稍微有点了解,你应该知道这个名字的分量,圈内人都叫他卡神。 他的YouTube上的神经网络保姆级教程系列,已经有了近3000万总播放。 而更猛的,是他的履历。 2015年,斯坦福博士毕业,导师是李飞飞。 同年,成为OpenAI的创始团队成员。 2017年,被马斯克挖去特斯拉当AI总监,直接向马斯克汇报。在 特斯拉 的五年里,他主导了Autopilot和FSD整个视觉系统的开发,特斯拉那条纯视觉路线的核心推动者就是他。 2022年离开Tesla,2023年短暂回到OpenAI,2024年又走了,自己创办了Eureka Labs做AI教育。 到了今年5月,他来到了Anthropic。 他加入的是Nick Joseph的预训练团队,组建一个子团队,做的事情是用Claude来加速Claude自己的预训练研究。 Anthropic内部现在超过80%合入代码库的代码由Claude生成,人类工程师主要就是负责指挥和审查,Karpathy的团队要把这个逻辑推到极致,用当前这一代Claude来加速下一代Claude的诞生。 简单说就是让AI研究AI自己。 他加入Anthropic的消息,大家可能多少都有刷到。 毕竟他是AI圈子里知名度最高的人之一,这事很难不出圈。 而这种级别的大佬,其实所有的顶级高管offer都是随便拿,但是最后他选择加入了Anthropic,来全身心的去做研究。 二、John Jumper 今年6月,John Jumper在X上发帖,宣布离开DeepMind,加入Anthropic。 他的本科是范德堡大学的物理和数学,硕士是剑桥的理论凝聚态物理,博士是芝加哥大学的理论化学。 2017年加入DeepMind,带队做蛋白质结构预测,搞出了AlphaFold,在蛋白质结构预测问题上取得突破,预测了超过2亿个蛋白质结构。 2024年拿了诺贝尔化学奖,39岁,70年来化学领域最年轻的诺奖得主。 他在DeepMind待了将近九年。 然后,他走了。 有一个背景值得注意。 2026年2月,Anthropic宣布和Allen Institute、Howard Hughes Medical Institute展开生命科学合作。 Allen Institute这边,重点是用多智能体系统做多组学数据分析、知识图谱管理和实验设计协调。 HHMI这边,是把AI agents放进实验室,连接实验知识、科学仪器和数据分析工作流。 4月据报道收购了隐形生物科技公司Coefficient Bio,开始准备内部建wet lab,就是能做真实生物化学实验的物理实验室。 这些基础设施全部就位之后,AlphaFold的缔造者来了。 一个诺贝尔化学奖得主,从世界上最好的AI研究机构之一主动离开。 这样的大神,其实已经不缺钱不缺荣誉不缺学术地位了,缺的就是一个他觉得值得全力以赴去做的新东西。 三、Peter Bailis Peter Bailis之前是Workday CTO。 先说一下Workday是干嘛的。简单讲就是全球最大的企业HR和财务管理软件公司之一,年收入逼近100亿美元,超过2万名员工,几乎所有大公司的人力资源系统背后都有它的影子。 Peter Bailis在2025年5月被请去当CTO,负责整个公司的agentic AI战略。 不过Bailis的背景其实不是纯管理出身。 他之前是斯坦福计算机系的教授,做过数据库和分布式系统研究,后来创办了Sisu Data,融了1.28亿美元,2023年被Snowflake收购。 之后去Google Cloud当工程VP,负责AI for Data,做过NL2SQL和RAG相关的产品,真的就属于学术能力和工程能力都非常牛逼的那种人。 然后,他在Workday待了不到一年,2026年3月决定走了,去Anthropic当了一个MTS,负责强化学习这块。 MTS全称Member of Technical Staff,是Anthropic和OpenAI通用的工程岗位名称,不管你之前是什么头衔,进来一律叫这个。 一家年收入接近百亿美元的企业软件公司CTO,在任职不到一年后转向Anthropic的强
Claude’s values across models and languages ↗
When someone asks Claude a question with no universal right answer—say, whether to take a new job or how to handle conflict with a friend—how Claude responds inevitably reflects certain values. 1 The values we want Claude to reflect are outlined at a high level in Claude’s constitution, but no document can anticipate every value that might emerge across the millions of conversations that happen every day on Claude.ai. Instead, we seek to cultivate in Claude’s responses “good judgment and sound values that can be applied contextually.” How, exactly, do we study the values that Claude expresses and how they change in different contexts? In previous work, we analyzed 700,000 anonymized Claude.ai conversations, identifying more than 3,000 distinct values in Claude's responses and how often Claude expressed them. But a list of values so large is hard to reason about. In this work, we make studying these thousands of values tractable by compressing them into a small number of axes that capture key patterns in Claude’s responses. Each axis is a number line between two groups of values—for example, values relating to emotional warmth on one end and values relating to rigor on the other—and where Claude falls on that line tells us which values it leans toward. We applied this approach to measure how the values Claude expresses vary across two factors. First, we compared how the values Claude expresses vary across models. Each Claude model reflects a slightly different approach to character training as well as many other fine-tuning decisions. Because our value axis approach quantifies key differences between models, it may ultimately allow us to connect variation in the values Claude expresses to different training decisions. Second, we want to understand how the experience of users compares across the many languages people use to talk to Claude. Our previous research has shown that Claude behaves somewhat differently in different languages. 2 We apply our value axis approach to understand how the values expressed by Claude vary across the top 20 languages on Claude.ai. Figure 1: Claude’s expressed values differ between Opus 4.6 and Opus 4.7 and between English and Arabic. Opus 4.6 leans toward expressing values related to deference, rigor, brevity, and execution while Opus 4.7 leans toward expressing values related to caution, rigor, depth, and candor. In English, Claude leans toward expressing values related to caution, rigor, depth, and candor, while in Arabic it leans toward deference, warmth, brevity, and execution. We find: Four key axes capture 15% of the variation in Claude's values: 3 Deference vs. Caution: Whether Claude leans toward accommodating what someone wants or guarding against possible risk and harm. Warmth vs. Rigor: Whether Claude leans toward expressing positivity and care for the person or emphasizing accuracy and precision. Depth vs. Brevity: Whether Claude leans toward explaining in depth or doing only what was asked. Candor vs. Execution: Whether Claude leans toward foregrounding its own uncertainty or producing a more polished and confident answer. Value profiles across these axes match perceptions of model character. Sonnet 4.6 is regarded as particularly warm, while Opus 4.7 is known for rigor. We find that each model’s value profile mirrors these subjective assessments: Sonnet 4.6 leans toward expressing more deference to the user and emotional warmth while Opus 4.7 leans toward expressing a focus on accuracy and precision as well as guarding against misuse. The values Claude expresses vary across languages. When Claude speaks in English, it emphasizes different values than when it speaks in Portuguese, Indonesian, or Chinese. 4 The largest variation is in the Warmth vs. Rigor axis, with Claude leaning toward expressing warmth-related values most in Arabic and Hindi and rigor-related values most in English and Russian. With this approach we can begin to ask why values shift across models and languages and better test how factors such as behavioral training or cultural context influence the values that Claude expresses. How do we interpret the giant space of values? Ultimately, our goal is to have a way to empirically understand the values that Claude expresses and how these vary across contexts. In this work, we focus specifically on how the values change between models and languages. But our previous work, Values in the Wild, identified more than 3,000 values expressed by Claude. Comparing these thousands of values one by one would be unwieldy and would obscure broader trends. To make comparing values easier, we constructed value axes that reduce those thousands of values down to a few underlying dimensions based on which values tend to show up together i
Claude plays robotics ↗
Shmuel Berman, Michael Ilie, Jia Deng, and Daniel Freeman Do language models’ strengths transfer to robotics, a domain which requires the synthesis of logical skills and precise 3D understanding? Can a model perceive a scene, understand a particular robot’s state, and issue actions that reliably effect change in the physical world? We ran tests to find out. We gave several language models control over a range of robot bodies—including classic control toys, a simulated quadruped and humanoid, a robotic arm, and a real Unitree Go2 (the quadruped robot of Project Fetch ). We gave the models a range of ways to control them, which varied in their abstraction (that is, how “high-level” their instructions are): from directly commanding motor torques (at the least abstract end), to writing controller code, to training a controller from scratch with reinforcement learning, to providing high-level steering instructions to a pretrained robot policy (a separate neural network that turns high-level commands into coordinated joint movements). We tested models’ performance in three areas: on classic control problems (like balancing a pendulum), locomotion and navigation (getting legged robots to balance, walk, and move through space), and manipulation (using a robotic arm to grasp and move objects). Models are getting better at robotics quickly, but we found that how capable they are depends heavily on how they are connected to the robot—which of the control methods they used. When they must drive the joints themselves they mostly fail. But when they supervise a pretrained controller or use simple orientation tools, they can complete real navigation and manipulation tasks. Some forms of embodiment remain unwieldy and difficult to control, but newer models, especially, are substantially stronger at adjusting their strategies and converting image and sensory understanding into appropriate actions across domains. This has important implications for the safe development and deployment of language models. Today’s frontier models cannot control humanoid robots without a pretrained policy, but newer models have made real gains in direct manipulation and high-level policy control across the humanoid and quadruped embodiments we tested. We expect future models to be even better. Put concretely: a general-purpose chat model with no robotics training can already, on a good run, write and download its own tools to slowly walk a quadruped through a maze or pick a plate off a counter and set it on a stove, and the gap in reliability is closing with each model generation. Composite score on Embody (our benchmark suite) by model, stacked by control interface. The composite is a normalized average across every robot body ("embodiment") and task in the suite except for high-level locomotion; higher bars mean broader physical competence. Summary of findings A model's robotics score depends as much on the robot body and the control interface as on the model itself. The same model can look weak or strong depending on whether it is setting motor torques directly, writing a Python controller, supervising a pretrained policy, or training its own policy with reinforcement learning—each of which is a different way of the model completing the same task. For the most challenging bodies to control (the humanoid in particular), today's models only get traction at the higher-abstraction interfaces, in which a pretrained policy handles the low-level physics. Models are improving at robotics, but unevenly. The most consistent performance improvements between model generations are on the high-level interfaces. Direct low-level control is also improving, but much less consistently: some new models clearly improve over their predecessors, but others don’t. On locomotion tasks, frontier models can now perform limited but meaningful whole-body control. Newer models make progress on low level control quadruped standing, balancing, and walking—and show weaker but measurable gains on humanoid balancing. Using pretrained policies and perception tools, they can even navigate simple environments. However, models still fail at tasks that require stable spatial memory, self-localization, or long open-loop plans. With low-level manipulation methods, models are beginning to produce useful local physical behavior, even though full task success remains rare. Newer models are better at reaching objects, making contact, and grasping. However, they only complete the full task a small percentage of the time (from 0 to 5.5%). With high-level manipulation methods, newer models are more successful when using pretrained policies. Vision-language-action (VLA) scaffolds—pretrained policies that map camera images and an instruction directly to robot-arm motions—raise models’ manipulation performance far above direct control. Newer models are also becoming increasingly g
An off switch for dual-use knowledge in AI models ↗
This post describes research conducted by AE Studio in collaboration with Anthropic. A frontier AI model is, among other things, a large store of knowledge. Some of that knowledge is dual use, meaning it can be used for good or for bad. For example, knowledge of cybersecurity can help patch critical security vulnerabilities, or it can be used to exploit them. Knowledge of virology can help a researcher create a vaccine, but it can also help a malicious actor design a deadly pathogen. Ideally, we would be able to balance three separate goals: first, limiting access to dual-use capabilities in as surgical a way as possible; second, allowing trusted users to access those same capabilities for beneficial purposes; and third, doing all this without affecting the model’s performance on any other task. Current safeguards are imperfect. We train models to refuse harmful requests and use classifiers to screen inputs and outputs for dangerous content. These layers of protection guard against dangerous outputs—but they don’t change the knowledge stored in the underlying model. Despite our safeguards, a sufficiently determined attacker may still try to jailbreak the model, working past its defenses to access the dual-use knowledge. A more robust protection against misuse would be to control what the model knows. We’ve explored this before: in earlier work, we filtered information about chemical, biological, radiological, and nuclear weapons out of pretraining data, and later showed that dual-use knowledge can be confined to a removable slice of a model’s weights. But filtering is a blunt instrument. It produces one model with one fixed set of capabilities. Using filtering, if you want a model version that can discuss advanced virology—for deployment in a vetted biosecurity lab, say—and another version that can’t, you have to train two separate models. Especially in the case of frontier models (which are large and very expensive to train), the cost to the developer would be prohibitive. In new research carried out with collaborators at AE Studio, we explore a new method that could enable the benefits of training many separately filtered models, but at the cost of training only one model. We call it GRAM, for Gradient-Routed Auxiliary Modules. Note that the results of the experiments presented here are preliminary—GRAM has not been applied to any of the production models at Anthropic, and we’re not sure it ever will be. How GRAM works The idea behind GRAM is to give a model dedicated, removable compartments for each category of dual-use knowledge, and to update only those compartments when learning from dual-use data. Concretely, GRAM adds extra neurons to every layer of a standard Transformer (the neural network architecture on which large language models are based). These neurons are divided into groups (or “modules”), one per dual-use category. During training, when the model encounters general-purpose text, it learns in the usual way. But when it encounters text from a dual-use category—virology, for instance—the rules change: the model can use its general knowledge to make predictions, but only the virology module is allowed to learn from that text. The general-purpose weights are temporarily frozen. 1 The consequence is that virology knowledge accumulates in the virology module rather than diffusing across the whole network. After training, the module can simply be deleted, and the capability goes with it. Or it can be left in place for trusted deployments, when virology knowledge is needed. The knowledge can be tailored very specifically to the type of deployment needed: in our experiments, we defined four dual-use categories, so that one training run with GRAM yielded a model that can be configured 16 different ways (“on” or “off” for each of the four categories). Testing GRAM We tested GRAM in three settings of increasing realism. First, on a synthetic dataset of children’s stories tagged by topic, a small GRAM model could be reconfigured to “forget” any chosen topic, and each configuration performed almost identically to a separate model trained from scratch with that topic filtered out. That is, for the cost of training a single model, we achieved results that would normally require multiple training runs on different datasets. Second, we trained a larger model on a realistic mix of web text, code, and scientific papers, with four dual-use domains: virology, cybersecurity, nuclear physics, and a niche programming language (to serve as a proxy for specialized dual-use code). The capability associated with each dual-use domain is routed to its own module. Deleting a module removed the corresponding capability about as effectively as never having trained on that data at all. Remarkably, we find that this removal did not degrade general performance. We also tested whether an attacker could recover
10:00 更新
12 itemsNo items match these filters.