资讯日报 · DAILY BRIEF
星期六
22:00 更新
10 条清华弄了个镜像错觉艺术生成器,支持3D打印 | CVPR'26亮点
新智元 2026-07-24 12:33 北京 新智元报道 【新智元导读】 清华大学团队研发的AutoMIA系统,可将任意两张图片转化为具有镜像错觉效果的3D艺术品,实现正反两面不同图案的视觉呈现,并支持3D打印。 先看下面两组照片:每一组里,左边是镜子前物体的正面图案,右边是它在镜中的倒影。奇怪的是,正面与镜中呈现出的几乎是两个毫不相干的东西——第一组正面是「CVPR」,镜中却变成「2026」;第二组正面是「山」,镜中却成了「水」。 它们的轮廓、颜色乃至含义都对不上,仿佛是一种「错觉」。 背后的原因是,它来自一个经过特殊设计的3D物体,利用人类视觉系统的「对称补全效应」而使人产生错觉,这类现象被称为镜像错觉艺术。 研究者通过精心设计三维几何和表面颜色,让一个真实物体在直接观察和镜中观察时呈现出截然不同的视觉效果。 以下是两组对应的「解密」视频。 传统意义上,这类艺术品的设计需要专业艺术家巧妙的构思,以及大量复杂的人工设计经验和数学计算,此类艺术品的设计对于普通人的门槛很高。 那么有没有一种方法可以自动化地帮助人们完成这样的艺术设计,让普通人也可以将自己的灵感转化为艺术品呢? 近日,来自清华大学等单位的研究团队提出了AutoMIA,一种自动生成镜像错觉艺术的 AI 设计方法,用户仅需任意指定两张图片,分别对应镜子前和镜子中的图案,AutoMIA就可以自动完成3维艺术品的设计,并且支持直接3D打印出来制作艺术品。 论文链接: 代码链接: 论文已被CVPR 2026接收,并被评为大会亮点论文(Highlight Paper);同时,因其较高的计算效率,该工作还获得了CVPR高效计算奖 (Efficient CVPR)。 研究背景 光学错觉艺术长期以来都是艺术、心理学和计算机视觉交叉领域中的重要问题。常见的 2D错觉包括混合图像、视觉变形图像等;3D错觉则包括Shadow Art、Multi-View Wire Art等。 这些方法通常依赖特定视角、投影或阴影关系,让同一个物体在不同观察条件下呈现不同外观。 Mirror Illusion Art是一种更特殊的3D错觉:一个真实物体被放在镜子前时,观察者在正面看到一种图案,而在镜中看到另一种图案。 此前,相关设计往往需要大量人工推导和手工调整,并且多集中在形状设计上,难以同时处理彩色图案。若直接借鉴Shadow Art一类方法,也容易产生表面噪声、背景浮块或内部断裂,影响视觉质量和实体制作。 因此,作者提出了一个直接的问题:能否让AI自动设计这种镜像幻觉物体?给定两张目标图片,系统是否可以同时优化3D形状和颜色,使同一物体在两个视角下呈现两种指定外观? 研究方法 AutoMIA将这一问题建模为一个双视角逆设计任务。系统用体素表示3D物体,每个体素包含密度和颜色信息;随后通过可微体渲染,从两个指定视角渲染该物体,并将渲染结果与两张目标图像进行比较。 优化目标同时包含形状相似度和颜色相似度,从而让生成物体既满足轮廓要求,也能生成目标图像的颜色。 在实际优化中,作者发现了四类关键问题:表面噪声、背景噪声、内部断裂以及形状和颜色优化不平衡。 为此,论文提出了四个核心机制。 首先是PAC,即基于投影对齐的连通域剪枝。系统会把当前体素中的连通分量逐个投影到两个视角,并根据它们与目标mask的重合程度和背景溢出情况进行评分,保留真正有助于目标图案的结构,去除漂浮或无效的噪声部分。 其次是PWA,即基于位置的加权自适应抑噪。它会根据像素到目标区域的距离调整背景惩罚权重,使远离目标图案的错误投影受到更强惩罚,从而减少远处的背景噪声。 第三是IVP,即内部体素保护。由于监督图像主要约束物体表面,内部体素容易在优化中被错误削弱,导致结构断裂。IVP会识别内部体素并施加密度下限,帮助保持物体完整性,这对后续3D打印尤其重要。 最后是SCD,即形状—颜色解耦优化。AutoMIA将训练过程划分为形状优化、形状颜色联合优化和颜色细化阶段,避免颜色过早干扰几何结构,也减少不同视角颜色之间的冲突。 实验结果 论文在多类2D图像作为输入时验证了AutoMIA,包括英文字母、数字、汉字、几何图案、emoji、卡通图案和logo等。 实验中,作者将AutoMIA与Shadow Art(SA)和 Shadow Art Revisited(SAR) 等方法进行了比较。由于基线方法主要支持形状优化,比较重点包括平滑程度、噪声水平和形状一致性等指标。 结果显示,AutoMIA在重建质量上取得了明显优势。论文报告中,AutoMIA的 平滑程度(SL) 达到0.989,噪声水平(NL) 降至0.049,形状一致性(SS) 达到0.931;相比之下,SA 和 SAR 在形状一致性和噪声控制上均存在明显差距。 同时,AutoMIA在单张RTX 3090上平均设计时间仅为76秒,平均显存占用约2.6GB,体现出高效的计算效率。
推荐理由CVPR亮点论文展示AI生成立体错觉艺术,结合3D打印,在创意应用领域有新意但行业影响力有限。
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径
ASI启示录 2026-07-24 12:33 北京 微信团队,找到AI的第三条Scaling Law 新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Scaling参数和思维链之外,到底有没有第三条路? 微信WeLM团队给了一个全新的答案—— 把额外算力折叠进序列内部,让模型在token之间完成隐式思考。输出不变长,每个token想得更深。 这套方法叫Hidden Decoding,隐式序列缩放。 而WeLM做到的关键一步,是把它推到了前沿规模。 从3月的80B参数,到现在的617B MoE,不仅增量续训只用了完整训练量的5.3%,而且9个评测全部超越自回归基线。 把思考折叠进序列 WeLM 617B MoE的隐式Scaling路径 7月14日,微信WeLM团队放出了Hidden Decoding系列的第二篇博客,并首次展示了一个新模型的进展:一个总参数617B、评估表现达到开源头部水平的模型。 博客地址: 这并非该系列的首度发声。 今年3月2日,WeLM 团队就发表了系列的第一篇博客,彼时Hidden Decoding还是一套相对朴素的早期实现,只在80B规模上跑通了初步验证。 四个月过去,新博客不仅把方法做扎实,更第一次展示了将该方案上推到600B+模型的效果。 这篇博客的核心,是介绍Hidden Decoding如何被推进到100B+ MoE的前沿规模—— 把每个token在序列维度上展开成多条并行的「流」,让同一套Transformer权重在一次前向传播里完成多步隐式推理,而只在最后一条流上计算损失。 换句话说,模型在落笔写下下一个token之前,先在自己的序列内部折叠进了一段不为人见的思考。 如果说过去一年大模型的两条主线是「把参数做大」和「把思维链做长」,Hidden Decoding展示的是第三条路:在不动参数的前提下,把额外算力藏进序列本身,让推理在模型内部多走几步。 参数与思维链之后,第三条路指向隐式序列 过去一年,大模型社区的努力可以粗略分成两条线。 一条是把模型本身做大,总参数冲到万亿、激活参数冲到30B以上;另一条是在后训练阶段堆算力,靠强化学习和更长的思维链把推理能力「逼」出来。 随着o1、DeepSeek-R1以及一众「思考模型」的走红,这后一条路线几乎成了默认叙事。 但两条线共享同一个隐含前提,都需要「更多」。更多参数、更多高质量推理数据。 Hidden Decoding的提出,恰好绕开了这个前提。它不在数据侧做文章,而是回到预训练与继续预训练阶段,问了一个更朴素的问题—— 同一套权重、同一批数据,能不能通过更聪明的算力组织方式,逼出更多能力? 这条路并非没人走过。 循环模型、各类「在序列维度做扩展」的尝试,都属于同一种思路。让同一套权重在一次前向里多走几步。 卡点也很清楚。循环模型串行不可并行,序列扩展又容易让注意力按序列长度的平方膨胀,在大模型上训不动、也用不起。 因此相关讨论虽多,真正在前沿规模跑通的却很少。WeLM这篇博客文章,正是要把这条被绕开的路,在100B+ MoE的体量上重新打通。 先认识一下WeLM:微信大模型的四代演进 WeLM是微信AI团队持续研发的通用大语言模型系列,承载着微信在大模型时代的核心技术战略,也是微信参与前沿人工智能竞争最为关键的技术底座。 从2022年首次公开亮相至今,WeLM已连续迭代四代。 虽然团队过往对外发声始终秉持审慎的态度,但从近期集中发布的技术博客来看,其已清晰勾勒出一条技术演进路线—— 从V3时代的训练体系搭建,到V4时代的效率与质量创新,再到600B级模型的Scaling突破与Hidden Decoding的推理范式创新。 这标志着WeLM已形成覆盖预训练、后训练和推理优化的完整技术版图。 更重要的是,WeLM绝非止步于论文指标与实验室评测的试验性模型。 当前已进入灰度测试阶段的微信AI助手「小微」,其核心模型能力由WeLM提供。依托微信这一拥有超大规模用户基数的国民级产品生态,WeLM已成功进入由真实用户、真实流量与真实复杂任务所构成的终极试炼场。 从这次Hidden Decoding系列技术博客的发布中,我们可以窥见WeLM团队将前沿模型技术和规模化应用实践相结合的思考。 Hidden Decoding:把思考折叠进序列 Hidden Decoding的做法,可以概括为三步: 给定输入序列和n份词表嵌入,把第i个token的第k条「流」表征放在物理位置(i−1)n+k上,构成长度为nL的扩展序列; 扩展序列在标准因果注意力和连续的位置编码下,送进同一个Transformer,不新增任何主干参数; 训练时只在每个token的最后一条流上计算下一个token的预测损失,前n−1条流不接收任何直接监督。 换句话说,前面的流像是给最后一流「打草稿」——逐步精炼表征、保留更宽的候选集合,等最后一流再收敛到最终预测。
推荐理由WeLM 617B MoE提出隐式序列缩放新路径,为Scaling Law提供第三条道路,兼具技术突破与开源模型进展。
刚获菲尔兹奖,Ta转身就跳槽OpenAI
ASI启示录 2026-07-24 12:33 北京 最后一届纯人类菲尔兹奖!新晋得主真信了 新智元报道 昨日,2026年国际数学家大会ICM正式官宣:邓煜、John Pardon、Jacob Tsimerman、王虹,共享本年度菲尔兹奖! 直播截图|前排从左至右:邓煜、John Pardon、Jacob Tsimerman、王虹 菲尔兹奖一下出现了两个中国籍数学家——王虹、邓煜,一举在菲尔兹奖90年历史中实现了中国国籍数学家人数从0到2的突破! 消息传来,国内一夜刷屏。 而且中国籍数学家王虹、邓煜同为北大2007级本科校友,北京大学成为中国目前唯一的「双菲院校」。 此外,另一位获奖者John Pardon精通汉语,在国际中文辩论赛、「汉语桥」世界大学生文化比赛中大秀汉语。 Jacob Tsimerman成了本届菲尔兹得主中唯一一个还不会讲汉语的数学家。 更具戏剧性的是,在获奖后的新闻发布上,他突然官宣转行。 在问及下一步计划时,Jacob Tsimerman宣布加入OpenAI,从事AI安全的工作: 接下来,我已经开始将我的职业生涯转向AI安全领域,利用数学来服务于安全及其他方面。 …… 我很快将在OpenAI的安全部门开始一个新职位。 2年,AI将在数学上彻底超越人类 Tsimerman因彻底解决 「安德烈-奥尔特猜想」(André-Oort Conjecture) 等算术几何难题获奖——那是代数几何皇冠上的明珠,几代数学家都啃不动的硬骨头。 他还是第一位在加拿大本土机构完成这一成就的获奖者。 换句话说,他现在正处于数学研究的黄金期。而现在,他亲手掐断了自己的学术传承,不再招研究生,宣布转行。 他的理由是,他不愿再训练年轻人,投身一个 可能几年内就不复存在的职业。 Tsimerman直言: 「我担心这个领域正处于危险之中」。 他给出了吓人的时间表—— 2年之内,AI将在所有数学证明领域彻底超越人类。 也就是2028年前后。 「我担心这个领域正处于危险之中」。 这不是外行的臆测。Tsimerman自己就体验过:AI已经把他的科研生产力 提高了一倍 ——起初,只是帮他加速那些无聊、机械的部分。 但很快他意识到,AI正在从一个「好用的计算器」,变成一个 「思考的同行」。 从去年底到今年,各大实验室的推理模型接连在IMO乃至前沿猜想验证上撕开口子。人们曾以为「定理证明」是不容一粒沙子的人类护城河,如今这条护城河正在迅速归零。 原因并不复杂。纯数学的本质,是在极度抽象的符号空间里搜索结构性真理——而这种搜索,在万卡集群和强化学习的加持下,正是AI最擅长的游戏。 人类大脑几十年沉淀出的「数学直觉」,在近乎无限的算力面前,可能只是一种 效率极低的生物突触组合。 他还算过一笔更冷的账:现在入学的博士生2030年毕业时,他们的导师——哪怕是菲尔兹奖得主——在AGI面前也已失去速度与深度上的比较优势。 所以,不如不招。 当外行人还在推测,今年是最后一届颁给人类的菲尔兹奖,刚获菲尔兹奖的Jacob Tsimerman已经行动了。 参考资料: 编辑:大卫 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 跳转微信打开
推荐理由菲尔兹奖得主转投OpenAI安全部门并预警AI两年内超越人类数学,震撼数学界与AI社区,具有极高稀缺性和影响面。
08:00 更新 · 等待中
本批次发布后,条目会出现在这里。
14:00 更新 · 等待中
本批次发布后,条目会出现在这里。
次日 02:00 补充更新 · 等待中
本批次发布后,条目会出现在这里。
没有符合当前条件的资讯。