Coding Agent 要完成大型软件任务,究竟还缺什么
Factory 的 ProgramBench 实验说明:Coding Agent 在大型任务中往往不是能力不够,而是过早认定完成;一套独立、可执行的完成标准,能显著提高最终行为完整度。
知识搜索
按关键词和栏目,快速找到教程与知识文章。
41篇内容
Factory 的 ProgramBench 实验说明:Coding Agent 在大型任务中往往不是能力不够,而是过早认定完成;一套独立、可执行的完成标准,能显著提高最终行为完整度。
Warp 把一次性的人类反馈沉淀成技能文件:内层基础技能干活,外层改进技能定期消化反馈并发起 PR,让 Agent 的输出随使用越来越准。
先不急着安装,从源码结构和 Agent Loop 理解 Pi 是什么、它与模型是什么关系,以及它为什么刻意保持极简。
以 TrueForge 网页研究 Agent 为例,完整拆解模型循环、MCP、Skills、沙箱、子 Agent、上下文压缩、审批门禁与持久事件流如何共同支撑长任务。
Andrew Ng 梳理 AI 工程师构建可靠应用所需的六组核心能力:LLM 基础、数据增强、Agent 系统、评测驱动开发、生产运维与机器学习基础。
前两章看到模型的输入在循环里一轮轮变大,这一章从源码看 Pi 怎么给它“瘦身”:什么时候触发压缩、从哪里下刀、旧消息被改写成了什么。
一个 TypeScript 文件怎么改变 Pi 的行为:扩展从哪里被发现和加载、事件钩子挂在循环的哪些位置、一次工具调用是怎么被拦下的。
解剖 Pi 的工具:一个工具由什么构成、四个内置工具各有哪些参数、多个调用怎么调度,以及并行执行时怎么保证不打架。
循环在生产消息,压缩在改写消息——它们最终都落进哪?从源码看 Pi 的会话文件:一行一条记录,parentId 把一列行长成一棵树。
模型每轮收到的输入是现场组装的:系统提示词怎么拼、消息列表长什么形状、工具输出进上下文前经过了哪些防护。
解释推理轨迹为何本质上是被路由到独立通道的文本、推理强度怎样写入系统提示词,以及模型如何在关闭原生推理时泄漏思考。
从广义相对论的另一条推导路径出发,讨论互联知识如何支持科学突破,以及它对 AI 安全与持续学习意味着什么。
Marek Minor 复盘一年时间里如何手工设计、校准、迁移并交付 Cursor 的 600 多枚图标,以及怎样把一致性变成可持续的设计基础设施。
从模型、输入输出 Token、提示词缓存和上下文管理出发,解释怎样用更少的无效消耗完成更多工作。
解读 ngrok 的《Compression is prediction》:压缩率为何取决于预测概率,算术编码、信息熵与 LLM 的交叉熵训练又如何指向同一套数学。
Nick Nisi 复盘自己为何错把 pi 当成更快的 Claude Code,以及可扩展的 Harness 如何让工具从外部脚本真正进入智能体会话。
介绍 WorkBuddy 移动端的云端工作、连接电脑、自动化、文件处理与微信分享,体验只用手机调度 Agent 的完整办公流程。
MiniMax 团队在 Reddit AMA 中回应 H3 开源、2K 重生成、稀疏注意力、低步数版本、图像模型与远景画质等关键问题。
Sean Goedecke 反思 AI 驱动的频繁上下文切换如何让人偏向快速判断,并讨论为什么亲自写作和阅读真正的书仍是维持深度思考的有效方式。
推理 API 正通过加密推理、隐藏搜索上下文、不透明压缩、密封的子代理消息和服务端 ID,把 AI 会话越来越深地绑定在单一提供商上。
用通俗的方式解释 CLI、Harness、Skills、HTML 与 GitHub,帮助非技术用户建立一套实用的 AI 基础认知。
HyperFrames 介绍如何用带类型的合成项目变量,将一次视频构建变成可复用模板,并在本地、托管云端和 Lambda 中批量生成个性化视频。
Dex Horthy 使用 SlopCodeBench 测试 Opus 4.8、Sonnet 5 和 Opus 5,衡量前沿模型能否在需求逐步揭示的过程中持续演进代码库。
Miguel 讲述 camelAI 如何用 Durable Objects、SQLite、R2、Pi、Code Mode、动态 Workers 和按需 Linux 容器取代常驻虚拟机。
提示词缓存如何影响编程智能体的成本、延迟、工具设计和系统架构,以及 Pi 如何让缓存行为变得可观测。
HyperFrames 介绍如何将同一个视频项目从本地 Chrome 与 FFmpeg 迁移到托管云端,并覆盖模板复用、CI、回调和幂等生产流程。
HyperFrames 介绍 Claude Design 如何基于品牌设计系统生成可直接使用的 HTML 和 CSS,以及如何交给 Claude Code 完成更稳定的视频制作流程。
Dex Horthy 分析无人值守的 AI 软件工厂为何会持续损害代码库的可维护性、现有基准为何无法衡量设计质量,以及人工评审为什么仍不可替代。
从核心循环开始,逐层用 CrewAI 重建 Claude Code 风格的智能体 Harness:工具、规划、子代理、沙箱、人工审批、记忆与检查点。
通过混元 3、表格 Skill、视频专家和产品战略专家团,演示如何在 WorkBuddy 中完成数据分析、视频制作与产品需求研究。
介绍如何为 WorkBuddy 配置第三方模型、连接知识库与腾讯会议,并使用设计工具和自动化工作流提升日常办公效率。
从安装登录、工作模式和模型配置,到专家、Skills、自动化、连接器与远程设置,系统了解 WorkBuddy 的核心用法。
通过 ChatGPT App 将手机与 Mac 上的 Codex App 配对,同步对话并在移动端继续编程。
从安装登录、界面布局到 AGENTS.md、内置浏览器、插件、Computer Use、自动化和 Hatch Pet,完整了解 Codex App 的核心用法。
从自由聊天、内置浏览器和 Computer Use,到 Plan、Agent Team、Memory 与 Chronicle,整理 Codex App 的实用玩法。
企业里是如何使用 Claude Code 的实践案例总结。
通过Claude的Skills功能,可以提升AI设计的页面质量。
Vibe Coding课程,介绍如何使用Google AI Studio
Anthropic 官方介绍Skills, MCP, Projects, Prompt的区别
OpenAI官方出品GPT-5.1提示词使用指南
Claude官方出品提示词工程最佳实践
没有找到符合条件的内容。