原文:AI Engineering Skills Map: Building and Deploying AI Applications
作者:Andrew Ng|原文发布于 2026 年 8 月 21 日
我之前介绍过一份 AI 工程技能地图。它最上层的四组能力分别是:
- 构建与部署 AI 应用
- 软件工程基础
- 使用编程 Agent
- 塑造构建过程
这篇文章重点展开第一项:构建与部署 AI 应用。
一名擅长构建和部署 AI 应用的工程师,需要掌握六组能力:
- LLM 基础
- 用数据增强模型
- 构建 Agent 系统
- 评测驱动开发
- 生产环境运维
- 机器学习基础
这份技能地图来自对大量招聘信息、结构化专家访谈和问卷反馈的分析。
AI 应用为什么需要不同的工程方法
AI 应用与非 AI 软件最关键的区别,在于前者的输出更难预测。你无法提前知道一个 LLM 会输出什么,也无法完全预知监督学习算法会给出怎样的预测。
正因为存在这种不确定性,构建 AI 系统通常比开发传统软件更依赖迭代,也更难在一开始就规划出完整路径。优秀的 AI 工程师会反复构建一小部分软件、检查结果,再根据中间反馈决定下一步尝试什么。
能否准确判断“接下来应该做什么”,决定了你能不能用并不可靠的 AI 组件,搭建出可靠的软件系统。下面六组能力,就是完成这件事的基础。
LLM 基础
理解大语言模型怎样切分输入、生成输出,可以帮助你判断什么时候能够依赖模型,什么时候它可能失败。
这也意味着你需要知道:
- 什么时候应该使用多模态模型;
- 上下文窗口里应该放什么,哪些内容应该舍弃;
- 缓存命中、知识截止日期和推理强度意味着什么;
- 采样参数会怎样改变结果;
- 什么时候应该使用工具调用等特殊能力。
掌握这些基础之后,你才能选择合适的模型或模型组合,并在需要时正确使用微调、自托管等专门技术。
用数据增强模型
LLM 需要高质量的输入上下文,才能产出真正有用的结果。
早期常见的方法,是通过向量搜索构建 RAG,为模型补充相关材料。但现在,让模型基于数据工作的技术已经丰富得多。工程师需要判断:哪些内容应该直接写进提示词,哪些信息应该让模型通过工具按需获取;面对不同的数据与查询,又该选择向量索引、知识图谱,还是建立在结构化数据之上的语义层。
你还需要把文本、PDF、HTML 和图片等文档转换成适合 LLM 使用的输入,并搭建持续保持数据干净、新鲜的数据管道。
只有了解这些获取和组织数据的方法,才更有可能把真正相关的上下文交给模型。
构建 Agent 系统
Agent 系统覆盖的范围很广:一端是按照预先设定的顺序执行多次 LLM 调用的工作流,另一端则是基于 Agent Harness,让模型在循环中不断自行决定下一步做什么。
构建这类系统时,你需要选择合适的架构,包括:
- 哪些步骤串行执行,哪些步骤并行执行;
- 什么时候使用确定性的代码,什么时候交给 LLM;
- 怎样设计工作流或 Harness,以及失败后的兜底路径;
- 模型可以调用哪些工具,包括 MCP、CLI 和沙箱执行环境;
- 采用怎样的记忆架构;
- 怎样管理长会话中的上下文;
- 什么任务需要多 Agent 协作,什么任务用单 Agent 就够了。
把一个有潜力的原型变成可靠、安全、可以用于生产的 Agent,还需要理解防护栏、对抗性输入、数据外泄等关键风险,以及相应的治理方法。
Agent 工作流仍在快速发展。根据应用领域不同,语音 Agent、Computer Use Agent 和生成式 UI 等前沿技术,也可能成为需要掌握的能力。
评测驱动开发
根据我的经验,判断一个人是否真正擅长构建 AI 系统,最重要的标准,是他能否通过一套严谨的评测与错误分析循环来推动开发。
这样的循环能让团队持续把精力投入到更可能有效的方向上。但它并不容易掌握,因为正确方法会随着项目不同、甚至项目所处阶段不同而显著变化。
构建一套好的评测,本身就是一项有深度的技术能力。你可能需要检查系统的轨迹与输出、开展探索性数据分析,再结合产品与业务判断,决定真正应该测量什么。
同时,你还需要理解不同评测方法的适用场景:
- 什么时候使用确定性的代码评测;
- 什么时候使用 LLM-as-a-judge;
- 什么时候必须让人参与判断;
- 怎样评测评测本身,并持续改进它。
这些评测结果会继续进入下一轮开发,使产品进步变得系统化,而不是靠随机尝试碰运气。
生产环境运维
AI 软件的不可预测性、成本和延迟,让它的生产运维与传统软件有所不同。
首先,你需要建立可观测机制,理解系统在真实使用中的表现:持续追踪性能、发现漂移,并在模型故障或对抗性提示注入等安全事件出现时快速响应。
回归测试和 CI/CD 也需要比传统软件包含更多统计评测,而且测试投入应该与错误可能带来的风险相匹配。
此外,当应用拥有大量用户时,成本和延迟会成为核心工程问题。你需要从模型选择优化、蒸馏、微调和简化 Agent 工作流等方法中,挑选合适的组合,在效果、成本与响应速度之间取得平衡。
机器学习基础
现代 LLM 建立在监督学习、强化学习等机器学习技术之上。我认识的优秀 LLM 工程师,通常也在不同程度上理解机器学习与深度学习。
很多应用仍然需要传统机器学习能力:你可能使用别人训练的模型,也可能自行训练模型。这要求你了解常见的机器学习与深度学习模型,理解它们在准确率、训练速度和推理速度等方面的取舍,并知道怎样准备训练和评测所需的数据。
偏差与方差、错误分析和数据工程等机器学习概念,依然是处理不确定输出系统时非常重要的思维框架,也会影响 AI 系统开发中的大量决策。
结语
要真正擅长构建和部署 AI 系统,需要学习的内容很多,这也是一个技术深度很高的领域。
但每多掌握一部分,你都会成为更好的 AI 工程师,也更有能力做出令人兴奋的应用。与这些能力相互补充的另一块重要基础,是软件工程;Andrew Ng 表示会在后续文章中继续展开。