EDITOR’S SELECTION

AI 工程技能地图:构建与部署 AI 应用

Andrew Ng 梳理 AI 工程师构建可靠应用所需的六组核心能力:LLM 基础、数据增强、Agent 系统、评测驱动开发、生产运维与机器学习基础。

发布于
所属栏目
精选阅读
阅读时间
6 分钟
资料来源
x.com

原文:AI Engineering Skills Map: Building and Deploying AI Applications

作者:Andrew Ng|原文发布于 2026 年 8 月 21 日

AI 工程技能地图:构建与部署 AI 应用

我之前介绍过一份 AI 工程技能地图。它最上层的四组能力分别是:

  1. 构建与部署 AI 应用
  2. 软件工程基础
  3. 使用编程 Agent
  4. 塑造构建过程

这篇文章重点展开第一项:构建与部署 AI 应用。

一名擅长构建和部署 AI 应用的工程师,需要掌握六组能力:

  • LLM 基础
  • 用数据增强模型
  • 构建 Agent 系统
  • 评测驱动开发
  • 生产环境运维
  • 机器学习基础

这份技能地图来自对大量招聘信息、结构化专家访谈和问卷反馈的分析。

AI 应用为什么需要不同的工程方法

AI 应用与非 AI 软件最关键的区别,在于前者的输出更难预测。你无法提前知道一个 LLM 会输出什么,也无法完全预知监督学习算法会给出怎样的预测。

正因为存在这种不确定性,构建 AI 系统通常比开发传统软件更依赖迭代,也更难在一开始就规划出完整路径。优秀的 AI 工程师会反复构建一小部分软件、检查结果,再根据中间反馈决定下一步尝试什么。

能否准确判断“接下来应该做什么”,决定了你能不能用并不可靠的 AI 组件,搭建出可靠的软件系统。下面六组能力,就是完成这件事的基础。

LLM 基础

理解大语言模型怎样切分输入、生成输出,可以帮助你判断什么时候能够依赖模型,什么时候它可能失败。

这也意味着你需要知道:

  • 什么时候应该使用多模态模型;
  • 上下文窗口里应该放什么,哪些内容应该舍弃;
  • 缓存命中、知识截止日期和推理强度意味着什么;
  • 采样参数会怎样改变结果;
  • 什么时候应该使用工具调用等特殊能力。

掌握这些基础之后,你才能选择合适的模型或模型组合,并在需要时正确使用微调、自托管等专门技术。

用数据增强模型

LLM 需要高质量的输入上下文,才能产出真正有用的结果。

早期常见的方法,是通过向量搜索构建 RAG,为模型补充相关材料。但现在,让模型基于数据工作的技术已经丰富得多。工程师需要判断:哪些内容应该直接写进提示词,哪些信息应该让模型通过工具按需获取;面对不同的数据与查询,又该选择向量索引、知识图谱,还是建立在结构化数据之上的语义层。

你还需要把文本、PDF、HTML 和图片等文档转换成适合 LLM 使用的输入,并搭建持续保持数据干净、新鲜的数据管道。

只有了解这些获取和组织数据的方法,才更有可能把真正相关的上下文交给模型。

构建 Agent 系统

Agent 系统覆盖的范围很广:一端是按照预先设定的顺序执行多次 LLM 调用的工作流,另一端则是基于 Agent Harness,让模型在循环中不断自行决定下一步做什么。

构建这类系统时,你需要选择合适的架构,包括:

  • 哪些步骤串行执行,哪些步骤并行执行;
  • 什么时候使用确定性的代码,什么时候交给 LLM;
  • 怎样设计工作流或 Harness,以及失败后的兜底路径;
  • 模型可以调用哪些工具,包括 MCP、CLI 和沙箱执行环境;
  • 采用怎样的记忆架构;
  • 怎样管理长会话中的上下文;
  • 什么任务需要多 Agent 协作,什么任务用单 Agent 就够了。

把一个有潜力的原型变成可靠、安全、可以用于生产的 Agent,还需要理解防护栏、对抗性输入、数据外泄等关键风险,以及相应的治理方法。

Agent 工作流仍在快速发展。根据应用领域不同,语音 Agent、Computer Use Agent 和生成式 UI 等前沿技术,也可能成为需要掌握的能力。

评测驱动开发

根据我的经验,判断一个人是否真正擅长构建 AI 系统,最重要的标准,是他能否通过一套严谨的评测与错误分析循环来推动开发。

这样的循环能让团队持续把精力投入到更可能有效的方向上。但它并不容易掌握,因为正确方法会随着项目不同、甚至项目所处阶段不同而显著变化。

构建一套好的评测,本身就是一项有深度的技术能力。你可能需要检查系统的轨迹与输出、开展探索性数据分析,再结合产品与业务判断,决定真正应该测量什么。

同时,你还需要理解不同评测方法的适用场景:

  • 什么时候使用确定性的代码评测;
  • 什么时候使用 LLM-as-a-judge;
  • 什么时候必须让人参与判断;
  • 怎样评测评测本身,并持续改进它。

这些评测结果会继续进入下一轮开发,使产品进步变得系统化,而不是靠随机尝试碰运气。

生产环境运维

AI 软件的不可预测性、成本和延迟,让它的生产运维与传统软件有所不同。

首先,你需要建立可观测机制,理解系统在真实使用中的表现:持续追踪性能、发现漂移,并在模型故障或对抗性提示注入等安全事件出现时快速响应。

回归测试和 CI/CD 也需要比传统软件包含更多统计评测,而且测试投入应该与错误可能带来的风险相匹配。

此外,当应用拥有大量用户时,成本和延迟会成为核心工程问题。你需要从模型选择优化、蒸馏、微调和简化 Agent 工作流等方法中,挑选合适的组合,在效果、成本与响应速度之间取得平衡。

机器学习基础

现代 LLM 建立在监督学习、强化学习等机器学习技术之上。我认识的优秀 LLM 工程师,通常也在不同程度上理解机器学习与深度学习。

很多应用仍然需要传统机器学习能力:你可能使用别人训练的模型,也可能自行训练模型。这要求你了解常见的机器学习与深度学习模型,理解它们在准确率、训练速度和推理速度等方面的取舍,并知道怎样准备训练和评测所需的数据。

偏差与方差、错误分析和数据工程等机器学习概念,依然是处理不确定输出系统时非常重要的思维框架,也会影响 AI 系统开发中的大量决策。

结语

要真正擅长构建和部署 AI 系统,需要学习的内容很多,这也是一个技术深度很高的领域。

但每多掌握一部分,你都会成为更好的 AI 工程师,也更有能力做出令人兴奋的应用。与这些能力相互补充的另一块重要基础,是软件工程;Andrew Ng 表示会在后续文章中继续展开。

COMMUNITY NOTES · 讨论

讨论与补充

评论将在接近此处时加载。

    本文目录

    ⌘K搜索知识库

    最近收录

    正在载入知识索引…