AI Agent 工程师核心技能全景

做 AI Agent 开发,光会调 API 是不够的。这篇文章梳理了三个核心工程方向的定义,以及完整的技能优先级排序。

三个核心工程方向

提示词工程(Prompt Engineering)

控制模型"怎么想"。

  • 设计 system prompt、few-shot 示例、输出格式约束
  • 让模型稳定输出结构化结果(JSON、特定格式)
  • 处理边界情况、防止越狱和幻觉

这是基础,必须掌握。

上下文工程(Context Engineering)

控制模型"看到什么"。

  • 决定哪些信息放进 context window(RAG 检索、记忆压缩、历史裁剪)
  • 管理 token 预算,避免超出限制
  • 动态组装 prompt(工具结果、用户历史、外部知识)

做复杂 Agent 必须掌握,直接影响效果和成本。

Harness 工程(Harness Engineering)

控制模型"跑在什么环境里"。

  • 构建评测框架:自动化测试 Agent 的行为是否符合预期
  • 定义 benchmark、golden dataset、评分标准
  • 持续回归测试,防止 prompt 改动引入退化

生产级 Agent 必须有,没有它你不知道改动是好是坏。


三者关系:提示词决定质量上限,上下文决定信息质量,Harness 保证你能持续迭代而不翻车。

核心技能优先级排序

第一层:必须掌握(地基)

  1. LLM 基础理解 — token、temperature、context window、模型能力边界
  2. 提示词工程 — system prompt 设计、few-shot、输出格式控制、防幻觉
  3. 工具/函数调用设计 — tool schema 定义、参数设计、让模型准确选择和调用工具
  4. 上下文工程 — RAG、记忆管理、token 预算控制、动态 prompt 组装
  5. 基础编程能力 — Python 为主,异步编程、API 调用、数据处理

第二层:核心工程能力(生产级必须有)

  1. Harness/评测工程 — 自动化测试、benchmark、回归测试
  2. 多 Agent 编排 — 任务拆解、Agent 间协作、状态机、循环检测
  3. 可观测性 — Tracing、日志、成本监控(LangSmith、Langfuse 等)
  4. 错误恢复设计 — 重试策略、降级、超时处理、幂等性
  5. 记忆系统 — 短期/长期记忆、向量数据库、检索策略

第三层:进阶能力(做好产品需要)

  1. 安全与对齐 — Prompt injection 防御、输出过滤、权限边界
  2. 延迟与成本优化 — 模型选型、缓存、并发、流式输出
  3. 主流框架使用 — LangChain/LangGraph、AutoGen、CrewAI、Pydantic AI 等
  4. 向量数据库 — Pinecone、Weaviate、pgvector,RAG 的基础设施
  5. 部署与基础设施 — 容器化、API 服务、队列系统

第四层:加分项(拉开差距用)

  1. Fine-tuning 基础 — 知道什么时候该微调而不是堆 prompt
  2. 多模态处理 — 图像、语音、文档解析
  3. 产品思维 — 知道 Agent 该解决什么问题,而不只是技术实现
  4. 数据飞轮意识 — 用生产数据持续改进模型和 prompt

常见误区

很多人卡在第二层(6-10):能跑 demo,但上不了生产线。原因通常是:

  • 没有评测体系,改了 prompt 不知道是好是坏
  • 没有可观测性,出问题无法定位
  • 没有错误恢复,Agent 一失败就卡死

第一层是地基,第二层决定能不能上线,第三层以后决定产品质量和竞争力。