AI Agent 工程师核心技能全景
做 AI Agent 开发,光会调 API 是不够的。这篇文章梳理了三个核心工程方向的定义,以及完整的技能优先级排序。
三个核心工程方向
提示词工程(Prompt Engineering)
控制模型"怎么想"。
- 设计 system prompt、few-shot 示例、输出格式约束
- 让模型稳定输出结构化结果(JSON、特定格式)
- 处理边界情况、防止越狱和幻觉
这是基础,必须掌握。
上下文工程(Context Engineering)
控制模型"看到什么"。
- 决定哪些信息放进 context window(RAG 检索、记忆压缩、历史裁剪)
- 管理 token 预算,避免超出限制
- 动态组装 prompt(工具结果、用户历史、外部知识)
做复杂 Agent 必须掌握,直接影响效果和成本。
Harness 工程(Harness Engineering)
控制模型"跑在什么环境里"。
- 构建评测框架:自动化测试 Agent 的行为是否符合预期
- 定义 benchmark、golden dataset、评分标准
- 持续回归测试,防止 prompt 改动引入退化
生产级 Agent 必须有,没有它你不知道改动是好是坏。
三者关系:提示词决定质量上限,上下文决定信息质量,Harness 保证你能持续迭代而不翻车。
核心技能优先级排序
第一层:必须掌握(地基)
- LLM 基础理解 — token、temperature、context window、模型能力边界
- 提示词工程 — system prompt 设计、few-shot、输出格式控制、防幻觉
- 工具/函数调用设计 — tool schema 定义、参数设计、让模型准确选择和调用工具
- 上下文工程 — RAG、记忆管理、token 预算控制、动态 prompt 组装
- 基础编程能力 — Python 为主,异步编程、API 调用、数据处理
第二层:核心工程能力(生产级必须有)
- Harness/评测工程 — 自动化测试、benchmark、回归测试
- 多 Agent 编排 — 任务拆解、Agent 间协作、状态机、循环检测
- 可观测性 — Tracing、日志、成本监控(LangSmith、Langfuse 等)
- 错误恢复设计 — 重试策略、降级、超时处理、幂等性
- 记忆系统 — 短期/长期记忆、向量数据库、检索策略
第三层:进阶能力(做好产品需要)
- 安全与对齐 — Prompt injection 防御、输出过滤、权限边界
- 延迟与成本优化 — 模型选型、缓存、并发、流式输出
- 主流框架使用 — LangChain/LangGraph、AutoGen、CrewAI、Pydantic AI 等
- 向量数据库 — Pinecone、Weaviate、pgvector,RAG 的基础设施
- 部署与基础设施 — 容器化、API 服务、队列系统
第四层:加分项(拉开差距用)
- Fine-tuning 基础 — 知道什么时候该微调而不是堆 prompt
- 多模态处理 — 图像、语音、文档解析
- 产品思维 — 知道 Agent 该解决什么问题,而不只是技术实现
- 数据飞轮意识 — 用生产数据持续改进模型和 prompt
常见误区
很多人卡在第二层(6-10):能跑 demo,但上不了生产线。原因通常是:
- 没有评测体系,改了 prompt 不知道是好是坏
- 没有可观测性,出问题无法定位
- 没有错误恢复,Agent 一失败就卡死
第一层是地基,第二层决定能不能上线,第三层以后决定产品质量和竞争力。