Skip to content
Agent使用水平分级

Agent使用水平分级

2026年6月17日·
Andre Pan

现在横轴扩展为 12个维度。以下是完整的能力矩阵:


编码智能体操作者能力矩阵(L1-L5 × 12维度)

维度 L1 基础使用 L2 进阶使用 L3 高阶使用 L4 自治管理 L5 团队协调
D1 Prompt与需求表达 能描述单步任务,给出简单输入输出示例 能写出包含约束、边界条件、验收标准的结构化Prompt 能编写多阶段任务的Prompt,包含依赖与回退逻辑 能设计长期任务的初始指令,包含目标、成功标准、异常处理策略 能指导团队的prompt编写。给出prompt规范。能编写多智能体协作的全局规则和角色指令
D2 上下文管理,memory @文件或粘贴代码片段。 了解上下文的重要性和基本组成。 了解初步的memory 能筛选相关文件,排除无关内容,控制上下文窗口不溢出理解claude.md的高效使用 能按阶段注入上下文(设计→实现→测试),主动清理无用信息 能配置长期上下文(项目架构、历史决策),让智能体自动检索 能为不同智能体隔离上下文,设计共享状态区
会设置claude.md或agents.md项目级简单指令 会使用AGENTS.mdCLAUDE.md等结构化规则文件 能根据不同任务切换多套Rules,利用Memory记录常见模式 能配置向量记忆,让智能体跨会话记住设计决策和失败经验 能设计团队共享知识库,管理Rules版本和冲突
D4 工具 知道智能体可以用哪些内置工具(读文件、搜索、终端)。最常用的终端内命令/命令 能配置MCP Server连接本地数据库、API、文档系统 能组合多个工具完成复杂工作流(查日志→定位代码→改代码→测试) 能创建自定义工具(脚本、API包装),供智能体调用 能设计智能体团队的工具权限矩阵,防止资源竞争
D5 权限、Hook与安全边界 知道运行命令前需人工确认 能配置文件/网络白名单、设置敏感操作审批Hook 能按任务类型设置不同安全策略(开发环境宽松/生产环境严格) 能设置自动熔断和审计日志,处理异常权限请求 能为多智能体团队设计分层权限和审批流程
D6 测试、验证与质量闭环 能让智能体为函数写单元测试 能让智能体运行测试并解释失败原因 能实践TDD:先写测试→写实现→重构;能生成可审查的diff 能设置自动修复循环:测试失败→智能体修复→再测 能设计多智能体交叉验证(写代码的与写测试的分离),设置质量门禁
D7 任务拆解与流程编排 只能给出单一指令 能将中等任务拆成3-5个有序步骤 能将PRD/重构目标拆解为阶段、任务、依赖关系,并让智能体按序执行 能设计自治任务的检查点和恢复机制,处理执行中的异常 能为多智能体团队设计DAG任务流,设置并行和串行节点
D8 Subagent/多智能体管理 不了解或不使用Subagent 能启动单一Subagent(如代码审查)并回收结果 能设计并同时协调2-3个Subagent,分工协作(前端/后端/测试)。以实现Longterm工作 能设计Subagent间的任务移交和结果汇总机制 能设计完整的多智能体团队:角色定义、通信协议、冲突裁决、合并策略
D9 工程判断、风险与治理 能判断简单输出是否合理(如语法正确) 能识别潜在风险(如删除文件、覆盖配置) 能评估智能体输出的可维护性、性能影响、安全漏洞 能审计智能体的决策链条,判断是否偏离目标,及时干预 能制定团队级别的智能体使用规范、成本预算、回滚策略
D10 Debug与故障排查 能发现智能体输出明显错误并重新提问 能查看执行日志,定位是工具调用失败还是模型理解错误 能分析智能体陷入循环的原因,调整Prompt或上下文中断循环 能通过Memory回溯智能体之前的决策,找到长期任务失败根因 能调试多智能体间的通信死锁、状态不同步、资源竞争
D11 成本与效率意识 不需要关注 能估算单次任务的Token消耗。设置statusline显示token消耗 能通过优化Prompt和工具调用减少浪费,选择合适模型。​ 能设置成本预算和告警,分析长期任务的成本效率 能为多智能体团队设计成本分配和优化策略(如缓存、模型降级)
D12 Skill管理 能使用内置Skill(如文档生成、格式化) 能安装、配置第三方Skill,理解Skill的输入输出接口 能组合多个Skill完成复杂能力(数据提取→分析→报告) 能根据需求编写复杂的自定义Skill,通过skill引导,:编排完成复杂的流程。 能为团队建立Skill仓库,制定Skill开发规范和共享机制

补充说明:各维度的递进逻辑

  • D1-D3:从“单次对话”到“结构化指令”再到“长期记忆与知识库”
  • D4-D5:从“知道有工具”到“配置安全边界”再到“自定义扩展”
  • D6-D8:从“写测试”到“TDD流程”再到“多角色协作”
  • D9-D11:从“看结果”到“判断质量”再到“治理成本与风险”
  • D12:从“会用Skill”到“会配会写”再到“团队共享”

使用建议

  1. 评估个人水平:逐维度对照,取最低等级作为综合等级(短板决定上限)
  2. 团队能力模型:可设置目标等级(如全员L2+,核心工程师L3+)
  3. 招聘JD:针对岗位要求,标明需要的维度和等级(如“需要D4工具与MCP达到L3以上”)

如果需要进一步调整维度数量、重新排序,或生成对应的面试题/自测题,随时告诉我。