- 银行业Agent建设方案/报告/ 4 篇:建设方案 · 智能中台 · 意图识别 · 合规风险 - 研发型企业AI转型方案/报告/ 9 篇:角色矩阵(交互版) · 培训1-6课 · 角色矩阵 · 实操培训 · 培训路线图 - AI Agent 驾驭工程/报告/ 1 篇:Harness Engineering 全面解析 - 简历AI技术讲解.html + .md - Dify部署分析报告.html
13 KiB
张德海简历中 AI 相关技术讲解
以下按简历中出现的 AI 技术领域,逐一进行深入讲解。
1. Agent 智能体
是什么
Agent(智能体)是能够自主感知环境、制定计划、调用工具、执行多步任务的 AI 程序。与传统的"一问一答"式聊天机器人不同,Agent 具备自主决策能力——它会在执行过程中自我反思、调整策略,遇到错误时自动重试或换方案。
核心架构
用户输入 → Agent 大脑(LLM) → 思考(Reasoning) → 选择工具(Tool Selection) → 执行(Action) → 观察结果(Observation) → 继续思考或输出最终答案
这是一个ReAct(Reasoning + Acting)循环,Agent 在这个循环中反复迭代,直到完成任务或达到终止条件。
简历中的对应实践
- 自主决策 Agent:让 LLM 不只是回答问题,而是像一个员工一样去完成一件完整的任务(例如"帮我分析上季度供热能耗异常并出报告")
- 多 Agent 协作:多个 Agent 像团队一样分工——一个负责任务拆解与分发,多个执行 Agent 并行工作,再由汇总 Agent 整合结果。冲突仲裁机制解决多个 Agent 结论不一致的问题
- Function Calling / Tool Use:Agent 通过调用外部 API/工具来与真实世界交互——查数据库、发邮件、调摄像头、控制设备
- 上下文管理与会话记忆:维护长对话的上下文窗口,通过摘要、压缩、向量记忆等技术让 Agent 记住之前的交互
- 安全护栏(Guardrails):限制 Agent 的行为边界——不能删除生产数据、不能发送未经审核的外部邮件、预算上限控制等
2. Skills 编排系统
是什么
Skills 编排是将业务能力封装为独立的、可插拔的"技能模块",由 LLM 根据用户意图自动路由到对应的 Skill 去执行。
与 Agent 的关系
Agent 智能体(大脑/决策层)
├── Skill 1: 数据查询(查 MySQL/时序库)
├── Skill 2: 报表生成(生成 PDF/Excel)
├── Skill 3: 消息推送(企业微信/邮件/短信)
├── Skill 4: 审批流程(调用 OA 接口)
├── Skill 5: 视频分析(调用 YOLO 模型)
└── Skill 6: 能耗预测(调 ML 模型)
Agent 负责理解意图 + 决策调度,Skills 负责具体执行。
简历中的对应实践
- 可插拔 Skills 框架:新业务能力以 Skill 插件形式注册,支持热加载——不停机就能上线新能力
- LLM 自动路由与编排:用户说"查一下天津项目上个月的能耗情况",Agent 自动识别需要调用"数据查询 Skill"→"能耗预测 Skill"→"报表生成 Skill",并按正确顺序编排执行
- 行业定制 Skill:医疗 DRGs(疾病诊断相关分组)分析、供热能耗预测等垂直领域 Skill
3. RAG 知识库(检索增强生成)
是什么
RAG(Retrieval-Augmented Generation)是让 LLM 先检索相关文档,再基于检索结果生成回答的技术。它解决了 LLM 的两大痛点:
- 知识截止日期:模型训练数据有截止时间,不知道最新信息
- 幻觉问题:没有知识支撑时容易编造,RAG 让回答有据可查
完整 Pipeline
文档摄入 → 解析(PDF/Word/HTML) → 文本分块(Chunking) → Embedding向量化 → 存入向量数据库
↓
用户提问 → Embedding向量化 → 向量相似度检索 → 召回Top-K相关文档块 → 拼入Prompt → LLM生成回答
简历中的对应实践
-
向量数据库:
- Milvus:开源分布式向量数据库,适合大规模生产环境,支持十亿级向量检索
- Chroma:轻量级向量数据库,适合原型开发和小规模场景
- FAISS:Meta 开源的向量相似度搜索库,纯算法层面,GPU 加速
-
混合检索(Hybrid Search):同时使用语义检索(向量相似度)+ 关键词检索(BM25/Elasticsearch)+ 元数据过滤(按日期、分类、来源筛选),取长补短,提升召回精度
-
实际场景:
- 制度问答:员工问"年假怎么算",RAG 从公司制度文档中检索→给出准确条款
- 民政 AI 客服:市民问低保申请条件,从民政知识库检索婚姻/低保/养老/残疾/殡葬政策
- 合同审查:上传合同→检索相关法规和先例条款→AI 标注风险项
- 辅助诊断:输入病症描述→检索相似病例和诊疗指南→辅助医生决策
4. Function Calling / Tool Use
是什么
让 LLM 输出结构化的函数调用请求,而不是自然语言,从而实现与外部系统的精确对接。
工作原理
用户: "帮我查一下张三的社保缴纳记录"
↓
LLM 输出(JSON格式):
{
"function": "query_social_security",
"parameters": {
"name": "张三",
"date_range": "2024-01-01~2024-12-31"
}
}
↓
业务系统执行 → 返回结构化结果 → LLM 用自然语言呈现给用户
与传统 API 调用的区别
传统方式是"if-else 意图识别 + 槽位填充",覆盖有限。Function Calling 让 LLM 自主决定要不要调函数、调哪个函数、用什么参数,灵活度大幅提升。
5. Prompt Engineering
是什么
提示工程——设计、优化和管理 LLM 的输入提示,以引导模型产出期望的输出。这是一个工程化的过程,不是简单的"写好提示词"。
关键技术
| 技术 | 说明 |
|---|---|
| Few-shot Prompting | 在 Prompt 中给出几个示例,让模型学会输出格式和风格 |
| Chain-of-Thought | 要求模型"一步步思考",显著提升推理任务准确率 |
| System Prompt 设计 | 设定角色、行为约束、输出格式等系统级指令 |
| Prompt 模板化 | 类似代码模板,变量替换 + 条件分支,工程化管理 |
| Prompt 优化与 A/B 测试 | 不同 Prompt 效果对比,迭代优化 |
| Token 预算控制 | 平衡上下文长度与成本,摘要压缩、动态裁剪 |
6. AI Coding 工具链
Claude Code
Anthropic 出品的终端原生 AI 编程助手,运行在命令行环境中:
- 可以直接读写文件、执行 Shell 命令、操作 Git,不只是"建议代码"
- 支持 Agent 模式:给定任务自主规划步骤、执行、验证
- 支持 MCP 协议接入外部工具和数据源
- 支持 Hooks 机制在特定事件触发自定义逻辑
- 本项目(知识库 wiki)大量使用 Claude Code 进行开发
GitHub Copilot
微软/GitHub 的 AI 编程助手,深度集成在 IDE(VS Code / JetBrains)中:
- 代码补全:根据上下文实时建议下一行/下一段代码
- Chat 面板:在 IDE 内对话式编程
- Agent 模式:Copilot 自主规划多文件编辑、运行终端命令
- 代码审查:PR 级别的 AI Review
Cursor
基于 VS Code 深度定制的 AI-first IDE:
- 全文件上下文感知:不只是当前文件,而是整个项目
- Composer:多文件协同编辑
- Apply 模式:AI 提出的修改可直接应用到代码
- Rules 系统:项目级/用户级行为约束
Windsurf
Codeium 出品的 AI IDE(原 Windsurf Editor):
- Cascade:流式 AI 交互,边生成边应用
- 强调实时协作和上下文保持
Aider
开源命令行 AI 编程工具:
- Git 原生:每次修改自动 commit,形成干净的变更历史
- 多模型支持:可对接 OpenAI、Anthropic、本地模型
- 地图文件(Map):生成仓库结构图帮助 LLM 理解项目
- 多文件编辑:一次对话可修改多个文件
AI 代码审查 & 自动测试生成
- AI Code Review:在 PR/MR 阶段由 AI 自动审查代码质量、安全漏洞、性能问题
- 自动测试生成:AI 分析代码逻辑自动生成单元测试、集成测试用例,提升覆盖率
7. AI 视觉(计算机视觉)
YOLO(You Only Look Once)
实时目标检测算法,核心特点:
- 单次推理:一次前向传播同时完成目标定位 + 分类,速度极快
- 版本迭代:YOLOv5 → YOLOv8 → YOLOv10/YOLO11,精度和速度持续提升
- 实际场景:视频监控中的人/车/物检测、安防异常行为识别
简历中的应用
- 视频智能识别:对接 GB/T 28181 国标视频流,实时分析监控画面
- 自定义模型训练部署:针对特定场景(如供热站仪表读数、工地安全帽检测)训练专属模型
- 视频融合平台:国标视频接入 + AI 识别叠加,形成智能安防方案
8. LangChain
是什么
LangChain 是 LLM 应用开发框架,提供标准化的链(Chain)、Agent、工具(Tool)、记忆(Memory)、**检索器(Retriever)**等抽象。
核心组件
# LangChain 的核心抽象
from langchain.chains import LLMChain
from langchain.agents import AgentExecutor, create_react_agent
from langchain.tools import Tool
from langchain.memory import ConversationBufferMemory
from langchain.vectorstores import Milvus
# Chain: 将多个步骤串联
chain = prompt | llm | output_parser
# Agent + Tools: 让 LLM 学会用工具
agent = create_react_agent(llm, tools, prompt)
agent_executor = AgentExecutor(agent=agent, tools=tools)
作为框架,它统一了不同 LLM 提供商(OpenAI/Anthropic/本地模型)的接口,简化了 RAG、Agent 等模式的实现。
9. MCP 协议(Model Context Protocol)
是什么
Anthropic 推出的开放标准协议,定义了 AI 模型与外部工具/数据源之间的统一通信方式。可以理解为"AI 世界的 USB-C 接口"。
架构
AI 应用(Host)
↓ MCP 协议
MCP 客户端(Claude Code / Cursor 等)
↓ JSON-RPC over stdio/SSE
MCP 服务器(工具提供方)
├── 数据库 MCP Server → PostgreSQL / MySQL
├── 文件系统 MCP Server → 本地文件
├── API MCP Server → GitHub / Jira / Slack
└── 自定义 MCP Server → 企业内部系统
意义
在 MCP 之前,每个 AI 工具都要单独对接每个外部系统(M×N 的集成复杂度)。MCP 标准化后,工具只需实现一次 MCP Server,所有支持 MCP 的 AI 应用都能使用(M+N 的复杂度)。
技术组合全景
简历中的 AI 能力不是孤立的,它们在实际项目中形成一条完整链路:
┌─────────────────────────────────────────────────────┐
│ 应用层(场景) │
│ 智能客服 │ 制度问答 │ 合同审查 │ 能耗预测 │ 视频安防 │
└─────────────────────────────────────────────────────┘
↑
┌─────────────────────────────────────────────────────┐
│ Agent 智能体层(决策) │
│ 意图识别 → 任务规划 → Skills路由 → 多Agent协作 │
│ Function Calling / Tool Use │
└─────────────────────────────────────────────────────┘
↑
┌─────────────────────────────────────────────────────┐
│ Skills 编排层(执行) │
│ 数据查询 │ 报表生成 │ 消息推送 │ 审批流 │ 视频分析 │
└─────────────────────────────────────────────────────┘
↑
┌─────────────────────────────────────────────────────┐
│ 知识/数据层(支撑) │
│ RAG知识库(Milvus/Chroma) │ 向量检索 │ 混合检索 │
│ 时序数据库 │ 业务数据库 │ 文档Pipeline │
└─────────────────────────────────────────────────────┘
↑
┌─────────────────────────────────────────────────────┐
│ 基础设施层 │
│ LLM API │ Prompt Engineering │ LangChain │
│ AI Coding工具链 │ MCP协议 │ 模型训练/部署 │
└─────────────────────────────────────────────────────┘
这套体系的核心思路是:让 AI 不只是"聊天",而是真正能干活——查数据、调系统、出报告、审合同、看监控。这也正是简历中反复强调的"AI 应用落地"的含义。