Files
wiki/简历AI技术讲解.md
zdh c677393d08
Deploy Wiki to Production / deploy (push) Has been cancelled
feat: 入库 17 个新报告页
- 银行业Agent建设方案/报告/ 4 篇:建设方案 · 智能中台 · 意图识别 · 合规风险
- 研发型企业AI转型方案/报告/ 9 篇:角色矩阵(交互版) · 培训1-6课 · 角色矩阵 · 实操培训 · 培训路线图
- AI Agent 驾驭工程/报告/ 1 篇:Harness Engineering 全面解析
- 简历AI技术讲解.html + .md
- Dify部署分析报告.html
2026-06-20 22:38:20 +08:00

301 lines
13 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 张德海简历中 AI 相关技术讲解
以下按简历中出现的 AI 技术领域,逐一进行深入讲解。
---
## 1. Agent 智能体
### 是什么
Agent(智能体)是能够**自主感知环境、制定计划、调用工具、执行多步任务**的 AI 程序。与传统的"一问一答"式聊天机器人不同,Agent 具备**自主决策能力**——它会在执行过程中自我反思、调整策略,遇到错误时自动重试或换方案。
### 核心架构
```
用户输入 → Agent 大脑(LLM) → 思考(Reasoning) → 选择工具(Tool Selection) → 执行(Action) → 观察结果(Observation) → 继续思考或输出最终答案
```
这是一个**ReActReasoning + Acting)循环**Agent 在这个循环中反复迭代,直到完成任务或达到终止条件。
### 简历中的对应实践
- **自主决策 Agent**:让 LLM 不只是回答问题,而是像一个员工一样去完成一件完整的任务(例如"帮我分析上季度供热能耗异常并出报告")
- **多 Agent 协作**:多个 Agent 像团队一样分工——一个负责任务拆解与分发,多个执行 Agent 并行工作,再由汇总 Agent 整合结果。冲突仲裁机制解决多个 Agent 结论不一致的问题
- **Function Calling / Tool Use**Agent 通过调用外部 API/工具来与真实世界交互——查数据库、发邮件、调摄像头、控制设备
- **上下文管理与会话记忆**:维护长对话的上下文窗口,通过摘要、压缩、向量记忆等技术让 Agent 记住之前的交互
- **安全护栏(Guardrails**:限制 Agent 的行为边界——不能删除生产数据、不能发送未经审核的外部邮件、预算上限控制等
---
## 2. Skills 编排系统
### 是什么
Skills 编排是将**业务能力封装为独立的、可插拔的"技能模块"**,由 LLM 根据用户意图**自动路由**到对应的 Skill 去执行。
### 与 Agent 的关系
```
Agent 智能体(大脑/决策层)
├── Skill 1: 数据查询(查 MySQL/时序库)
├── Skill 2: 报表生成(生成 PDF/Excel
├── Skill 3: 消息推送(企业微信/邮件/短信)
├── Skill 4: 审批流程(调用 OA 接口)
├── Skill 5: 视频分析(调用 YOLO 模型)
└── Skill 6: 能耗预测(调 ML 模型)
```
Agent 负责**理解意图 + 决策调度**,Skills 负责**具体执行**。
### 简历中的对应实践
- **可插拔 Skills 框架**:新业务能力以 Skill 插件形式注册,支持热加载——不停机就能上线新能力
- **LLM 自动路由与编排**:用户说"查一下天津项目上个月的能耗情况",Agent 自动识别需要调用"数据查询 Skill"→"能耗预测 Skill"→"报表生成 Skill",并按正确顺序编排执行
- **行业定制 Skill**:医疗 DRGs(疾病诊断相关分组)分析、供热能耗预测等垂直领域 Skill
---
## 3. RAG 知识库(检索增强生成)
### 是什么
RAGRetrieval-Augmented Generation)是让 LLM **先检索相关文档,再基于检索结果生成回答**的技术。它解决了 LLM 的两大痛点:
- **知识截止日期**:模型训练数据有截止时间,不知道最新信息
- **幻觉问题**:没有知识支撑时容易编造,RAG 让回答有据可查
### 完整 Pipeline
```
文档摄入 → 解析(PDF/Word/HTML) → 文本分块(Chunking) → Embedding向量化 → 存入向量数据库
用户提问 → Embedding向量化 → 向量相似度检索 → 召回Top-K相关文档块 → 拼入Prompt → LLM生成回答
```
### 简历中的对应实践
- **向量数据库**
- **Milvus**:开源分布式向量数据库,适合大规模生产环境,支持十亿级向量检索
- **Chroma**:轻量级向量数据库,适合原型开发和小规模场景
- **FAISS**:Meta 开源的向量相似度搜索库,纯算法层面,GPU 加速
- **混合检索(Hybrid Search**:同时使用**语义检索**(向量相似度)+ **关键词检索**BM25/Elasticsearch+ **元数据过滤**(按日期、分类、来源筛选),取长补短,提升召回精度
- **实际场景**
- **制度问答**:员工问"年假怎么算",RAG 从公司制度文档中检索→给出准确条款
- **民政 AI 客服**:市民问低保申请条件,从民政知识库检索婚姻/低保/养老/残疾/殡葬政策
- **合同审查**:上传合同→检索相关法规和先例条款→AI 标注风险项
- **辅助诊断**:输入病症描述→检索相似病例和诊疗指南→辅助医生决策
---
## 4. Function Calling / Tool Use
### 是什么
让 LLM **输出结构化的函数调用请求**,而不是自然语言,从而实现与外部系统的精确对接。
### 工作原理
```
用户: "帮我查一下张三的社保缴纳记录"
LLM 输出(JSON格式):
{
"function": "query_social_security",
"parameters": {
"name": "张三",
"date_range": "2024-01-01~2024-12-31"
}
}
业务系统执行 → 返回结构化结果 → LLM 用自然语言呈现给用户
```
### 与传统 API 调用的区别
传统方式是"if-else 意图识别 + 槽位填充",覆盖有限。Function Calling 让 LLM 自主决定**要不要调函数、调哪个函数、用什么参数**,灵活度大幅提升。
---
## 5. Prompt Engineering
### 是什么
**提示工程**——设计、优化和管理 LLM 的输入提示,以引导模型产出期望的输出。这是一个**工程化**的过程,不是简单的"写好提示词"。
### 关键技术
| 技术 | 说明 |
|------|------|
| **Few-shot Prompting** | 在 Prompt 中给出几个示例,让模型学会输出格式和风格 |
| **Chain-of-Thought** | 要求模型"一步步思考",显著提升推理任务准确率 |
| **System Prompt 设计** | 设定角色、行为约束、输出格式等系统级指令 |
| **Prompt 模板化** | 类似代码模板,变量替换 + 条件分支,工程化管理 |
| **Prompt 优化与 A/B 测试** | 不同 Prompt 效果对比,迭代优化 |
| **Token 预算控制** | 平衡上下文长度与成本,摘要压缩、动态裁剪 |
---
## 6. AI Coding 工具链
### Claude Code
Anthropic 出品的**终端原生 AI 编程助手**,运行在命令行环境中:
- 可以**直接读写文件、执行 Shell 命令、操作 Git**,不只是"建议代码"
- 支持 **Agent 模式**:给定任务自主规划步骤、执行、验证
- 支持 **MCP 协议**接入外部工具和数据源
- 支持 **Hooks** 机制在特定事件触发自定义逻辑
- 本项目(知识库 wiki)大量使用 Claude Code 进行开发
### GitHub Copilot
微软/GitHub 的 AI 编程助手,深度集成在 IDEVS Code / JetBrains)中:
- **代码补全**:根据上下文实时建议下一行/下一段代码
- **Chat 面板**:在 IDE 内对话式编程
- **Agent 模式**Copilot 自主规划多文件编辑、运行终端命令
- **代码审查**PR 级别的 AI Review
### Cursor
基于 VS Code 深度定制的 AI-first IDE
- **全文件上下文感知**:不只是当前文件,而是整个项目
- **Composer**:多文件协同编辑
- **Apply 模式**:AI 提出的修改可直接应用到代码
- **Rules 系统**:项目级/用户级行为约束
### Windsurf
Codeium 出品的 AI IDE(原 Windsurf Editor):
- **Cascade**:流式 AI 交互,边生成边应用
- 强调**实时协作**和**上下文保持**
### Aider
开源命令行 AI 编程工具:
- **Git 原生**:每次修改自动 commit,形成干净的变更历史
- **多模型支持**:可对接 OpenAI、Anthropic、本地模型
- **地图文件(Map)**:生成仓库结构图帮助 LLM 理解项目
- **多文件编辑**:一次对话可修改多个文件
### AI 代码审查 & 自动测试生成
- **AI Code Review**:在 PR/MR 阶段由 AI 自动审查代码质量、安全漏洞、性能问题
- **自动测试生成**:AI 分析代码逻辑自动生成单元测试、集成测试用例,提升覆盖率
---
## 7. AI 视觉(计算机视觉)
### YOLOYou Only Look Once
实时目标检测算法,核心特点:
- **单次推理**:一次前向传播同时完成目标定位 + 分类,速度极快
- **版本迭代**YOLOv5 → YOLOv8 → YOLOv10/YOLO11,精度和速度持续提升
- **实际场景**:视频监控中的人/车/物检测、安防异常行为识别
### 简历中的应用
- **视频智能识别**:对接 GB/T 28181 国标视频流,实时分析监控画面
- **自定义模型训练部署**:针对特定场景(如供热站仪表读数、工地安全帽检测)训练专属模型
- **视频融合平台**:国标视频接入 + AI 识别叠加,形成智能安防方案
---
## 8. LangChain
### 是什么
LangChain 是 LLM 应用开发框架,提供标准化的**链(Chain**、**Agent**、**工具(Tool**、**记忆(Memory**、**检索器(Retriever**等抽象。
### 核心组件
```python
# LangChain 的核心抽象
from langchain.chains import LLMChain
from langchain.agents import AgentExecutor, create_react_agent
from langchain.tools import Tool
from langchain.memory import ConversationBufferMemory
from langchain.vectorstores import Milvus
# Chain: 将多个步骤串联
chain = prompt | llm | output_parser
# Agent + Tools: 让 LLM 学会用工具
agent = create_react_agent(llm, tools, prompt)
agent_executor = AgentExecutor(agent=agent, tools=tools)
```
作为框架,它统一了不同 LLM 提供商(OpenAI/Anthropic/本地模型)的接口,简化了 RAG、Agent 等模式的实现。
---
## 9. MCP 协议(Model Context Protocol
### 是什么
Anthropic 推出的**开放标准协议**,定义了 AI 模型与外部工具/数据源之间的统一通信方式。可以理解为"AI 世界的 USB-C 接口"。
### 架构
```
AI 应用(Host
↓ MCP 协议
MCP 客户端(Claude Code / Cursor 等)
↓ JSON-RPC over stdio/SSE
MCP 服务器(工具提供方)
├── 数据库 MCP Server → PostgreSQL / MySQL
├── 文件系统 MCP Server → 本地文件
├── API MCP Server → GitHub / Jira / Slack
└── 自定义 MCP Server → 企业内部系统
```
### 意义
在 MCP 之前,每个 AI 工具都要单独对接每个外部系统(M×N 的集成复杂度)。MCP 标准化后,工具只需实现一次 MCP Server,所有支持 MCP 的 AI 应用都能使用(M+N 的复杂度)。
---
## 技术组合全景
简历中的 AI 能力不是孤立的,它们在实际项目中形成一条完整链路:
```
┌─────────────────────────────────────────────────────┐
│ 应用层(场景) │
│ 智能客服 │ 制度问答 │ 合同审查 │ 能耗预测 │ 视频安防 │
└─────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────┐
│ Agent 智能体层(决策) │
│ 意图识别 → 任务规划 → Skills路由 → 多Agent协作 │
│ Function Calling / Tool Use │
└─────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────┐
│ Skills 编排层(执行) │
│ 数据查询 │ 报表生成 │ 消息推送 │ 审批流 │ 视频分析 │
└─────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────┐
│ 知识/数据层(支撑) │
│ RAG知识库(Milvus/Chroma) │ 向量检索 │ 混合检索 │
│ 时序数据库 │ 业务数据库 │ 文档Pipeline │
└─────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────┐
│ 基础设施层 │
│ LLM API │ Prompt Engineering │ LangChain │
│ AI Coding工具链 │ MCP协议 │ 模型训练/部署 │
└─────────────────────────────────────────────────────┘
```
这套体系的核心思路是:**让 AI 不只是"聊天",而是真正能干活——查数据、调系统、出报告、审合同、看监控**。这也正是简历中反复强调的"AI 应用落地"的含义。