← 返回知识库

AI 核心技能原理说明

系统梳理大模型应用开发的关键技术原理,涵盖从基础模型到上层应用的完整技术栈。

LLM 基础Prompt EngineeringAgent 架构 Skills 编排RAG 知识库AI CodingYOLO 视觉

大语言模型(LLM)基础

核心原理

训练三阶段

  1. Pre-training(预训练):海量语料上做 Next Token Prediction,学习语言的统计规律和世界知识
  2. SFT(监督微调):用高质量指令-回答对训练,让模型学会"对话"
  3. RLHF(人类反馈强化学习):用人类偏好数据训练奖励模型,再用 PPO 优化,对齐人类价值观。解决"模型能力强但不一定听话"的对齐问题

关键概念

概念说明
Token模型处理的最小文本单元,中文约 1.5-2 字符/token
Context Window模型一次能处理的 token 上限(如 128K、200K)
Temperature控制输出随机性,0 = 确定性,1 = 高随机
Top-P / Top-K采样策略,限制候选 token 范围,平衡多样性与质量

主流模型对比

模型特点适用场景
GPT-4o多模态,综合能力最强复杂推理、多模态任务
Claude 4长上下文 200K,安全性高,代码能力强长文档分析、代码生成
DeepSeek-V3开源,MoE 架构,性价比极高国内部署、成本敏感场景
通义千问中文优化,阿里云生态深度集成政务、企业中文场景

Prompt Engineering

核心方法论

技术原理示例
Zero-shot不给示例,直接提问"将以下文本分类为正面/负面:..."
Few-shot给 2-5 个示例,模型学习输入输出模式示例 1 → 示例 2 → 新输入
CoT(思维链)要求模型"一步步思考",激活推理能力"让我们一步步分析:首先...其次..."
结构化输出约束输出格式(JSON / XML)"请以 JSON 格式返回,包含 name、age 字段"
Self-Consistency多次采样 + 投票,提升推理准确率同一问题跑 5 次,取多数答案

为什么 CoT 有效

Function Calling 原理

  1. 定义函数的 JSON Schema(函数名、参数、描述)
  2. 模型判断用户意图 → 返回函数名 + 结构化参数(而非自然语言)
  3. 应用层执行函数 → 结果回传模型 → 模型生成最终回复
  4. 本质:让模型"学会"输出结构化指令,模型不直接调用函数,而是输出参数由应用层执行

Agent 智能体

核心架构:ReAct 循环

用户输入 → Agent Core(LLM)
              │
              ├─ 规划(Plan)
              ├─ 调用工具(Tool Use)
              ├─ 观察结果(Observation)
              ├─ 反思调整(Reflection)
              └─ 循环直到目标达成 → 输出

关键设计模式

模式原理适用场景
ReActReasoning + Acting 交替:思考一步 → 执行一步 → 观察 → 再思考需要与外部交互的任务
Plan-and-Execute先生成完整计划,再逐步执行复杂多步任务
Multi-Agent多个 Agent 分工协作,各司其职跨领域复杂流程

多 Agent 协作

安全护栏(Guardrails)

Agent vs 普通 LLM 调用:Agent 的核心区别在于拥有自主规划 + 工具调用 + 循环决策能力,不是一次问答,而是多步自主完成任务。

Skills 编排系统

设计理念

将业务能力封装为标准化、可复用的 Skill 模块,由 LLM 根据用户意图自动选择并编排执行。

架构流程

用户输入
    ↓
意图识别(LLM)
    ↓
Skill 路由(语义匹配最相关的 Skill 组合)
    ↓
编排执行(串行 / 并行 / 条件分支)
    ↓
结果聚合 → 输出

Skill 定义规范

{
  "name": "report_generator",
  "description": "根据查询条件生成业务报表",
  "parameters": {
    "report_type": "销售报表 / 库存报表 / 财务报表",
    "date_range": "起止日期",
    "format": "PDF / Excel"
  },
  "auth_required": true
}

关键机制

机制说明
热加载Skill 注册/下线不重启系统,通过配置中心或数据库动态生效
自动路由LLM 用语义匹配(Embedding 相似度)找到最相关的 Skill
依赖解析Skill A 的输出可能是 Skill B 的输入,编排引擎自动处理依赖顺序
降级策略首选 Skill 不可用时,自动回退到备选方案或转人工
与 Function Calling 的关系:Skills 编排是更高层的抽象,一个 Skill 可能包含多个 Function Call。类比:Skills 编排 ≈ 微服务 + API 网关 + 服务编排,只是"路由规则"由 LLM 动态决定。

知识库(RAG)系统

为什么需要 RAG

核心流程

文档入库(离线):
  原始文档 → 解析 → 分块 → Embedding → 存入向量数据库

在线问答:
  用户提问 → Embedding → 向量检索(Top-K)→ 拼接 Prompt → LLM 生成 → 返回

分块策略(Chunking)

策略适用场景优缺点
固定长度通用场景实现简单但可能切断语义
语义分块长文档按段落/章节切分,语义完整
滑动窗口需要上下文相邻块有重叠,避免信息断裂

Embedding 模型选择

检索优化

技术说明
混合检索语义检索(向量)+ 关键词检索(BM25)加权融合,提升召回率
Rerank粗召回后用精排模型重排序,提升 Top-N 精度
元数据过滤按时间/分类/权限等结构化字段预过滤,缩小检索范围

AI Coding

主流工具原理

工具底层原理特点
Claude CodeClaude 模型 + 工具调用(文件读写/Shell/搜索),Agent 模式自主执行复杂任务拆解,长期上下文
GitHub CopilotCodex 模型,实时上下文(当前文件+相邻Tab+项目结构)补全IDE 深度集成,毫秒级响应
Cursor多模型支持,全文件上下文编辑,Composer 模式重构友好,Diff 预览
AiderCLI 工具,Git 集成,Map-Reduce 处理大代码库终端场景,可脚本化

三种工作模式

  1. 补全模式:根据光标上下文,实时续写代码(Copilot 类)
  2. 对话模式:自然语言描述需求 → AI 生成/修改代码(Cursor / Claude Code)
  3. Agent 模式:AI 自主规划 → 读写文件 → 执行命令 → 检查结果 → 迭代修复(Claude Code)

工程化实践

AI 视觉(YOLO)

核心思想

演进路线

版本关键改进年份
YOLOv5工程化最成熟,社区生态好2020
YOLOv8无锚框检测,多任务(检测/分割/姿态)统一框架2023
YOLOv10NMS-Free,端到端,效率进一步提升2024

训练部署流程

数据采集 → 标注(LabelImg / LabelStudio)→ 数据集划分(训练/验证/测试)
    → 数据增强(翻转/旋转/色彩抖动/Mosaic)
    → 模型训练(预训练权重微调)
    → 模型转换(ONNX / TensorRT)
    → 边缘/服务端部署

网络架构:Backbone + Neck + Head

组件作用YOLOv8 示例
Backbone特征提取网络,从原始图像中提取多尺度特征图CSPDarknet + C2f 模块(跨阶段局部网络,提升梯度流动)
Neck特征融合层,将不同尺度的特征图进行融合,增强多尺度检测能力PAN-FPN(路径聚合网络 + 特征金字塔),自顶向下 + 自底向上双向融合
Head检测头,输出最终的边界框坐标 + 类别概率 + 置信度解耦头(Decoupled Head):分类和回归分支分离,各自优化

关键技术原理

锚框(Anchor Box)

NMS(非极大值抑制)

损失函数

损失类型说明常用函数
分类损失衡量类别预测的准确性BCE Loss(二元交叉熵)
定位损失衡量边界框坐标的准确性CIoU Loss(考虑重叠面积 + 中心点距离 + 宽高比)
置信度损失衡量"该框包含目标"的置信度BCE Loss + Focal Loss(聚焦难分样本)

核心评估指标

指标定义意义
IoU预测框与真实框的交集 / 并集衡量定位精度,> 0.5 通常认为检测正确
mAP所有类别 AP 的平均值综合衡量检测精度,最常用的整体指标
mAP@0.5IoU 阈值 = 0.5 时的 mAP宽松标准,反映"找得到"的能力
mAP@0.5:0.95IoU 从 0.5 到 0.95(步长 0.05)取平均严格标准,反映"定位准"的能力(COCO 数据集主要指标)
FPS每秒处理帧数衡量推理速度,实时场景通常需要 ≥ 25 FPS

模型优化与加速

技术原理效果
模型量化(INT8)将 FP32 权重和激活值映射到 INT8,降低计算精度换取速度推理速度 2-4x 提升,精度损失 < 1%
模型剪枝移除不重要的通道/层,减少参数量和计算量模型体积缩减 30-50%,速度提升
TensorRT 加速NVIDIA 推理优化引擎:层融合、显存优化、内核自动调优推理速度 3-5x 提升,适合 GPU 部署
ONNX 导出将 PyTorch 模型导出为 ONNX 通用格式,跨框架/跨硬件部署一次导出,多端部署(GPU / CPU / Edge TPU)
OpenVINOIntel 推理引擎,针对 CPU / VPU / FPGA 优化x86 平台 CPU 推理加速,无需 GPU

主流检测模型对比

模型类型精度 (mAP)速度适用场景
YOLOv8单阶段 Anchor-Free实时检测、边缘部署
YOLOv10单阶段 NMS-Free更高更快端到端实时检测
Faster R-CNN两阶段最高高精度离线分析
SSD单阶段中等轻量级移动端
RT-DETR基于 Transformer较快端到端 + 全局上下文建模

视频流推理 Pipeline(工程实践)

┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐
│  RTSP    │───→│  解码    │───→│  抽帧    │───→│  YOLO    │───→│  告警    │
│  取流    │    │ FFmpeg   │    │ (1-N fps)│    │  推理    │    │  推送    │
└──────────┘    └──────────┘    └──────────┘    └──────────┘    └──────────┘
                                                     │
                                                     ▼
                                              ┌──────────┐
                                              │ 目标跟踪  │
                                              │ DeepSORT │
                                              └──────────┘

常见应用场景与模型选型

场景检测目标推荐模型部署方式
安全生产安全帽、反光衣、烟火、区域入侵YOLOv8s边缘盒子(Jetson Orin)
智慧交通车牌、车型、车流统计、违停YOLOv8m + LPRNet边缘服务器(T4 GPU)
农业物联网病虫害识别、果实计数、生长阶段YOLOv8n边缘网关 / 云端 GPU
工业质检产品缺陷、尺寸偏差、装配完整性YOLOv8x工业相机 + GPU 工控机
安防监控人脸、人体、异常行为、物品遗留YOLOv8lNVR + 算力卡 / 中心服务器

实施场景注意事项(实战经验)

以下基于实际项目踩坑经验总结——涉及 GB/T 28181 国标平台、海康/大华 SDK、开源方案(FastBee / WVP-GB28181 / FFmpeg + YOLO)在真实场景中的落地要点。

摄像头接入与取流

问题常见坑对策
协议兼容不同品牌摄像头支持的协议不同——海康优先 ISUP / EHOME,大华有私有 SDK,ONVIF 各厂商实现程度不一优先对接 GB/T 28181 国标(强制标准),兜底 RTSP;海康/大华单独适配 SDK 以获得完整 PTZ 控制和报警回调
RTSP 稳定性RTSP 基于 UDP,网络抖动导致花屏、断流;长时间运行 TCP 会话可能被防火墙断开使用 TCP 传输模式(?tcp 参数);增加断线重连 + 指数退避策略;FFmpeg 设置 -rtsp_transport tcp -stimeout 5000000
多路并发直接拉 50+ 路 RTSP 流导致带宽和连接数爆炸,单台服务器网卡成为瓶颈分级架构:边缘网关(NVR / 工控机)本地拉流 + 推理,只上传告警事件到中心;或使用流媒体服务(ZLM / SRS)统一收流转发
视频编码H.265 摄像头越来越普及,但部分开源推理框架对 H.265 硬解支持不佳确认 GPU 硬解能力(NVIDIA NVDEC / Intel QSV);必要时在接入层统一转码为 H.264;优先选 H.264 流的摄像头子码流做推理

推理性能与资源规划

问题常见坑对策
GPU 资源估算低估了多路视频并发推理的显存和算力需求,上线后发现 GPU 跑不满或 OOM单路 YOLOv8s 约占用 1.5-2GB 显存;一张 T4(16GB)实际可跑 8-12 路(需留显存给解码 + 前后处理);做好压测再承诺路数
抽帧策略全部 25fps 逐帧推理,GPU 资源浪费且告警风暴(同一个目标连续告警几十次)按场景定抽帧率:周界入侵 5fps、烟火检测 2fps、车牌识别 10fps;配合跳帧 + 告警去重(同一目标同一区域 N 秒内只告警一次)
子码流推理用主码流(1080P/4K)做推理,分辨率远超模型输入尺寸(640×640),浪费解码 + 预处理算力摄像头开启子码流(704×576 或 640×480),专门用于 AI 推理;主码流仅用于录像存储和人工调阅
批处理 vs 实时为提升吞吐量攒批次推理,但引入几百毫秒延迟,告警不及时安防场景优先低延迟:单帧推理、不攒批;离线分析(如事后检索)可以用大 batch 提升吞吐
模型选型误区追求大模型高精度(YOLOv8x),忽略边缘设备算力限制边缘设备用 YOLOv8n/s + TensorRT INT8 量化;中心服务器可用大模型做二次复核(小模型初筛 → 大模型确认)

告警策略与误报控制

问题常见坑对策
误报泛滥检测灵敏度设太高或未做区域过滤,一天几百条误报告警,客户直接关系统多级过滤:置信度阈值(≥0.6)+ 检测区域 ROI 绘制(排除马路/绿化带等干扰区)+ 时间策略(工作时间告警、非工作时间静默)
告警风暴同一事件持续触发(如一个烟头在画面中 5 分钟,告警 300 次)告警去重窗口:同一摄像头 + 同一目标类别 + N 秒内合并为一条;告警升级机制:持续超过 M 分钟升级为严重告警
目标跟踪丢失DeepSORT 在遮挡、光照变化、密集场景下 ID Switch 严重,导致计数不准结合 ROI 区域限定跟踪范围;遮挡后给 ReID 特征匹配设置合理的超时时间(如 30 帧);密集场景考虑 ByteTrack(低分框也做匹配,抗遮挡更好)
昼夜差异白天训练模型用在夜间红外画面,检测率断崖下降训练集必须包含红外/微光场景样本(至少 20%);或分时段加载不同模型(白天模型 + 夜间模型)
天气影响雨雪雾天气导致画面模糊,检测失效数据增强时加入高斯模糊、亮度抖动、模拟雨雪噪声;极端天气自动切换为移动侦测兜底方案

存储与回溯

问题常见坑对策
告警截图丢失只存告警记录不存截图/短视频,事后追查无依据告警触发时同时保存:告警时刻前后各 3 秒的短视频片段 + 关键帧截图 + 检测框标注图;存储策略:热数据 SSD(7 天)、冷数据 NAS/对象存储(90 天)
录像回溯告警记录和录像时间戳不对齐,事后查证时找不到对应录像片段告警记录强制记录 NTP 时间戳(精确到毫秒)+ 摄像头编号 + 帧序号;对接 NVR 录像回放 API 实现一键跳转到告警时刻回放
存储成本全量录像 7×24 存储,100 路 1080P 一个月几十 TB常态录像:低码率 + 移动侦测录像(只录有动静的);告警录像:高清 + 完整片段;定期清理策略自动化

系统可靠性与运维

问题常见坑对策
单点故障AI 推理服务挂了,所有摄像头告警全部中断,且没有感知服务健康检查 + 自动重启(systemd / k8s 探针);关键通道双机热备;监控告警通道本身的心跳(超过 1 分钟无数据触发运维告警)
GPU 掉卡GPU 长时间运行温度过高掉卡或驱动崩溃,进程无感知卡死定时检测 GPU 可用性(nvidia-smi + CUDA 可用性探针);异常时自动重启推理服务;边缘设备注意散热和防尘
模型更新模型迭代后直接全量替换,新模型在某个点位效果变差,缺乏回滚能力灰度发布:先在 10% 通道上验证新模型,对比告警准确率;保留上一版本模型,支持一键回滚;记录模型版本 + 通道的告警效果基线
时钟同步服务器、摄像头、NVR 时钟不同步,告警时序混乱,多路联动失败全系统强制 NTP 对时;摄像头每天自动校时;告警时间以服务器收到帧的时间戳为准(而非摄像头 OSD 时间)
日志与审计出了事故查不到为什么没告警——是模型没检测到?还是告警规则过滤了?还是推送通道断了?全链路埋点:取流状态 → 抽帧计数 → 推理耗时 → 检测结果 → 过滤规则命中 → 告警推送状态,每个环节都可追溯

国标 GB/T 28181 对接注意事项

技术全景总结

方向核心原理
LLMTransformer + 三阶段训练,Self-Attention 是核心
Prompt通过输入设计引导模型行为,CoT 通过中间推理 token 约束输出路径
AgentLLM + 规划 + 工具调用 + 循环决策 = 自主完成任务
Skills 编排业务能力模块化,LLM 语义匹配 + 动态路由,自动编排执行
RAG检索外部知识增强 LLM,离线入库 + 在线问答双 Pipeline,解决幻觉与知识时效
AI CodingAI 辅助代码生成/审查/测试,Agent 模式实现自主开发闭环
YOLO单阶段目标检测,Backbone+Neck+Head 架构,一次前向传播同时输出检测框与类别,适合实时视频流推理