1. 产品简介
智训台是 Windows 安装版桌面 AI 工具:解压即用,无需安装 Python。 把「准备数据 → 训练 → 试用 → 导出」收在一个窗口里。 适合学习、中小企业试点、现场演示;不是大企业云中台。
| 模块 | 做什么 | 典型产出 |
|---|---|---|
| YOLO视觉训练 | 图片检测 / 分类 / 分割:标注框 → 训练 → 测试 | best.pt、ONNX 等 |
| ML机器学习 | 表格 CSV/Excel:选特征 → 多算法训练 → 预测 | joblib / ONNX / zip |
| OCR文档识别 | 免训练读发票、单据文字,可配字段模板 | Excel 结果表 |
| 读字字符串识别 | 自己标注字符串再训练(车牌、编号、工号等) | 读字模型 pt / zip / ONNX |
| 视频视频监测 | 摄像头 / RTSP;区域/计数/停留规则、HTTP 回调 | 告警图;JSON / WebSocket / POST 回调 |
| 流水线多模型编排 | 检测→读字、推坐标、OCR→Excel;可发布 API | 串联结果 JSON;可选 Excel |
2. 安装与首次启动
智训台.exe 即可。
无需安装 Python,运行库已内置。不要只拷贝单个 exe。
2.1 环境要求(安装版)
- Windows 10 / 11(64 位)
- 磁盘建议预留 8GB+(模型与训练缓存)
- 有 NVIDIA 显卡可选加速,没有也能用 CPU(更慢)
- 不需要单独安装 Python、pip 或 CUDA
2.2 启动软件
首次启动会显示加载页,在进入主界面前同步加载全部六个功能页,切换页签时不再卡顿。
- 将整个「智训台」文件夹放到任意目录(如
D:\智训台\) - 双击 智训台.exe
- 等待加载页完成(首次略慢属正常)
2.3 新安装就绪检查(必做)
首次启动会自动打开;之后从 帮助 → 新安装就绪检查… 进入。
- 安装版一般不必点「一键补齐缺失依赖」(运行库已自带)
- 选择预训练底座(推荐 YOLO11n)→ 下载所选底座(需联网)
- 点 重新检查,确认 YOLO 底座与 OCR 等就绪
- 点 开始使用
.pt 后导入本机。
2.4 源码版(仅开发者)
若你从 Gitee 拉的是源码仓库而非安装包,才需要 Python 3.10/3.11 与下列步骤(普通用户请忽略):
scripts\install.bat
scripts\run_app.bat
# 或
python -m pip install -r requirements.txt
python -m pip install -e .
python -m yolo_studio
3. 界面总览
| 区域 | 说明 |
|---|---|
| 顶部六个选项卡 | YOLO / 机器学习 / 文档 OCR / 字符串识别 / 视频监测 / 多模型流水线 |
| 左侧步骤栏 | ✅ 完成 · ▶ 当前 · ○ 未完成 · 🔒 未解锁(悬停看提示) |
| 上一步 / 下一步 | 按流程推进;未完成时下一步会提示原因 |
| 数据与模型管理 | 查看、导出、删除数据集与训练结果 |
| 帮助菜单 | 就绪检查、激活码、本地 API、关于 |
| 参数旁 (?) | 鼠标悬停看「怎么用 / 建议值 / 为什么」 |
4. YOLO 视觉训练
适合:缺陷检测、目标计数、安全帽/车辆、货架等有图有框的场景。
4.1 推荐流程
- ① 准备数据:创建数据集,导入图片文件夹;可选行业模板
- ② 标注:检测画框;分割沿边缘点轮廓;姿态按提示点关节点
- ③ 拆分:划分 train / val(保持默认比例通常即可)
- ④ 训练:选任务(检测/分类/分割等)、底座、轮数、batch;看曲线
- ⑤ 测试:用自训
best.pt测单张或文件夹 - ⑥ 导出:ONNX / TorchScript / 复制 pt 等 →
data/exports
4.1.1 YOLO 系列能训哪些任务?
| 系列 | 目标检测 | 分割 / 分类 / 姿态 / 旋转框 |
|---|---|---|
| YOLOv5 / v9 / v10 / YOLO12 | ✅ | ❌ 无官方预训练底座 |
| YOLOv8 / YOLO11 | ✅ | ✅(推荐新手统一用 YOLO11) |
4.2 关键参数怎么选(白话)
| 参数 | 建议 |
|---|---|
| 底座模型 | 入门用 Nano/小模型(如 yolo11n);图多再加大 |
| 轮数 epochs | 先 50~100 试效果;过拟合再减或加数据 |
| batch | 显存不够就减小(4 / 8);CPU 更要小 |
| 图片尺寸 | 默认即可;小目标可适当加大 |
| 继续训练 | 勾选后从已有 run 的权重接着训 |
4.3 数据与模型管理
- 删除无用数据集 / 训练运行(腾磁盘)
- 导出权重到
data/exports - 换电脑:拷贝整个项目的
data文件夹最省事
best.pt。
5. 机器学习训练
适合:台账、工单、风控、销量等表格数据(CSV / Excel)。
5.1 推荐流程
- ① 导入数据:选 CSV/Excel,预览列名与内容
- ② 配置特征:
- 选标签列(要预测的答案;异常/聚类可选「无标签」)
- 勾选特征列 X(输入列;不要勾标签本身)
- 可选:生成影响因素(假期/周末,需日期列)
- 可选:生成滞后特征(用昨天/上周数值预测今天)
- 必须点 保存配置
- ③ 选择算法并训练:随机森林等;看是否达标与评估图
- ④ 预测 / 使用:单条或批量 CSV;导出模型
5.2 滞后特征怎么填(易错)
数值列:选数字,如 amount / 销售额。不要选 date。
按哪天排序:选日期列 date。
生成后会出现 lag_xxx_1(约昨天)、lag_xxx_7(约上周)→ 勾进特征 → 保存配置。
5.3 常见算法怎么选
| 场景 | 建议算法 |
|---|---|
| 有标签分类(合规/违规) | 随机森林、梯度提升(新手首选随机森林) |
| 数值回归(预测销售额) | 随机森林回归、梯度提升、岭回归 |
| 异常点 | 孤立森林 |
| 分群 | KMeans / GMM(DBSCAN 一般不适合对新行直接预测) |
| 想试神经网络 | MLP;样本少时未必优于树模型 |
6. 文档 OCR
免训练读图上的字,适合发票、单据、合同扫描件。
- 打开顶部 文档 OCR
- 添加图片或文件夹
- 选择模板:通用全文 / 增值税发票 / 自定义字段模板
- 一键识别 → 核对 → 导出 Excel
- 模板向导…:样例图上拖框定义字段区域(比手填比例更直观)
自定义模板可按字段名、关键词、正则配置;也可用「自定义模板…」手填。内置模板不可删。
引擎默认 rapidocr-onnxruntime。未安装时到「新安装就绪检查」一键补齐。
7. 字符串识别
适合车牌、钢印号、工号等:需要自己标注再训一版的专用读字(与文档 OCR 不同)。
7.1 推荐流程
- ① 准备数据:建数据集,导入裁好的文字条带图(字水平、背景尽量干净)
- ② 标注文本:点缩略图,输入图上完整字符串,回车保存并下一张(至少 5 张,建议 50+)
- ③ 训练模型:可勾选旧模型微调;看 Loss / Acc;结束后看结论与优化建议
- ④ 识别使用:选模型,测单张图
7.2 标注注意
- 标注必须与画面一字不差(大小写、无多余空格)
- 图越干净、裁得越准,越容易训好
- 左侧步骤栏与 YOLO/ML 一样有 ✅ / 🔒 状态
8. 视频监测
用已训好的 YOLO 模型,对接摄像头、本地视频文件或 RTSP,实时画框 / 告警截图。
8.1 基本操作
- 先完成 YOLO 训练,或准备好可用的
.pt - 打开顶部 视频监测 → 选模型与视频源 → 开始监测
- 卡顿时可勾选「流畅优先」,或把识别尺寸改为 320、隔帧调大
- 告警截图保存在
data/alerts - 在预览图上配置区域…:拖框生成 ROI(比手填数字直观)
- 规则与回调 URL 会自动保存到
data/workspace/prefs/ - 底部 HTTP 回调日志 可查看最近 POST 成功/失败
8.2 告警规则(可选)
- 告警类别:留空=任意检出;或填
person, car等 - 区域入侵:ROI 比例
左,上,右,下(0~1),如0.15,0.15,0.85,0.85 - 区域计数:ROI + 数量 ≥ N
- 停留告警:ROI + 停留秒数
- 过线计数:线段
x1,y1,x2,y2(0~1) - HTTP 回调:告警或检出坐标 POST JSON 到外部 URL(无 MQTT)
本机读取:启用「本地 API」后使用
/api/v1/monitor/latest(JSON)或
/api/v1/monitor/ws(WebSocket)。外部系统也可只接 HTTP 回调。
9. 多模型流水线
把多步任务串成一条链,适合「检测后读字」「只推坐标」「批量 OCR 出 Excel」。
- 打开顶部 多模型流水线
- 选模板 ID:
detect_crop_textrec/detect_push_coords/ocr_excel - 绑定 YOLO、字符串或 OCR 模板;推坐标模板需填 HTTP 回调 URL
- 批量图片:添加图片 → 运行流水线
- 视频/RTSP:运行模式选「视频持续推坐标」,填视频源与回调 URL,点停止结束
- 配置自动保存;底部可查看 HTTP 回调日志
- 可选 发布到本地 API…,外部程序 POST 一张图即可跑整条链
10. 试用与激活
- 新用户首次启动可先本机试用几天(训练、本地 API、视频监测均可使用)
- 试用到期后,若想继续用:回到官网首页扫码加微信,说明情况即可
- 收到激活码后:帮助 → 输入激活码 → 粘贴 → 联网校验
- 一码一台机;换电脑再输入同一码可换绑
教程公开。安装包、用法或卡住了,加微信说一声就好。
11. 本地 API(软件开着才可用)
把能力发布成本机 HTTP 接口,供其它程序(MES、质检上位机、自研后台等)调用: YOLO / 机器学习 / 字符串识别 / 文档 OCR / 多模型流水线,以及视频监测结果。 关闭智训台后接口立即失效 — 不是独立后台服务。
完整接口文档(Markdown):仓库 docs/LOCAL_API.md。
10.1 启用与保存
- 确保处于3 天体验期内或已用有效激活码激活
- 菜单 帮助 → 本地 API…
- 勾选 启用本地 API,确认端口(默认 8787),可选 访问令牌
- 下拉选择已训模型、「文档OCR · 模板」或「流水线 · 模板」→ 发布为接口
- 点 保存并应用(仅勾选不保存不会启动服务)
- 状态栏显示「本地 API:运行中 http://127.0.0.1:8787」
127.0.0.1,不对外网开放。10.2 鉴权
- 未设置令牌:除 license 外不做令牌校验
- HTTP:
X-API-Token: 令牌或Authorization: Bearer 令牌 - 监测 GET / WebSocket:也可用
?token=令牌 GET /api/health不校验令牌,但会校验是否已激活
10.3 端点总览
| 方法 | 路径 | 说明 |
|---|---|---|
| GET | /api/health | 健康检查、路由数量、监测是否在跑 |
| GET | /api/v1/routes | 已发布接口列表 + 完整 URL 与 docs |
| GET | /api/v1/routes/<id>/docs | 单个接口入参/出参说明 |
| POST | /api/v1/predict/<接口ID> | YOLO / ML / 字符串 / OCR / 流水线 |
| GET | /api/v1/monitor/* | 视频监测 JSON(见 10.5) |
| WS | /api/v1/monitor/ws | 监测实时推送 |
10.4 单张图 / 表格推理
健康检查:
GET http://127.0.0.1:8787/api/health
图像输入(二选一):
image— 本机图片绝对路径(服务端读盘,不是 multipart 上传)image_base64— Base64,可带data:image/jpeg;base64,前缀
YOLO(检测看 detections;分类看 classifications;旋转框 obb;姿态 keypoints):
POST http://127.0.0.1:8787/api/v1/predict/<接口ID>
Content-Type: application/json
{"image": "D:/demo.jpg", "conf": 0.25, "iou": 0.45}
机器学习(单行 features 或批量 rows):
POST http://127.0.0.1:8787/api/v1/predict/<接口ID>
Content-Type: application/json
{"features": {"广告投入": 100, "投诉次数": 2}}
# 或批量
{"rows": [{"广告投入": 100}, {"广告投入": 200}]}
字符串识别:
{"image": "D:/plate.jpg"}
返回 text、confidence 等。
文档 OCR(发布时选「文档OCR · 模板」;template_id 可省略):
{"image": "D:/invoice.jpg", "template_id": "vat_invoice"}
返回 full_text、fields、lines、avg_score。
多模型流水线(发布「流水线 · 模板」;单张或批量):
{"image": "D:/demo.jpg"}
# 或 {"images": ["D:/a.jpg", "D:/b.jpg"]}
返回各步 results;OCR 链可能含 excel_path。
10.5 视频监测结果(JSON + WebSocket + HTTP 回调)
需:本地 API 已启用并保存 + 「视频监测」页已开始监测(无需再发布 YOLO 模型)。
GET http://127.0.0.1:8787/api/v1/monitor/status
GET http://127.0.0.1:8787/api/v1/monitor/latest
GET http://127.0.0.1:8787/api/v1/monitor/alerts?since_id=0&limit=50
GET http://127.0.0.1:8787/api/v1/monitor/docs
WS ws://127.0.0.1:8787/api/v1/monitor/ws
latest:最新检出(detections/count/seq/ts)alerts:告警列表(since_id增量;含截图本机路径snapshot)- WebSocket:连上先收
hello,之后detections/alert/status;可发{"type":"ping"}保活 - HTTP 回调:在视频监测页填 URL,告警或坐标流会 POST JSON(无 MQTT)
10.6 错误与排错
| 现象 | 处理 |
|---|---|
| HTTP 403 | 未激活或已过期 → 续费后重新激活并「保存并应用」 |
| HTTP 401 | 令牌不一致 → 检查 X-API-Token 或 ?token= |
| HTTP 404 | 接口 ID 错误 → GET /api/v1/routes 核对 |
| 模型文件报错 | 权重被删 → 重新发布;OCR 用模板发布 |
| 监测无数据 | 先点「开始监测」再访问 latest |
| 关软件后失效 | 设计如此;需长期服务请保持智训台运行 |
12. 导出与换机
| 模块 | 常见导出 | 位置 |
|---|---|---|
| YOLO | pt / ONNX;训练报告 PDF | data/exports;④训练页或管理页导出 PDF |
| 机器学习 | joblib / ONNX / zip;训练报告 PDF | 训练页或管理页 |
| 字符串识别 | pt / 文件夹 / zip / ONNX | data/exports/textrec 等 |
| OCR / 流水线 | Excel 字段表 | 识别页或流水线输出路径 |
换电脑:优先拷贝整个项目下的 data 目录(含 datasets、runs、models、授权缓存等),再在新机装依赖。
机器学习另有「换机 / 导入助手」可按向导操作。
13. 常见问题
Q:一键装依赖失败?
安装版可忽略(无需 pip)。仅源码版用户需 Python 3.10/3.11 并运行 scripts\install.bat。
Q:训练很慢 / 显存不够?
减小 batch、图片尺寸、模型规格;或改用 CPU 小轮数先跑通流程。
Q:效果不好?
先查数据:标注对不对、样本够不够、类别是否极不平衡;再调轮数 / 换算法。软件会在训练结束给出白话建议。
Q:激活失败?
需能访问激活服务器;检查网络;确认码未作废、未过期;换机请用同一码重新激活。
Q:本地 API 调不通?
确认:软件已开、已点「保存并应用」、已激活未过期、端口与接口 ID 正确、令牌一致。用 GET /api/health 和 GET /api/v1/routes 自检。详见 docs/LOCAL_API.md。
Q:启用后下次还要再开吗?
上次「保存并应用」后,下次启动会自动恢复服务;激活过期会自动停用。
Q:监测接口没有数据?
先启用本地 API 并「保存并应用」,再在「视频监测」点开始监测;然后访问 /api/v1/monitor/latest。
Q:文档 OCR 和字符串识别有何区别?
OCR:通用读字,免训练。字符串识别:针对你裁好的专用号码再训一版,通常更准。
14. 重要目录
| 路径 | 内容 |
|---|---|
data/datasets | YOLO 数据集 |
data/runs/train | YOLO 训练结果 |
data/runs/ml | 机器学习模型 |
data/textrec_datasets | 字符串识别数据 |
data/runs/textrec | 字符串识别训练结果 |
data/models | 预训练底座缓存 |
data/exports | 导出文件 |
data/alerts | 视频监测告警截图 |
data/.license | 激活状态(本机) |
data/.local_api | 本地 API 发布配置 |