1. 产品简介

智训台是 Windows 安装版桌面 AI 工具:解压即用,无需安装 Python。 把「准备数据 → 训练 → 试用 → 导出」收在一个窗口里。 适合学习、中小企业试点、现场演示;不是大企业云中台。

模块做什么典型产出
YOLO视觉训练 图片检测 / 分类 / 分割:标注框 → 训练 → 测试 best.pt、ONNX 等
ML机器学习 表格 CSV/Excel:选特征 → 多算法训练 → 预测 joblib / ONNX / zip
OCR文档识别 免训练读发票、单据文字,可配字段模板 Excel 结果表
读字字符串识别 自己标注字符串再训练(车牌、编号、工号等) 读字模型 pt / zip / ONNX
视频视频监测 摄像头 / RTSP;区域/计数/停留规则、HTTP 回调 告警图;JSON / WebSocket / POST 回调
流水线多模型编排 检测→读字、推坐标、OCR→Excel;可发布 API 串联结果 JSON;可选 Excel
期望要对齐:除「文档 OCR」外,视觉 / 表格 / 字符串识别都需要你自己的数据。 数据质量决定效果;小样本只能做试点,不能当魔法。

2. 安装与首次启动

安装版用户(推荐):解压/拷贝整个「智训台」文件夹,双击 智训台.exe 即可。 无需安装 Python,运行库已内置。不要只拷贝单个 exe。

2.1 环境要求(安装版)

2.2 启动软件

首次启动会显示加载页,在进入主界面前同步加载全部六个功能页,切换页签时不再卡顿。

  1. 将整个「智训台」文件夹放到任意目录(如 D:\智训台\
  2. 双击 智训台.exe
  3. 等待加载页完成(首次略慢属正常)

2.3 新安装就绪检查(必做)

首次启动会自动打开;之后从 帮助 → 新安装就绪检查… 进入。

  1. 安装版一般不必点「一键补齐缺失依赖」(运行库已自带)
  2. 选择预训练底座(推荐 YOLO11n)→ 下载所选底座(需联网)
  3. 重新检查,确认 YOLO 底座与 OCR 等就绪
  4. 开始使用
下载失败可用「打开底座助手」在浏览器下载 .pt 后导入本机。

2.4 源码版(仅开发者)

若你从 Gitee 拉的是源码仓库而非安装包,才需要 Python 3.10/3.11 与下列步骤(普通用户请忽略):

scripts\install.bat
scripts\run_app.bat

# 或
python -m pip install -r requirements.txt
python -m pip install -e .
python -m yolo_studio
源码版勿用 Python 3.13+;安装时勾选 Add python.exe to PATH

3. 界面总览

区域说明
顶部六个选项卡YOLO / 机器学习 / 文档 OCR / 字符串识别 / 视频监测 / 多模型流水线
左侧步骤栏✅ 完成 · ▶ 当前 · ○ 未完成 · 🔒 未解锁(悬停看提示)
上一步 / 下一步按流程推进;未完成时下一步会提示原因
数据与模型管理查看、导出、删除数据集与训练结果
帮助菜单就绪检查、激活码、本地 API、关于
参数旁 (?)鼠标悬停看「怎么用 / 建议值 / 为什么」

4. YOLO 视觉训练

适合:缺陷检测、目标计数、安全帽/车辆、货架等有图有框的场景。

4.1 推荐流程

  1. ① 准备数据:创建数据集,导入图片文件夹;可选行业模板
  2. ② 标注:检测画框;分割沿边缘点轮廓;姿态按提示点关节点
  3. ③ 拆分:划分 train / val(保持默认比例通常即可)
  4. ④ 训练:选任务(检测/分类/分割等)、底座、轮数、batch;看曲线
  5. ⑤ 测试:用自训 best.pt 测单张或文件夹
  6. ⑥ 导出:ONNX / TorchScript / 复制 pt 等 → data/exports

4.1.1 YOLO 系列能训哪些任务?

系列目标检测分割 / 分类 / 姿态 / 旋转框
YOLOv5 / v9 / v10 / YOLO12❌ 无官方预训练底座
YOLOv8 / YOLO11✅(推荐新手统一用 YOLO11)
不是「六个版本随便选都能训所有任务」。软件会按当前任务自动隐藏不可用系列。

4.2 关键参数怎么选(白话)

参数建议
底座模型入门用 Nano/小模型(如 yolo11n);图多再加大
轮数 epochs先 50~100 试效果;过拟合再减或加数据
batch显存不够就减小(4 / 8);CPU 更要小
图片尺寸默认即可;小目标可适当加大
继续训练勾选后从已有 run 的权重接着训

4.3 数据与模型管理

预训练底座(如 yolo11n.pt)只是起点,不是你的成品。 成品是训练后生成的 best.pt

5. 机器学习训练

适合:台账、工单、风控、销量等表格数据(CSV / Excel)。

5.1 推荐流程

  1. ① 导入数据:选 CSV/Excel,预览列名与内容
  2. ② 配置特征
    • 标签列(要预测的答案;异常/聚类可选「无标签」)
    • 勾选特征列 X(输入列;不要勾标签本身)
    • 可选:生成影响因素(假期/周末,需日期列)
    • 可选:生成滞后特征(用昨天/上周数值预测今天)
    • 必须点 保存配置
  3. ③ 选择算法并训练:随机森林等;看是否达标与评估图
  4. ④ 预测 / 使用:单条或批量 CSV;导出模型

5.2 滞后特征怎么填(易错)

数值列:选数字,如 amount / 销售额。不要选 date。

按哪天排序:选日期列 date

生成后会出现 lag_xxx_1(约昨天)、lag_xxx_7(约上周)→ 勾进特征 → 保存配置。

5.3 常见算法怎么选

场景建议算法
有标签分类(合规/违规)随机森林、梯度提升(新手首选随机森林)
数值回归(预测销售额)随机森林回归、梯度提升、岭回归
异常点孤立森林
分群KMeans / GMM(DBSCAN 一般不适合对新行直接预测)
想试神经网络MLP;样本少时未必优于树模型

6. 文档 OCR

免训练读图上的字,适合发票、单据、合同扫描件。

  1. 打开顶部 文档 OCR
  2. 添加图片或文件夹
  3. 选择模板:通用全文 / 增值税发票 / 自定义字段模板
  4. 一键识别 → 核对 → 导出 Excel
  5. 模板向导…:样例图上拖框定义字段区域(比手填比例更直观)

自定义模板可按字段名、关键词、正则配置;也可用「自定义模板…」手填。内置模板不可删。

引擎默认 rapidocr-onnxruntime。未安装时到「新安装就绪检查」一键补齐。

7. 字符串识别

适合车牌、钢印号、工号等:需要自己标注再训一版的专用读字(与文档 OCR 不同)。

7.1 推荐流程

  1. ① 准备数据:建数据集,导入裁好的文字条带图(字水平、背景尽量干净)
  2. ② 标注文本:点缩略图,输入图上完整字符串,回车保存并下一张(至少 5 张,建议 50+)
  3. ③ 训练模型:可勾选旧模型微调;看 Loss / Acc;结束后看结论与优化建议
  4. ④ 识别使用:选模型,测单张图

7.2 标注注意

8. 视频监测

用已训好的 YOLO 模型,对接摄像头、本地视频文件或 RTSP,实时画框 / 告警截图。

8.1 基本操作

  1. 先完成 YOLO 训练,或准备好可用的 .pt
  2. 打开顶部 视频监测 → 选模型与视频源 → 开始监测
  3. 卡顿时可勾选「流畅优先」,或把识别尺寸改为 320、隔帧调大
  4. 告警截图保存在 data/alerts
  5. 在预览图上配置区域…:拖框生成 ROI(比手填数字直观)
  6. 规则与回调 URL 会自动保存到 data/workspace/prefs/
  7. 底部 HTTP 回调日志 可查看最近 POST 成功/失败

8.2 告警规则(可选)

授权:视频监测在3 天体验期内或激活后可用。

本机读取:启用「本地 API」后使用 /api/v1/monitor/latest(JSON)或 /api/v1/monitor/ws(WebSocket)。外部系统也可只接 HTTP 回调。

9. 多模型流水线

把多步任务串成一条链,适合「检测后读字」「只推坐标」「批量 OCR 出 Excel」。

  1. 打开顶部 多模型流水线
  2. 选模板 ID:detect_crop_textrec / detect_push_coords / ocr_excel
  3. 绑定 YOLO、字符串或 OCR 模板;推坐标模板需填 HTTP 回调 URL
  4. 批量图片:添加图片 → 运行流水线
  5. 视频/RTSP:运行模式选「视频持续推坐标」,填视频源与回调 URL,点停止结束
  6. 配置自动保存;底部可查看 HTTP 回调日志
  7. 可选 发布到本地 API…,外部程序 POST 一张图即可跑整条链

10. 试用与激活

教程公开。安装包、用法或卡住了,加微信说一声就好。

11. 本地 API(软件开着才可用)

把能力发布成本机 HTTP 接口,供其它程序(MES、质检上位机、自研后台等)调用: YOLO / 机器学习 / 字符串识别 / 文档 OCR / 多模型流水线,以及视频监测结果关闭智训台后接口立即失效 — 不是独立后台服务。

完整接口文档(Markdown):仓库 docs/LOCAL_API.md

10.1 启用与保存

  1. 确保处于3 天体验期内或已用有效激活码激活
  2. 菜单 帮助 → 本地 API…
  3. 勾选 启用本地 API,确认端口(默认 8787),可选 访问令牌
  4. 下拉选择已训模型、「文档OCR · 模板」或「流水线 · 模板」→ 发布为接口
  5. 保存并应用(仅勾选不保存不会启动服务)
  6. 状态栏显示「本地 API:运行中 http://127.0.0.1:8787」
上次启用并保存后,下次启动软件会自动恢复服务(约 0.6 秒)。 激活过期则自动停用并提示续费。
默认只监听 127.0.0.1,不对外网开放。

10.2 鉴权

10.3 端点总览

方法路径说明
GET/api/health健康检查、路由数量、监测是否在跑
GET/api/v1/routes已发布接口列表 + 完整 URL 与 docs
GET/api/v1/routes/<id>/docs单个接口入参/出参说明
POST/api/v1/predict/<接口ID>YOLO / ML / 字符串 / OCR / 流水线
GET/api/v1/monitor/*视频监测 JSON(见 10.5)
WS/api/v1/monitor/ws监测实时推送

10.4 单张图 / 表格推理

健康检查:

GET http://127.0.0.1:8787/api/health

图像输入(二选一):

YOLO(检测看 detections;分类看 classifications;旋转框 obb;姿态 keypoints):

POST http://127.0.0.1:8787/api/v1/predict/<接口ID>
Content-Type: application/json

{"image": "D:/demo.jpg", "conf": 0.25, "iou": 0.45}

机器学习(单行 features 或批量 rows):

POST http://127.0.0.1:8787/api/v1/predict/<接口ID>
Content-Type: application/json

{"features": {"广告投入": 100, "投诉次数": 2}}

# 或批量
{"rows": [{"广告投入": 100}, {"广告投入": 200}]}

字符串识别:

{"image": "D:/plate.jpg"}

返回 textconfidence 等。

文档 OCR(发布时选「文档OCR · 模板」;template_id 可省略):

{"image": "D:/invoice.jpg", "template_id": "vat_invoice"}

返回 full_textfieldslinesavg_score

多模型流水线(发布「流水线 · 模板」;单张或批量):

{"image": "D:/demo.jpg"}
# 或 {"images": ["D:/a.jpg", "D:/b.jpg"]}

返回各步 results;OCR 链可能含 excel_path

10.5 视频监测结果(JSON + WebSocket + HTTP 回调)

需:本地 API 已启用并保存 + 「视频监测」页已开始监测(无需再发布 YOLO 模型)。

GET  http://127.0.0.1:8787/api/v1/monitor/status
GET  http://127.0.0.1:8787/api/v1/monitor/latest
GET  http://127.0.0.1:8787/api/v1/monitor/alerts?since_id=0&limit=50
GET  http://127.0.0.1:8787/api/v1/monitor/docs
WS   ws://127.0.0.1:8787/api/v1/monitor/ws

10.6 错误与排错

现象处理
HTTP 403未激活或已过期 → 续费后重新激活并「保存并应用」
HTTP 401令牌不一致 → 检查 X-API-Token?token=
HTTP 404接口 ID 错误 → GET /api/v1/routes 核对
模型文件报错权重被删 → 重新发布;OCR 用模板发布
监测无数据先点「开始监测」再访问 latest
关软件后失效设计如此;需长期服务请保持智训台运行
授权:本地 API 与视频监测在3 天体验期内或激活后可用。 体验到期或激活过期后无法启动服务;预测/监测请求返回 HTTP 403。

12. 导出与换机

模块常见导出位置
YOLOpt / ONNX;训练报告 PDFdata/exports;④训练页或管理页导出 PDF
机器学习joblib / ONNX / zip;训练报告 PDF训练页或管理页
字符串识别pt / 文件夹 / zip / ONNXdata/exports/textrec
OCR / 流水线Excel 字段表识别页或流水线输出路径

换电脑:优先拷贝整个项目下的 data 目录(含 datasets、runs、models、授权缓存等),再在新机装依赖。

机器学习另有「换机 / 导入助手」可按向导操作。

13. 常见问题

Q:一键装依赖失败?

安装版可忽略(无需 pip)。仅源码版用户需 Python 3.10/3.11 并运行 scripts\install.bat

Q:训练很慢 / 显存不够?

减小 batch、图片尺寸、模型规格;或改用 CPU 小轮数先跑通流程。

Q:效果不好?

先查数据:标注对不对、样本够不够、类别是否极不平衡;再调轮数 / 换算法。软件会在训练结束给出白话建议。

Q:激活失败?

需能访问激活服务器;检查网络;确认码未作废、未过期;换机请用同一码重新激活。

Q:本地 API 调不通?

确认:软件已开、已点「保存并应用」、已激活未过期、端口与接口 ID 正确、令牌一致。用 GET /api/healthGET /api/v1/routes 自检。详见 docs/LOCAL_API.md

Q:启用后下次还要再开吗?

上次「保存并应用」后,下次启动会自动恢复服务;激活过期会自动停用。

Q:监测接口没有数据?

先启用本地 API 并「保存并应用」,再在「视频监测」点开始监测;然后访问 /api/v1/monitor/latest

Q:文档 OCR 和字符串识别有何区别?

OCR:通用读字,免训练。字符串识别:针对你裁好的专用号码再训一版,通常更准。

14. 重要目录

路径内容
data/datasetsYOLO 数据集
data/runs/trainYOLO 训练结果
data/runs/ml机器学习模型
data/textrec_datasets字符串识别数据
data/runs/textrec字符串识别训练结果
data/models预训练底座缓存
data/exports导出文件
data/alerts视频监测告警截图
data/.license激活状态(本机)
data/.local_api本地 API 发布配置