AI 训练服务器用户指南
AI 训练服务器简介
AI 训练服务器提供一站式转换和训练工作流,可作为离线 Acuity Toolkit 的替代方案。 它提供基于 Web 的用户界面,用于数据集管理、模型训练、量化和部署。
有关 AI 训练服务器的安装和使用完整指南,包括硬件要求、安装步骤和完整训练工作流, 请参考:
主要特性
基于 Web 的用户界面:通过浏览器界面管理数据集、配置训练和下载转换后的模型。
端到端工作流:从数据集导入到训练和量化模型(
.nb文件)。自动标注:自动为数据集生成标签。
量化对比:在部署前比较 FP32 和 INT8 模型的精度。
内置模拟器:在服务器环境中直接测试您的模型。
要求
备注
AI 训练服务器有以下要求:
需要搭载 NVIDIA GPU 的原生 Ubuntu 环境。(推荐使用 Ubuntu 24.04)
不支持 WSL。
由于仅有一个 NVIDIA GPU,同一时间只能运行一个训练任务。
更多详情,请参见 AI 训练服务器设置指南 和 AI 训练服务器运行指南。
AI 训练服务器设置指南
备注
安装过程需要执行多个命令。该流程已打包到 Docker 中,您只需导入 Docker 映像即可开始使用。
S1. 硬件要求
搭载 NVIDIA GPU 的 Ubuntu 操作系统(推荐版本:Ubuntu 24.04)
32 GB 内存
NVIDIA 4060 8 GB VRAM(或更高版本)
备注
AI 训练服务器 不 支持在 WSL(适用于 Linux 的 Windows 子系统)上安装或运行。 需要原生 Ubuntu 环境并配备 NVIDIA GPU 支持。
S2. 安装 NVIDIA 驱动
打开 Software & Updates (软件与更新)
导航至 Additional Drivers (附加驱动)选项卡
选择标记为 "proprietary, tested"(专有,已测试)的驱动程序(例如
nvidia-driver-560)点击 Apply Changes (应用更改)并重启
重启后,运行
nvidia-smi验证安装
S3. 安装 Docker
将用户添加到 Docker 用户组并重启:
sudo usermod -aG docker $USER
使用
docker ps验证安装。
S4. 创建工作目录
创建一个文件夹用于存放脚本和 .tar.gz 文件(例如 AI_train_server)。
文件夹结构如下:
AI_train_server/
|-- docker_images/
| |-- IMAGES.txt --> Docker 映像列表
| |-- load_docker_images.sh --> 安装脚本
| |-- acuity_converter_v1.1.tar.gz --> Docker 映像文件
| |-- training-server-train_latest.tar.gz --> Docker 映像文件
| |-- training-server-importer_latest.tar.gz --> Docker 映像文件
| |-- nvidia_cuda_12.1.1-cudnn8-runtime-ubuntu22.04.tar.gz --> Docker 映像文件
|-- base
|-- base-20260109-165208.tar.gz
|-- workspaces_example
|-- workspaces-example-20251223-135111.tar.gz
|-- INSTALLATION.md
S5. 安装脚本
tar -xzf base-<timestamp>.tar.gz
tar -xzf workspaces-example-<timestamp>.tar.gz
cd docker_images && ./load_docker_images.sh
cd ../base
sudo ./install.sh
cd ../workspaces_example && ./install_workspaces_example.sh (可选,生成默认示例)
S6. 登录系统
安装完成后,桌面上会出现快捷方式,您也可以通过访问 http://localhost:8080/login 登录。
系统登录界面
在模型训练界面上,使用以下默认凭据登录:
用户名:
admin@realtek.com密码:
admin123
登录后您可以更改密码。
系统支持多个用户账户,每个账户拥有独立的工作空间。但由于仅有一个 NVIDIA GPU, 同一时间只能运行一个训练任务。
AI 训练服务器运行指南
AI 训练服务器支持从管理自有数据、仿真测试到设备端测试的完整工作流程。
R1. 登录服务器
确保你可以访问服务器,并使用正确的凭据登录。
R2. 开始训练
成功登录服务器后,你可以:
上传自己的数据集,或从 Hugging Face 下载示例数据集。
调整训练配置。
导入数据集
数据集的标签可以自动生成。
自动标注
图像分类训练显示 loss 曲线,而目标检测显示 训练进度。
图像分类显示 loss
目标检测显示训练进度
该工具提供模型量化(FP32 到 INT8)的 前后对比。如有需要,你还可以下载训练好的 ONNX 和 NB 文件进行进一步的手动对比。
量化对比
你可以直接在 UI 中定义和管理类别。如需识别新的物体,只需添加一个新类别,系统便会自动将其纳入训练流程。
添加新类别
备注
理论上,由于初始权重是随机的,不同次运行中模型收敛到完全相同结果的可能性极低。然而,增加训练轮数可以减少结果的差异性。在实际应用中,通常需要多次运行训练。
R3. 下载模型
训练完成后,会出现 下载 按钮。点击该按钮即可下载训练好的模型,用于 RTL IC 芯片。
"运行"和"下载模型"按钮
备注
目前,Hugging Face 集成主要用于初始测试。暂不支持上传本地训练的模型进行量化和部署,但该功能计划在未来版本中提供。
R4. 模型测试
训练完成后,该工具内置 仿真器,你可以直接观察结果并评估模型。
实时测试