AI 训练服务器用户指南

AI 训练服务器简介

AI 训练服务器提供一站式转换和训练工作流,可作为离线 Acuity Toolkit 的替代方案。 它提供基于 Web 的用户界面,用于数据集管理、模型训练、量化和部署。

有关 AI 训练服务器的安装和使用完整指南,包括硬件要求、安装步骤和完整训练工作流, 请参考:

主要特性

  • 基于 Web 的用户界面:通过浏览器界面管理数据集、配置训练和下载转换后的模型。

  • 端到端工作流:从数据集导入到训练和量化模型( .nb 文件)。

  • 自动标注:自动为数据集生成标签。

  • 量化对比:在部署前比较 FP32 和 INT8 模型的精度。

  • 内置模拟器:在服务器环境中直接测试您的模型。

要求

备注

AI 训练服务器有以下要求:

  • 需要搭载 NVIDIA GPU 的原生 Ubuntu 环境。(推荐使用 Ubuntu 24.04)

    不支持 WSL。

  • 由于仅有一个 NVIDIA GPU,同一时间只能运行一个训练任务。

更多详情,请参见 AI 训练服务器设置指南AI 训练服务器运行指南

AI 训练服务器设置指南

备注

安装过程需要执行多个命令。该流程已打包到 Docker 中,您只需导入 Docker 映像即可开始使用。

S1. 硬件要求

  • 搭载 NVIDIA GPU 的 Ubuntu 操作系统(推荐版本:Ubuntu 24.04)

  • 32 GB 内存

  • NVIDIA 4060 8 GB VRAM(或更高版本)

备注

AI 训练服务器 支持在 WSL(适用于 Linux 的 Windows 子系统)上安装或运行。 需要原生 Ubuntu 环境并配备 NVIDIA GPU 支持。

S2. 安装 NVIDIA 驱动

  • 打开 Software & Updates (软件与更新)

  • 导航至 Additional Drivers (附加驱动)选项卡

  • 选择标记为 "proprietary, tested"(专有,已测试)的驱动程序(例如 nvidia-driver-560

  • 点击 Apply Changes (应用更改)并重启

  • 重启后,运行 nvidia-smi 验证安装

../../../_images/ai_train_server_setup_2_1.png

S3. 安装 Docker

S4. 创建工作目录

创建一个文件夹用于存放脚本和 .tar.gz 文件(例如 AI_train_server)。 文件夹结构如下:

AI_train_server/
|-- docker_images/
|   |-- IMAGES.txt                               --> Docker 映像列表
|   |-- load_docker_images.sh                    --> 安装脚本
|   |-- acuity_converter_v1.1.tar.gz             --> Docker 映像文件
|   |-- training-server-train_latest.tar.gz      --> Docker 映像文件
|   |-- training-server-importer_latest.tar.gz   --> Docker 映像文件
|   |-- nvidia_cuda_12.1.1-cudnn8-runtime-ubuntu22.04.tar.gz  --> Docker 映像文件
|-- base
|-- base-20260109-165208.tar.gz
|-- workspaces_example
|-- workspaces-example-20251223-135111.tar.gz
|-- INSTALLATION.md

S5. 安装脚本

tar -xzf base-<timestamp>.tar.gz
tar -xzf workspaces-example-<timestamp>.tar.gz
cd docker_images && ./load_docker_images.sh
cd ../base
sudo ./install.sh
cd ../workspaces_example && ./install_workspaces_example.sh   (可选,生成默认示例)

S6. 登录系统

安装完成后,桌面上会出现快捷方式,您也可以通过访问 http://localhost:8080/login 登录。

../../../_images/ai_train_server_setup_6_1.jpg

系统登录界面

在模型训练界面上,使用以下默认凭据登录:

  • 用户名: admin@realtek.com

  • 密码: admin123

登录后您可以更改密码。

系统支持多个用户账户,每个账户拥有独立的工作空间。但由于仅有一个 NVIDIA GPU, 同一时间只能运行一个训练任务。

AI 训练服务器运行指南

AI 训练服务器支持从管理自有数据、仿真测试到设备端测试的完整工作流程。

R1. 登录服务器

确保你可以访问服务器,并使用正确的凭据登录。

R2. 开始训练

成功登录服务器后,你可以:

  • 上传自己的数据集,或从 Hugging Face 下载示例数据集。

  • 调整训练配置。

../../../_images/ai_train_server_run_2.png

导入数据集

数据集的标签可以自动生成。

../../../_images/ai_train_server_run_4.png

自动标注

图像分类训练显示 loss 曲线,而目标检测显示 训练进度

../../../_images/ai_train_server_run_5.png

图像分类显示 loss

../../../_images/ai_train_server_run_6.png

目标检测显示训练进度

该工具提供模型量化(FP32 到 INT8)的 前后对比。如有需要,你还可以下载训练好的 ONNX 和 NB 文件进行进一步的手动对比。

../../../_images/ai_train_server_run_7.png

量化对比

你可以直接在 UI 中定义和管理类别。如需识别新的物体,只需添加一个新类别,系统便会自动将其纳入训练流程。

../../../_images/ai_train_server_run_8.png

添加新类别

备注

理论上,由于初始权重是随机的,不同次运行中模型收敛到完全相同结果的可能性极低。然而,增加训练轮数可以减少结果的差异性。在实际应用中,通常需要多次运行训练。

R3. 下载模型

训练完成后,会出现 下载 按钮。点击该按钮即可下载训练好的模型,用于 RTL IC 芯片。

../../../_images/ai_train_server_run_3.png

"运行"和"下载模型"按钮

备注

目前,Hugging Face 集成主要用于初始测试。暂不支持上传本地训练的模型进行量化和部署,但该功能计划在未来版本中提供。

R4. 模型测试

训练完成后,该工具内置 仿真器,你可以直接观察结果并评估模型。

../../../_images/ai_train_server_run_9.png

实时测试