Generative AI Speech

备注

image_3rd_party "Generative AI Speech" 由 RTKSG SD3 与 ChungYi Fu(高雄,台湾) 联合开发

image_ameba_iot 特别感谢所有开发者的努力与贡献。

材料

  • AMB82-mini x 1

  • MicroSD 卡

  • 按钮 x1

  • 220 欧姆电阻 x1

范例

GenAISpeech_Whisper

在本范例中,我们将使用开发板录制音频并将其发送到 LLM 服务器进行语音转录或翻译。

File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Whisper 中打开 Generative AI Speech Whisper 范例。

../../_images/image016.png

在突出显示的代码片段中,将 "ssid" 填入您的 WiFi 网络 SSID,并将 "pass" 填入网络密码。

../../_images/image026.png

选择您的 API 服务器并相应地粘贴您的 API 密钥。

根据您的服务器和任务(转录或翻译)修改 api_path

修改 audio_model 以选择适合您应用需求的 LLM 模型。

../../_images/image036.png

您可以在此处修改文件名和录制时长。

../../_images/image045.png

按如下方式连接按钮和电阻。

../../_images/image055.png

编译并运行范例。

打开串口监视器查看日志。

按住按钮 2 秒,等待绿色 LED 亮起,然后在预设的录制时长内对着麦克风说话。

音频文件的转录或翻译结果将打印在串口监视器上。

备注

请注意,在此范例中,MP4 录制文件将保存到 SD 卡。

GenAISpeech_Gemini

File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Gemini 中打开 Generative AI Speech Gemini 范例。

../../_images/image064.png
将 "ssid" 填入您的 WiFi 网络 SSID,并将 "pass" 填入网络密码。
然后,填入您的 Gemini API 密钥。
您也可以修改录制时长和文件名。
../../_images/image073.png

按如下方式连接按钮和电阻。

../../_images/image055.png

编译并运行范例。

打开串口监视器查看日志。

按下按钮一次,蓝色 LED 闪烁 3 秒后开始录制,在预设的录制时长内对着麦克风说话。

Gemini 的响应将打印在串口监视器上。

备注

请注意,在此范例中,MP4 录制文件不会保存到 SD 卡。

GenAISpeech_Gemini_LEDControl

File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Gemini_LEDControl 中打开 Generative AI Speech Gemini 范例。

../../_images/image083.png
将 "ssid" 填入您的 WiFi 网络 SSID,并将 "pass" 填入网络密码。
然后,填入您的 Gemini API 密钥。
../../_images/image092.png

按如下方式连接按钮和电阻。

../../_images/image055.png

编译并运行范例。

打开串口监视器查看日志。

按下按钮一次,蓝色 LED 闪烁 3 秒后开始录制,在预设的录制时长内对着麦克风说 "LED ON"。

绿色 LED 随后将点亮。

您也可以尝试相反的操作。

备注

请注意,在此范例中,MP4 录制文件不会保存到 SD 卡。

Online LLM Models

SDK 中集成的各种在线服务器和 LLM 模型:

主机

转录端点

翻译端点

模型

速率限制

定价

api.openai.com

/v1/audio/transcriptions

/v1/audio/translations

whisper-1

500 RPM

付费(Tier 1)

api.groq.com

/openai/v1/audio/transcriptions

/openai/v1/audio/translations

whisper-large-v3-turbo or whisper-large-v3

20 RPM

免费

generativelanguage.googleapis.com

/v1beta/models/<model>

gemini-2.0-flash

15 RPM

免费

速率限制参考

openAI: https://platform.openai.com/docs/guides/rate-limits?context=tier-one#usage-tiers

GroqCloud: https://console.groq.com/settings/limits

Google AI Studio: https://ai.google.dev/gemini-api/docs/rate-limits

Resources