Generative AI Speech
材料
AMB82-mini x 1
MicroSD 卡
按钮 x1
220 欧姆电阻 x1
范例
GenAISpeech_Whisper
在本范例中,我们将使用开发板录制音频并将其发送到 LLM 服务器进行语音转录或翻译。
在 File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Whisper 中打开 Generative AI Speech Whisper 范例。
在突出显示的代码片段中,将 "ssid" 填入您的 WiFi 网络 SSID,并将 "pass" 填入网络密码。
选择您的 API 服务器并相应地粘贴您的 API 密钥。
根据您的服务器和任务(转录或翻译)修改 api_path。
修改 audio_model 以选择适合您应用需求的 LLM 模型。
您可以在此处修改文件名和录制时长。
按如下方式连接按钮和电阻。
编译并运行范例。
打开串口监视器查看日志。
按住按钮 2 秒,等待绿色 LED 亮起,然后在预设的录制时长内对着麦克风说话。
音频文件的转录或翻译结果将打印在串口监视器上。
备注
请注意,在此范例中,MP4 录制文件将保存到 SD 卡。
GenAISpeech_Gemini
在 File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Gemini 中打开 Generative AI Speech Gemini 范例。
按如下方式连接按钮和电阻。
编译并运行范例。
打开串口监视器查看日志。
按下按钮一次,蓝色 LED 闪烁 3 秒后开始录制,在预设的录制时长内对着麦克风说话。
Gemini 的响应将打印在串口监视器上。
备注
请注意,在此范例中,MP4 录制文件不会保存到 SD 卡。
GenAISpeech_Gemini_LEDControl
在 File -> Examples -> AmebaNN -> MultimediaAI -> GenAISpeech_Gemini_LEDControl 中打开 Generative AI Speech Gemini 范例。
按如下方式连接按钮和电阻。
编译并运行范例。
打开串口监视器查看日志。
按下按钮一次,蓝色 LED 闪烁 3 秒后开始录制,在预设的录制时长内对着麦克风说 "LED ON"。
绿色 LED 随后将点亮。
您也可以尝试相反的操作。
备注
请注意,在此范例中,MP4 录制文件不会保存到 SD 卡。
Online LLM Models
SDK 中集成的各种在线服务器和 LLM 模型:
主机 |
转录端点 |
翻译端点 |
模型 |
速率限制 |
定价 |
|---|---|---|---|---|---|
api.openai.com |
/v1/audio/transcriptions |
/v1/audio/translations |
whisper-1 |
500 RPM |
付费(Tier 1) |
api.groq.com |
/openai/v1/audio/transcriptions |
/openai/v1/audio/translations |
whisper-large-v3-turbo or whisper-large-v3 |
20 RPM |
免费 |
generativelanguage.googleapis.com |
/v1beta/models/<model> |
gemini-2.0-flash |
15 RPM |
免费 |
|
速率限制参考
openAI: https://platform.openai.com/docs/guides/rate-limits?context=tier-one#usage-tiers
GroqCloud: https://console.groq.com/settings/limits
Google AI Studio: https://ai.google.dev/gemini-api/docs/rate-limits

