CM588RK182X组合布署Qwen3-TTS文字转语音模型Part1一模型介绍Qwen3-TTS是阿里云通义千问团队开发的旗舰语音合成模型支持多音色、多语种和多方言目前可通过Qwen API访问。主要改进包括更加丰富的音色支持多语种多方言能力持续增强以及韵律/语速更加自然、更拟人化。 [1]模型支持包括中文、英文在内的10种主流语言及多种方言。 [2] [8]2026年1月22日Qwen3-TTS多码本全系列模型已开源二代码架构分析2-1): 整体架构Qwen3-TTS 原始 PyTorch 模型被拆成 5 个可独立部署的子模块外加静态 embedding 表设计思路Talker 是 1.7B 级 LLM走 RKNN3 LLM 接口KV cache、异步推理text_projector / speech_decoder 是小网络走普通 RKNNembedding 表直接 mmap 加载避免重复计算。2-2): 目录结构3-3Python 导出3-3-1): 基础配置源模型CKPT/Qwen3-TTS-12Hz-1.7B-Base流程PyTorch → ONNX → RKNNrknn3-toolkit目标平台默认 rk1828量化talker 用 GRQ 校准集code_predictor 量化无 datasettext_projector / speech_decoder 默认不量化3-3-1): 各模块详情embeds — export_embeds.pytext_projector — export_text_projector_onnx.py子模块model.talker.text_projectionResizeMLP输入text_embed [1, 512, text_hidden_size]输出text_projection [1, 512, 2048]RKNNw4a16do_quantizationFalsetalker — export_talker_onnx.py放在Part2了。code_predictor — export_code_predictor_onnx.py放在Part2了speech_decoder — export_speech_decoder_onnx.py放在Part2了特殊脚本 — export_speaker_embed_hpp.py放在Part2了3-4C 板端运行时放在Part2了三模型导出2-1导出基础 Embeds放在Part2了四转换结果4-1听听--------------Max new token reached-------------talker_output_callback: state 3talker_output_callback: 处理 Tensor [0], Index 0, Name logits, Shape [1, 1, 3072]talker_output_callback: 处理 Tensor [1], Index 1, Name past_hidden, Shape [1, 1, 2048]--------------------TALKER 123 New Tokens--------------------2150--------------------Finished--------------------decoded chunk samples42240, total_samples232575saved wav to ./output/output.wav #保存在板子端目录playing wav: ./output/output.wav #直接在主板端播放出来
CM588+RK182X组合布署Qwen3-TTS文字转语音模型Part1
CM588RK182X组合布署Qwen3-TTS文字转语音模型Part1一模型介绍Qwen3-TTS是阿里云通义千问团队开发的旗舰语音合成模型支持多音色、多语种和多方言目前可通过Qwen API访问。主要改进包括更加丰富的音色支持多语种多方言能力持续增强以及韵律/语速更加自然、更拟人化。 [1]模型支持包括中文、英文在内的10种主流语言及多种方言。 [2] [8]2026年1月22日Qwen3-TTS多码本全系列模型已开源二代码架构分析2-1): 整体架构Qwen3-TTS 原始 PyTorch 模型被拆成 5 个可独立部署的子模块外加静态 embedding 表设计思路Talker 是 1.7B 级 LLM走 RKNN3 LLM 接口KV cache、异步推理text_projector / speech_decoder 是小网络走普通 RKNNembedding 表直接 mmap 加载避免重复计算。2-2): 目录结构3-3Python 导出3-3-1): 基础配置源模型CKPT/Qwen3-TTS-12Hz-1.7B-Base流程PyTorch → ONNX → RKNNrknn3-toolkit目标平台默认 rk1828量化talker 用 GRQ 校准集code_predictor 量化无 datasettext_projector / speech_decoder 默认不量化3-3-1): 各模块详情embeds — export_embeds.pytext_projector — export_text_projector_onnx.py子模块model.talker.text_projectionResizeMLP输入text_embed [1, 512, text_hidden_size]输出text_projection [1, 512, 2048]RKNNw4a16do_quantizationFalsetalker — export_talker_onnx.py放在Part2了。code_predictor — export_code_predictor_onnx.py放在Part2了speech_decoder — export_speech_decoder_onnx.py放在Part2了特殊脚本 — export_speaker_embed_hpp.py放在Part2了3-4C 板端运行时放在Part2了三模型导出2-1导出基础 Embeds放在Part2了四转换结果4-1听听--------------Max new token reached-------------talker_output_callback: state 3talker_output_callback: 处理 Tensor [0], Index 0, Name logits, Shape [1, 1, 3072]talker_output_callback: 处理 Tensor [1], Index 1, Name past_hidden, Shape [1, 1, 2048]--------------------TALKER 123 New Tokens--------------------2150--------------------Finished--------------------decoded chunk samples42240, total_samples232575saved wav to ./output/output.wav #保存在板子端目录playing wav: ./output/output.wav #直接在主板端播放出来