Fish Speech 1.5参数详解max_new_tokens、temperature对语音自然度影响Fish Speech 1.5是一个让人眼前一亮的语音合成工具。它最厉害的地方在于你只需要给它一段10到30秒的录音它就能模仿那个声音帮你生成各种语言的语音而且听起来非常自然。这背后有两个关键参数在默默工作max_new_tokens和temperature。它们就像厨师手里的盐和火候用得好语音就生动自然用得不好效果可能就大打折扣。今天我们就来好好聊聊这两个参数。我会用最直白的话告诉你它们是什么怎么用以及怎么调整才能让Fish Speech 1.5“说”出最动听的话。无论你是刚接触语音合成的新手还是想优化现有应用效果的开发者这篇文章都能给你带来实用的启发。1. 先认识一下我们的“厨师”Fish Speech 1.5在深入调料参数之前我们先快速了解一下这位“厨师”的基本功。1.1 它有什么特别的本事Fish Speech 1.5和很多传统的语音合成工具不太一样。它不需要你事先用大量数据去“训练”它认识某个特定的声音。你给它一段短录音作为参考它就能“克隆”那个音色。无论是中文、英文还是日语、韩语它都能处理这就是所谓的“零样本跨语言合成”能力。它的工作流程可以简单理解为两步理解文本用一个基于LLaMA架构的模型把你输入的文字转换成它自己能理解的“语义表示”。生成声音再用一个叫VQGAN的声码器把上一步的“语义表示”变成我们能听到的、连续的声音波形。整个过程你通过一个简洁的网页界面就能操作输入文字点击生成几秒钟后就能听到结果非常方便。1.2 我们如何与它互动主要有两种方式网页界面WebUI在浏览器里访问适合手动测试、调整参数、即时试听。界面直观左边输入文字和调整滑块右边播放和下载结果。程序接口API通过发送HTTP请求来调用适合集成到你的应用程序、机器人或者进行批量处理。功能更全面比如音色克隆就需要通过API来实现。我们今天讨论的max_new_tokens和temperature这两个参数在两种方式里都可以进行设置和调整。2. 核心参数一max_new_tokens – 控制语音的“长度”首先我们来解决一个最实际的问题我想让AI说一段话怎么控制这段话别太长也别太短2.1 max_new_tokens是什么你可以把max_new_tokens理解成给AI生成语音设定的一个“字数上限”。不过这里说的“字”不是汉字或英文单词而是模型内部用来表示声音的一种基本单位token。这个参数直接决定了生成语音的最大时长。在Fish Speech 1.5的网页界面上它通常体现为一个叫“最大长度”的滑块。在API调用时你需要明确指定这个参数。2.2 它如何影响结果这个参数的影响非常直接设置过小如果文本内容还没说完但token数已经用完了语音就会在中途被“切断”听起来像是话没说完就突然结束了。设置过大对于很短的文本比如“你好”如果设置了一个很大的上限模型在生成完有效内容后可能会继续“脑补”一些无意义的、重复的语音片段导致末尾出现杂音或奇怪的延长音。设置合适语音能够完整、自然地表达全部文本内容并在结束时干净利落地停止。一个简单的类比就像录音机的磁带。max_new_tokens决定了这盘磁带的最大录制长度。话短磁带长后面就是空白噪音话长磁带短录音就被硬生生截断了。2.3 应该怎么设置这里没有万能公式但有一些经验法则默认值是个安全的起点Fish Speech 1.5的默认值通常是1024。对于大多数一两句话的测试这个长度完全足够大概能生成20-30秒的语音。根据文本量估算对于长文本你需要预留足够的空间。一个非常粗略的估计是中文大约1个token对应2-3个字符的语音时长。你可以先按默认值生成如果发现被截断了再按比例增加这个值。在WebUI中动态调整这是最方便的方法。你可以先输入文本用默认值生成一次试听。如果发现话没说完就把滑块向右拉增大数值重新生成。如果发现末尾有多余的静音或杂音就适当减小数值。API调用时的策略在程序中对于未知长度的文本可以设置一个足够大的保守值比如2048同时结合检测生成音频的静音段或能量来判断实际结束点进行后期修剪。代码示例API调用 假设我们通过API生成一段欢迎语音并希望限制其长度。curl -X POST http://127.0.0.1:7861/v1/tts \ -H Content-Type: application/json \ -d { text: 欢迎新用户加入我们的社区希望您在这里能有愉快的体验。, max_new_tokens: 512, temperature: 0.7 } \ --output welcome.wav在这个例子中我们将max_new_tokens设置为512这是一个相对保守的长度适合这句中等长度的中文句子。如果生成的音频不完整下次尝试时可以提高到768或1024。3. 核心参数二temperature – 控制语音的“个性”如果说max_new_tokens管的是“量”那么temperature管的就是“质”它深刻影响着语音听起来是否自然、生动还是有机械感。3.1 temperature是什么temperature参数中文常译为“温度”或“采样温度”它控制着模型生成过程中的“随机性”或“创造性”。你可以这样想象模型在决定下一个发出什么声音时其实心里有一个所有可能声音的“概率排行榜”。temperature就像一个调节阀低温如0.1-0.3模型会变得非常“保守”和“确定”。它几乎总是选择排行榜上排名第一的那个最可能的声音。这样生成的语音非常稳定、可预测但有时会显得单调、机械缺乏真人说话那种细微的起伏和变化。高温如0.8-1.0模型会变得“活跃”和“大胆”。它会给排行榜上排名靠后的声音更多机会。这样生成的语音可能更富有变化、更自然甚至带点个性但同时也增加了出现不连贯、奇怪语调或发音错误的风险。中温如0.5-0.7在保守和冒险之间取得平衡。这是大多数场景下的推荐范围能在保证清晰可懂的前提下赋予语音一定的自然度。3.2 它如何影响语音自然度temperature对听感的影响是多方面的韵律和节奏低温可能导致语速过于均匀像新闻播报机高温可能让语速忽快忽慢更有“人味儿”但也可能失控。音高和语调低温下语调可能平板高温下语调更丰富疑问句的尾音上扬更明显但也可能过于夸张。发音稳定性低温确保每个字发音都标准高温时偶尔可能会为了追求整体流畅性而出现极轻微的连读或音变这有时是好事更自然有时是坏事听不清。关键点没有绝对“正确”的temperature值。它的最佳设置取决于你的具体需求。3.3 针对不同场景如何调整temperature下面这个表格总结了不同场景下的调整思路使用场景推荐temperature范围调整逻辑与期望效果新闻播报/有声书0.4 - 0.6需要清晰、稳定、庄重的发音。稍低的温度能减少不可预测性确保信息准确传递。客服语音/导航提示0.5 - 0.7需要在友好度和稳定性间平衡。中等温度能让语音听起来既亲切又可靠。虚拟角色/游戏配音0.7 - 0.9需要突出个性、情感和表现力。较高的温度可以产生更富有变化的语调让角色更鲜活。创意内容/广告配音0.6 - 0.8需要吸引注意力有一定感染力。温度可以调高一些让语音更有张力和节奏感。最大化清晰度优先0.3 - 0.5当理解内容为第一要务时选择较低温度牺牲部分自然度以换取最高的发音准确性。最大化自然度优先0.7 - 0.9当追求以假乱真的真人感时可以尝试较高温度但需接受偶尔可能出现的小瑕疵。实践建议从默认值开始Fish Speech 1.5的默认temperature通常是0.7这是一个很好的起点。A/B对比测试这是找到最佳值的最有效方法。为同一段文本分别用0.5、0.7、0.9生成三个音频戴上耳机仔细对比听。注意感受哪个听起来最舒服哪个最像真人在说话哪个的发音最让你满意结合文本内容对于情感丰富的诗歌或故事可以试试0.8对于严谨的技术说明可能0.6更合适。注意“过高”的风险当温度设置高于1.0时随机性会变得非常大极易产生难以理解的、混乱的语音一般不建议尝试。4. 参数组合实战让Fish Speech唱出最佳和声max_new_tokens和temperature不是孤立工作的它们需要协同配合。下面我们通过几个具体场景看看如何搭配使用这两个参数。4.1 场景一生成产品介绍短语音需求为一款新APP生成一句15秒左右的广告语要求语音清晰、有活力、能吸引人。文本“探索全新体验[APP名]让你的每一天都充满惊喜。立即下载开启你的专属旅程”分析文本不长需要自然且有感染力的语音。清晰度和活力自然度都需要。参数设置思路先定长度max_new_tokens这句话大概需要15秒默认1024肯定够用。为了更精确可以设一个稍大的值比如512或768避免资源浪费。再调个性temperature为了有活力温度不能太低。但作为广告语发音也必须清晰。因此选择中等偏上的范围。尝试组合组合Amax_new_tokens768,temperature0.75组合Bmax_new_tokens512,temperature0.8分别生成并试听看哪个组合的语音在说完话后停止得最干脆且语调最吸引人。4.2 场景二将长篇文章转换为有声书需求将一篇千字博客文章转换成语音用于通勤时收听。分析这是长文本、连续听感的场景。首要任务是连贯性和舒适度不能听着听着突然断掉或出现怪音。参数设置思路核心挑战长度必须确保max_new_tokens足够大能覆盖文章中最长的句子。建议先对文章进行分句估算最长句子的字符数然后设置一个留有充分余地的值例如根据估算设置1024或更大。更稳妥的做法是使用API并编写脚本自动分段处理长文本。核心追求耐听有声书需要长时间聆听语音应该平稳、自然、不刺耳。过高的temperature可能导致语调起伏过大容易引起听觉疲劳。推荐组合max_new_tokens1024(或根据分句调整)temperature0.6。这个组合偏向稳定和清晰能提供一种温和、可靠的叙述感非常适合长时间收听。后期处理即使参数设置得当生成长音频也建议在后期使用音频编辑软件进行简单的降噪和音量均衡体验会更佳。4.3 场景三为游戏NPC创建独特配音需求为一个性格豪爽的矮人铁匠角色生成几句台词。文本“这把剑哈哈它可是喝过兽人血的你眼光不错伙计。”分析需要极强的表现力和个性甚至可以接受一点点“不完美”来增加角色真实感。参数设置思路释放创造性这是最适合尝试高temperature的场景。目标是让语音跳出“标准朗读者”的框架。长度控制台词本身不长max_new_tokens设为256或512足矣重点在于防止生成多余的、破坏语气的尾音。大胆尝试可以将temperature设置为0.85甚至0.9。你可能会得到一些语调特别夸张、停顿方式很独特的版本从中或许就能找到最符合角色气质的那一版。多次生成择优录取在高温度下多次生成同一句台词结果会有差异。这正是我们想要的——我们可以像导演挑选演员一样从生成的多个版本中选出最“像”那个矮人铁匠的声音。5. 总结与进阶建议通过上面的探讨我们可以看到max_new_tokens和temperature是两个强大而直观的“旋钮”让我们能够精细地调控Fish Speech 1.5的语音输出。5.1 关键要点回顾max_new_tokens是“长度闸门”设得太低语音会被截断设得太高末尾可能产生噪音。从默认值开始根据实际生成音频的完整性进行微调是最佳实践。temperature是“个性调节器”低温求稳清晰但可能机械高温求活自然但可能冒险。0.5-0.7是适用于大多数场景的甜点区。组合使用是关键根据你的场景如清晰播报、生动讲故事、角色扮演来搭配这两个参数。长文本优先保证长度充足和稳定性短文本且追求效果时可以更自由地调整温度。耳朵是最好的裁判参数是死的听感是活的。务必通过A/B对比试听来做最终决定。5.2 给你的进阶建议当你熟练掌握了这两个基本参数后还可以探索以下方面让语音合成更好地为你服务探索音色克隆API功能Fish Speech 1.5的真正潜力在于零样本音色克隆。通过API传入一段参考音频你就能让模型用那个声音说话。这对于创建品牌专属语音助手、为虚拟偶像配音等场景极具价值。关注文本预处理模型生成语音的质量很大程度上也取决于输入文本的质量。确保标点符号正确特别是问号、感叹号会影响语调避免生僻字和特殊符号对于长文本进行合理的分段这些都能提升最终效果。结合后期音频处理生成的WAV文件可以导入到Audacity、Adobe Audition等软件中进行简单的后期处理如降噪、压缩、均衡能让语音听起来更专业。最后记住技术是为创意和目标服务的。Fish Speech 1.5提供了易用的工具而如何运用max_new_tokens和temperature这两个参数调教出最符合你心意的声音这个过程本身就是一种充满乐趣的创作。获取更多AI镜像想探索更多AI镜像和应用场景访问 CSDN星图镜像广场提供丰富的预置镜像覆盖大模型推理、图像生成、视频生成、模型微调等多个领域支持一键部署。
Fish Speech 1.5参数详解:max_new_tokens、temperature对语音自然度影响
Fish Speech 1.5参数详解max_new_tokens、temperature对语音自然度影响Fish Speech 1.5是一个让人眼前一亮的语音合成工具。它最厉害的地方在于你只需要给它一段10到30秒的录音它就能模仿那个声音帮你生成各种语言的语音而且听起来非常自然。这背后有两个关键参数在默默工作max_new_tokens和temperature。它们就像厨师手里的盐和火候用得好语音就生动自然用得不好效果可能就大打折扣。今天我们就来好好聊聊这两个参数。我会用最直白的话告诉你它们是什么怎么用以及怎么调整才能让Fish Speech 1.5“说”出最动听的话。无论你是刚接触语音合成的新手还是想优化现有应用效果的开发者这篇文章都能给你带来实用的启发。1. 先认识一下我们的“厨师”Fish Speech 1.5在深入调料参数之前我们先快速了解一下这位“厨师”的基本功。1.1 它有什么特别的本事Fish Speech 1.5和很多传统的语音合成工具不太一样。它不需要你事先用大量数据去“训练”它认识某个特定的声音。你给它一段短录音作为参考它就能“克隆”那个音色。无论是中文、英文还是日语、韩语它都能处理这就是所谓的“零样本跨语言合成”能力。它的工作流程可以简单理解为两步理解文本用一个基于LLaMA架构的模型把你输入的文字转换成它自己能理解的“语义表示”。生成声音再用一个叫VQGAN的声码器把上一步的“语义表示”变成我们能听到的、连续的声音波形。整个过程你通过一个简洁的网页界面就能操作输入文字点击生成几秒钟后就能听到结果非常方便。1.2 我们如何与它互动主要有两种方式网页界面WebUI在浏览器里访问适合手动测试、调整参数、即时试听。界面直观左边输入文字和调整滑块右边播放和下载结果。程序接口API通过发送HTTP请求来调用适合集成到你的应用程序、机器人或者进行批量处理。功能更全面比如音色克隆就需要通过API来实现。我们今天讨论的max_new_tokens和temperature这两个参数在两种方式里都可以进行设置和调整。2. 核心参数一max_new_tokens – 控制语音的“长度”首先我们来解决一个最实际的问题我想让AI说一段话怎么控制这段话别太长也别太短2.1 max_new_tokens是什么你可以把max_new_tokens理解成给AI生成语音设定的一个“字数上限”。不过这里说的“字”不是汉字或英文单词而是模型内部用来表示声音的一种基本单位token。这个参数直接决定了生成语音的最大时长。在Fish Speech 1.5的网页界面上它通常体现为一个叫“最大长度”的滑块。在API调用时你需要明确指定这个参数。2.2 它如何影响结果这个参数的影响非常直接设置过小如果文本内容还没说完但token数已经用完了语音就会在中途被“切断”听起来像是话没说完就突然结束了。设置过大对于很短的文本比如“你好”如果设置了一个很大的上限模型在生成完有效内容后可能会继续“脑补”一些无意义的、重复的语音片段导致末尾出现杂音或奇怪的延长音。设置合适语音能够完整、自然地表达全部文本内容并在结束时干净利落地停止。一个简单的类比就像录音机的磁带。max_new_tokens决定了这盘磁带的最大录制长度。话短磁带长后面就是空白噪音话长磁带短录音就被硬生生截断了。2.3 应该怎么设置这里没有万能公式但有一些经验法则默认值是个安全的起点Fish Speech 1.5的默认值通常是1024。对于大多数一两句话的测试这个长度完全足够大概能生成20-30秒的语音。根据文本量估算对于长文本你需要预留足够的空间。一个非常粗略的估计是中文大约1个token对应2-3个字符的语音时长。你可以先按默认值生成如果发现被截断了再按比例增加这个值。在WebUI中动态调整这是最方便的方法。你可以先输入文本用默认值生成一次试听。如果发现话没说完就把滑块向右拉增大数值重新生成。如果发现末尾有多余的静音或杂音就适当减小数值。API调用时的策略在程序中对于未知长度的文本可以设置一个足够大的保守值比如2048同时结合检测生成音频的静音段或能量来判断实际结束点进行后期修剪。代码示例API调用 假设我们通过API生成一段欢迎语音并希望限制其长度。curl -X POST http://127.0.0.1:7861/v1/tts \ -H Content-Type: application/json \ -d { text: 欢迎新用户加入我们的社区希望您在这里能有愉快的体验。, max_new_tokens: 512, temperature: 0.7 } \ --output welcome.wav在这个例子中我们将max_new_tokens设置为512这是一个相对保守的长度适合这句中等长度的中文句子。如果生成的音频不完整下次尝试时可以提高到768或1024。3. 核心参数二temperature – 控制语音的“个性”如果说max_new_tokens管的是“量”那么temperature管的就是“质”它深刻影响着语音听起来是否自然、生动还是有机械感。3.1 temperature是什么temperature参数中文常译为“温度”或“采样温度”它控制着模型生成过程中的“随机性”或“创造性”。你可以这样想象模型在决定下一个发出什么声音时其实心里有一个所有可能声音的“概率排行榜”。temperature就像一个调节阀低温如0.1-0.3模型会变得非常“保守”和“确定”。它几乎总是选择排行榜上排名第一的那个最可能的声音。这样生成的语音非常稳定、可预测但有时会显得单调、机械缺乏真人说话那种细微的起伏和变化。高温如0.8-1.0模型会变得“活跃”和“大胆”。它会给排行榜上排名靠后的声音更多机会。这样生成的语音可能更富有变化、更自然甚至带点个性但同时也增加了出现不连贯、奇怪语调或发音错误的风险。中温如0.5-0.7在保守和冒险之间取得平衡。这是大多数场景下的推荐范围能在保证清晰可懂的前提下赋予语音一定的自然度。3.2 它如何影响语音自然度temperature对听感的影响是多方面的韵律和节奏低温可能导致语速过于均匀像新闻播报机高温可能让语速忽快忽慢更有“人味儿”但也可能失控。音高和语调低温下语调可能平板高温下语调更丰富疑问句的尾音上扬更明显但也可能过于夸张。发音稳定性低温确保每个字发音都标准高温时偶尔可能会为了追求整体流畅性而出现极轻微的连读或音变这有时是好事更自然有时是坏事听不清。关键点没有绝对“正确”的temperature值。它的最佳设置取决于你的具体需求。3.3 针对不同场景如何调整temperature下面这个表格总结了不同场景下的调整思路使用场景推荐temperature范围调整逻辑与期望效果新闻播报/有声书0.4 - 0.6需要清晰、稳定、庄重的发音。稍低的温度能减少不可预测性确保信息准确传递。客服语音/导航提示0.5 - 0.7需要在友好度和稳定性间平衡。中等温度能让语音听起来既亲切又可靠。虚拟角色/游戏配音0.7 - 0.9需要突出个性、情感和表现力。较高的温度可以产生更富有变化的语调让角色更鲜活。创意内容/广告配音0.6 - 0.8需要吸引注意力有一定感染力。温度可以调高一些让语音更有张力和节奏感。最大化清晰度优先0.3 - 0.5当理解内容为第一要务时选择较低温度牺牲部分自然度以换取最高的发音准确性。最大化自然度优先0.7 - 0.9当追求以假乱真的真人感时可以尝试较高温度但需接受偶尔可能出现的小瑕疵。实践建议从默认值开始Fish Speech 1.5的默认temperature通常是0.7这是一个很好的起点。A/B对比测试这是找到最佳值的最有效方法。为同一段文本分别用0.5、0.7、0.9生成三个音频戴上耳机仔细对比听。注意感受哪个听起来最舒服哪个最像真人在说话哪个的发音最让你满意结合文本内容对于情感丰富的诗歌或故事可以试试0.8对于严谨的技术说明可能0.6更合适。注意“过高”的风险当温度设置高于1.0时随机性会变得非常大极易产生难以理解的、混乱的语音一般不建议尝试。4. 参数组合实战让Fish Speech唱出最佳和声max_new_tokens和temperature不是孤立工作的它们需要协同配合。下面我们通过几个具体场景看看如何搭配使用这两个参数。4.1 场景一生成产品介绍短语音需求为一款新APP生成一句15秒左右的广告语要求语音清晰、有活力、能吸引人。文本“探索全新体验[APP名]让你的每一天都充满惊喜。立即下载开启你的专属旅程”分析文本不长需要自然且有感染力的语音。清晰度和活力自然度都需要。参数设置思路先定长度max_new_tokens这句话大概需要15秒默认1024肯定够用。为了更精确可以设一个稍大的值比如512或768避免资源浪费。再调个性temperature为了有活力温度不能太低。但作为广告语发音也必须清晰。因此选择中等偏上的范围。尝试组合组合Amax_new_tokens768,temperature0.75组合Bmax_new_tokens512,temperature0.8分别生成并试听看哪个组合的语音在说完话后停止得最干脆且语调最吸引人。4.2 场景二将长篇文章转换为有声书需求将一篇千字博客文章转换成语音用于通勤时收听。分析这是长文本、连续听感的场景。首要任务是连贯性和舒适度不能听着听着突然断掉或出现怪音。参数设置思路核心挑战长度必须确保max_new_tokens足够大能覆盖文章中最长的句子。建议先对文章进行分句估算最长句子的字符数然后设置一个留有充分余地的值例如根据估算设置1024或更大。更稳妥的做法是使用API并编写脚本自动分段处理长文本。核心追求耐听有声书需要长时间聆听语音应该平稳、自然、不刺耳。过高的temperature可能导致语调起伏过大容易引起听觉疲劳。推荐组合max_new_tokens1024(或根据分句调整)temperature0.6。这个组合偏向稳定和清晰能提供一种温和、可靠的叙述感非常适合长时间收听。后期处理即使参数设置得当生成长音频也建议在后期使用音频编辑软件进行简单的降噪和音量均衡体验会更佳。4.3 场景三为游戏NPC创建独特配音需求为一个性格豪爽的矮人铁匠角色生成几句台词。文本“这把剑哈哈它可是喝过兽人血的你眼光不错伙计。”分析需要极强的表现力和个性甚至可以接受一点点“不完美”来增加角色真实感。参数设置思路释放创造性这是最适合尝试高temperature的场景。目标是让语音跳出“标准朗读者”的框架。长度控制台词本身不长max_new_tokens设为256或512足矣重点在于防止生成多余的、破坏语气的尾音。大胆尝试可以将temperature设置为0.85甚至0.9。你可能会得到一些语调特别夸张、停顿方式很独特的版本从中或许就能找到最符合角色气质的那一版。多次生成择优录取在高温度下多次生成同一句台词结果会有差异。这正是我们想要的——我们可以像导演挑选演员一样从生成的多个版本中选出最“像”那个矮人铁匠的声音。5. 总结与进阶建议通过上面的探讨我们可以看到max_new_tokens和temperature是两个强大而直观的“旋钮”让我们能够精细地调控Fish Speech 1.5的语音输出。5.1 关键要点回顾max_new_tokens是“长度闸门”设得太低语音会被截断设得太高末尾可能产生噪音。从默认值开始根据实际生成音频的完整性进行微调是最佳实践。temperature是“个性调节器”低温求稳清晰但可能机械高温求活自然但可能冒险。0.5-0.7是适用于大多数场景的甜点区。组合使用是关键根据你的场景如清晰播报、生动讲故事、角色扮演来搭配这两个参数。长文本优先保证长度充足和稳定性短文本且追求效果时可以更自由地调整温度。耳朵是最好的裁判参数是死的听感是活的。务必通过A/B对比试听来做最终决定。5.2 给你的进阶建议当你熟练掌握了这两个基本参数后还可以探索以下方面让语音合成更好地为你服务探索音色克隆API功能Fish Speech 1.5的真正潜力在于零样本音色克隆。通过API传入一段参考音频你就能让模型用那个声音说话。这对于创建品牌专属语音助手、为虚拟偶像配音等场景极具价值。关注文本预处理模型生成语音的质量很大程度上也取决于输入文本的质量。确保标点符号正确特别是问号、感叹号会影响语调避免生僻字和特殊符号对于长文本进行合理的分段这些都能提升最终效果。结合后期音频处理生成的WAV文件可以导入到Audacity、Adobe Audition等软件中进行简单的后期处理如降噪、压缩、均衡能让语音听起来更专业。最后记住技术是为创意和目标服务的。Fish Speech 1.5提供了易用的工具而如何运用max_new_tokens和temperature这两个参数调教出最符合你心意的声音这个过程本身就是一种充满乐趣的创作。获取更多AI镜像想探索更多AI镜像和应用场景访问 CSDN星图镜像广场提供丰富的预置镜像覆盖大模型推理、图像生成、视频生成、模型微调等多个领域支持一键部署。