数据截至 (上游 commit c49982eb3aea)
人格与声音:系统提示、声音库与声音克隆
30 秒导读: 前面几章(01-04)讲的是"音频怎么进、文字怎么出、什么时候该说话"的实时管线。这一章讲一件相对独立的事:这个语音助手的"人是谁"从哪来——它说什么语言、什么口吻、用哪把嗓子、遇到静音怎么办、怎么把你自己的声音克隆进去。答案全在三处:一个模板化的系统提示、一个 YAML 声音库、一条声音克隆/捐赠链路。
本章几乎不碰实时循环(那是 01-orchestration-loop 的事),只回答一个问题:对话的"个性"是怎么被组装出来的。
1. 这是什么(零基础也能懂)
一句话定义: Unmute 给任意文本 LLM 装上"耳朵和嘴"。但同一个 LLM 可以是冷幽默的英国问答主持人,也可以是温柔的人生导师 Gertrude,还可以用你昨天录的 10 秒声音说话。决定这些的,就是本章讲的"人格与声音"层。
它由三块拼成:
| 拼块 | 管什么 | 住在哪 |
|---|---|---|
| 系统提示(system prompt) | 语言、口吻、静音规则、结束规则、"你是谁" | unmute/llm/system_prompt.py |
| 声音库(voice library) | 有哪些嗓子可选,每把嗓子配什么人格 | voices.yaml + unmute/tts/voices.py |