参考 02:创作方式与音色特征(理论 → 素材的桥)
参考 02:创作方式与音色特征(理论 → 素材的桥)
这是"声音从哪来"的决策文档。创作方式直接决定音色的性格、可变性、成本与工程复杂度。 选错方式会出现典型症状:素材库做的核心武器"听着像买来的"、纯合成的脚步"塑料感"、 程序化引擎"永远调不好听"。
0. 一句话结论
现代商业游戏的主流不是单一方式,而是 Hybrid(混合):
- 有机内核来自真实录制(Foley / 实地录音)→ 提供"不可复制的复杂度"
- 可控骨架来自合成(Sub / 瞬态 / 能量层)→ 提供"穿透力与一致性"
- 连续变化来自程序化调制(参数驱动 / 多段交叉淡化)→ 提供"与物理的绑定感"
- 效率底座来自素材库与批处理 → 提供"覆盖率"
配比经验值(按资产数量):素材库加工 40% / 定制录制 30% / 合成 20% / 程序化 10%。 按玩家感知权重则相反:核心交互音(武器、角色、UI)几乎 100% 是定制的。
1. 音效创作方式全景对比
对比矩阵
| 方式 | 音色性格 | 真实度 | 可变性 | 迭代速度 | 内存 | CPU | 技能门槛 | 版权风险 |
|---|---|---|---|---|---|---|---|---|
| Foley 拟音 | 有机、有表演感、微随机 | ★★★★★ | ★★ | ★★ | 中 | 低 | 中 | 无 |
| 实地录音 | 空间真实、有环境印迹 | ★★★★★ | ★ | ★★ | 大 | 低 | 中 | 低 |
| 商业素材库 | 高质量但同质化 | ★★★★ | ★★ | ★★★★★ | 中 | 低 | 低 | 需核授权 |
| 减法合成 | 干净、可控、偏"电子" | ★★ | ★★★★★ | ★★★★ | 极小 | 低 | 中 | 无 |
| FM / 波表 | 金属、玻璃、可演化 | ★ | ★★★★★ | ★★★ | 极小 | 低-中 | 高 | 无 |
| 颗粒合成 | 云状、纹理化、时间冻结 | ★★ | ★★★★ | ★★ | 极小 | 高 | 高 | 无 |
| 物理建模 | 物理精确、参数响应准 | ★★★★ | ★★★★★ | ★ | 极小 | 中-高 | 极高 | 无 |
| 卷积(IR) | 真实空间/设备染色 | ★★★★★ | ★★★ | ★★★★ | 中 | 高 | 中 | IR 需授权 |
| 运行时程序化 | 连续、无限变化 | ★★★ | ★★★★★ | ★ | 几乎为零 | 中-高 | 极高 | 无 |
| AI 生成 | 快、量大、质量漂移 | ★★★ | ★★★ | ★★★★★ | 中 | 低 | 低 | 高(灰) |
1.1 Foley 拟音(棚内表演录制)
做法:在录音棚用真实道具"演"出动作——踩不同材质、摩擦布料、开关道具、击打材料。
音色特征:
- 有人类表演的呼吸感与微随机,这是合成永远补不上的
- 瞬态自然、谐波复杂、有"重量"
- 天然带有材质真实度(木头的共振、金属的余韵)
优点:独特、有辨识度、无版权风险、可精确匹配动画 缺点:慢(一个脚步组 1–2 人天)、受棚与道具限制、极端音做不出来(爆炸、巨兽、激光)
工程注意:
- 录 96kHz/24bit,留足变调变速余量;交付 48kHz
- 同一动作录 10–20 条 take,从中选 4–8 条做变体(不是录 4 条)
- 必须录**房间静音底噪(room tone)**用于后期降噪采样
- 演员/鞋/道具要固定,否则同一角色前后期音色不一致
适用:脚步、布料、肉搏、道具交互、角色动作 —— 玩家每秒都在听的声音
1.2 实地录音(Field Recording)
做法:去真实环境录自然声——森林、城市、机械、天气、人群。
音色特征:
- 带真实空间印迹(混响、空气、远场),这是最"贵"的部分
- 有偶发的生命感(鸟叫的随机、风的起伏)
- 底噪高(风噪、交通、设备底噪)
优点:空间真实性无可替代、一次录制产出大量素材 缺点:不可控、清理成本高(去噪会连带损失质感)、不同批次一致性差
工程注意:
- 录音时同时录 30s 静音供降噪;用防风毛衣(风噪是头号杀手)
- 环境床(Bed)要录 5–10 分钟无剪辑,循环点才好处理
- 城市/公共场所有肖像权与隐私问题,人群录音需谨慎
适用:环境音床、天气、人群、交通、自然细节
1.3 商业素材库(Boom Library / Soundly / Strata / Pro Sound Effects)
音色特征:
- 制作水准高、动态与频段都已处理到位
- 同质化:同一个库被上千款游戏用过,玩家会有"熟悉感"
- 素材往往"完整度过高"——自带混响与尾巴,反而难集成
优点:极快、覆盖面广、单价远低于自录 缺点:辨识度低、自带处理难拆、授权范围必须核(有的禁商用/禁某些平台/有发行量上限)
工程注意:
- 采购时就要确认:是否覆盖目标平台与发行量、是否允许修改、是否有 voice/用户数限制
- 入库后必须做再处理(去混响、重 EQ、重新分层),直接用会有"拼贴感"
- 建立"已用素材登记",避免同一音效出现在多个项目
适用:次要音效、一次性事件、填充性细节、原型阶段
1.4 减法合成(Subtractive)
做法:振荡器产生富含谐波的波形 → 滤波 + 包络塑形。
音色特征:干净、精准、偏电子/塑料感;缺乏有机复杂度 优点:体积极小(几十字节)、可完全参数化、一致性 100% 缺点:单薄,需叠加噪声/实录层才不"廉价"
适用:UI、科幻界面、能量音、Sub 低频层、激光
1.5 FM / 波表(Wavetable)合成
音色特征:
- FM:金属、钟、玻璃、贝斯、电钢 —— 谐波结构奇特,"冷而硬"
- 波表:音色可连续演化(扫过波表),适合"能量充能""变形"
优点:极小体积、极强的动态演化能力 缺点:参数极度不直观,调一个好音色可能几小时;容易做出"刺耳"的音
适用:科幻武器、能量护盾、变形、Boss 音色、程序化音乐的合成器声部
1.6 颗粒合成(Granular)
做法:把音频切成 10–100ms 的"颗粒",重新排列/重叠/变调播放。
音色特征:云状、雾化、时间被"冻结"或"拉伸"、有金属光泽的纹理 优点:能把任何素材变成氛围/纹理;可做无限长的无重复音床 缺点:CPU 高(每颗粒都是一次播放),移动端慎用;调参抽象
适用:魔法、能量场、异星环境、UI 氛围层、恐怖氛围
1.7 物理建模 / 模态合成(Physical / Modal Modeling)
做法:用数学模型模拟物体振动(模态频率 + 阻尼),输入是"敲击力度/材质/尺寸"。
音色特征:物理准确——同一个"玻璃杯",敲轻敲重、大小不同都自动合理 优点:几乎零内存、参数连续响应、天然无限变体 缺点:实现门槛极高(需 DSP 与物理知识)、单一模态模型只覆盖一类物体、调试周期长
适用:滚动/碰撞/刮擦/破碎、程序化脚步、车辆悬挂、可破坏物
工程现实:完整物理建模在多数项目不划算。常用折中 = 多段采样 + 交叉淡化 + 参数化滤波, 能拿到 80% 的效果、20% 的成本。见
04-engineering-pipeline.md的"伪程序化"模式。
1.8 卷积(Convolution)
做法:用脉冲响应(IR)把干声放进真实空间,或用材料 IR 做染色。
音色特征:真实空间感,算法混响做不出这种细节 优点:空间可信度最高;把廉价素材放进好 IR 会"变贵" 缺点:CPU 高(尤其长 IR);IR 本身需要采购/录制授权
工程注意:
- 运行时卷积混响 ≤ 2 个实例,其余用算法混响
- 也可离线烘焙:把混响烘进素材(牺牲动态,换 CPU)
- 短 IR(< 0.5s)用于"物体染色"(如通过电话/对讲机/头盔)
1.9 运行时程序化(Procedural / Runtime Synthesis)
做法:在引擎里实时合成,输入是游戏物理参数。典型载体:Unreal MetaSounds、自研 DSP、中间件内置合成器。
音色特征:
- 与游戏状态连续绑定——速度快声音就真的连续变化,不是"切换采样"
- 天然无重复、无变体需求
- 风险:容易"不好听"——反馈式的物理准确 ≠ 听感好
优点:内存几乎为零、变化无限、可直接读物理数据(速度/力度/质量) 缺点:CPU 成本、设计门槛极高、调试困难(不能"看波形")、难以做复杂音色
决策原则(重要):
用程序化的三个正当理由:
1. 参数是连续且高频变化的(引擎转速、风、滚动、充能)→ 采样切换会有"台阶感"
2. 变体需求量爆炸(每块碎石的碰撞都不同)
3. 内存极度紧张(超休闲/网页游戏)
除此之外,默认用采样 + 变体 + 随机化 —— 更好听、更省事、更可控。
典型落地:载具引擎、风、火焰、水、滚动/刮擦、节奏类游戏、UI 参数化反馈
1.10 AI 生成音频
现状:文本/参考生成音效与音乐,批量出变体速度快。
音色特征:平均质量不错但风格漂移、细节一致性差、常有"糊"的尾巴 优点:极快的原型与占位、批量变体 缺点:
- 可控性差:很难精确指定"这个金属撞击要 2kHz 的锐度"
- 不可分层:多数只出整轨,无法拆 stems → 与动态音乐系统不兼容
- 版权灰色:训练数据来源不明,多数国家 AI 生成物不受版权保护,商用有风险(部分平台/发行商要求披露 AI 使用)
工程定位(建议):
- ✅ 用于原型占位音、内部演示、白盒阶段
- ✅ 用于生成大量次要变体(如 50 个石头碰撞),再由人工筛选加工
- ❌ 不要直接进最终版本的标志性音效(武器、角色、UI)
- ❌ 不要作为音乐最终交付(无法分层)
- ⚠️ 必须记录 AI 使用清单,发行/审核可能需要披露
2. 音乐创作方式对比
| 方式 | 音色/结构特征 | 交互能力 | 成本 | 风险 |
|---|---|---|---|---|
| 实录乐队 / 录音棚 | 真实演奏动态、有人味 | 低(整轨,难分层) | 极高 | 版权清晰(需签委托) |
| DAW 制作(虚拟乐器 + 少量实录) | 主流方案,风格全覆盖 | 高(天然出 stems) | 中-高 | 需核采样音色库授权 |
| 全合成 / 模块化 | 电子、科幻、冷峻 | 极高(可参数化) | 中 | 无 |
| Stem 分层交付 | 同一 BPM 的多层(鼓/贝斯/和声/旋律/氛围) | 最高(纵向分层的前提) | 中(需作曲配合) | — |
| 程序化 / 生成式音乐 | 无限、随状态演化,音乐性弱 | 极高 | 高(系统开发) | 无 |
| AI 生成音乐 | 快、风格多,但只有整轨 | 几乎为零 | 极低 | 高(版权 + 不可分层) |
关键工程洞见(最容易被踩的坑)
交付格式决定了交互能力。 如果你只需要"一段背景音乐",AI 整轨够用。 如果你要做战斗强度分层 / 探索↔战斗切换,就必须拿到 stems(分轨)+ BPM/节拍网格元数据。 作曲阶段没谈这件事,后期无法补救 —— 只能在整轨上做音量淡入淡出,交互性基本为零。
委托作曲时必须写进合同的交付项
- Stem 分轨:至少
Drums / Bass / Harmony / Melody / Ambience五层,各自完整长度 - 统一 BPM 与节拍网格:所有段落与 Stinger 同 BPM,标注第 1 拍位置
- 无缝 Loop:每个 stem 首尾对齐到小节,可直接循环
- Stinger 集合:击杀、发现、胜利、失败、Boss 登场,同调性
- 元数据:调性、BPM、拍号、段落标记(可选:Music XML / 标记点)
- 源文件授权:明确游戏全平台、全区域、永久、可修改
3. 创作方式决策树
需求进来
│
├─ 参数是否"连续且高频变化"?(引擎/风/滚动/充能)
│ └─ 是 → 程序化合成 / 物理建模 / 多段 loop 交叉淡化
│
├─ 是否需要非现实/极端音色?(激光/魔法/巨兽)
│ └─ 是 → 合成(波表/FM/颗粒) + 实录 sub 层
│
├─ 是否是玩家每秒都在听的核心音?(脚步/武器/UI/角色)
│ └─ 是 → 定制 Foley + 合成层(混合),禁止直接用素材库原样
│
├─ 是否需要真实空间/环境可信度?
│ └─ 是 → 实地录音 / 卷积 IR
│
├─ 是否是量大、次要、一次性的细节?(碎石、远处鸟叫)
│ └─ 是 → 素材库 + 批处理,或 AI 生成 + 人工筛选
│
└─ 时间/预算紧张,或处于原型阶段
└─ 素材库 / AI 占位,标记 TODO 后续替换
4. 混合配方(Hybrid Recipes)—— 现代项目实际怎么用
| 音效 | 层 1(内核) | 层 2(骨架) | 层 3(变化) | 说明 |
|---|---|---|---|---|
| 枪械 | 实地录制的真实枪声 | 合成的 Sub 低频 + 瞬态 | 程序化:室内/室外 tail、连发降调 | 真实感靠实录,穿透力靠合成 |
| 脚步 | Foley 多材质 | 布料/装备 Foley 细节层 | 参数化:速度→音量/滤波;材质 Switch | 纯录制不可行(材质组合爆炸) |
| 载具引擎 | 4–5 段 RPM 实录 loop | 合成的进气/排气层 | 程序化:RPM 交叉淡化 + 负载失真 | 经典"伪程序化"案例 |
| 爆炸 | 素材库/实地爆破 | 合成 Sub + 反向 whoosh | 程序化:碎片随机散布 3D | 碎片用随机容器,别用程序化 |
| 环境 | 实地录音 Bed | 颗粒纹理层 | 程序化:昼夜 RTPC 交叉淡化 | Bed 必录长,纹理用颗粒 |
| UI | 纯合成 | — | 参数化:RTPC 驱动音高 | 合成最合适,别去录 |
| 魔法 | 反向素材(钢琴/钹倒放) | FM/波表扫频 | 程序化:蓄力时长→扫频曲线 | 反向 + 扫频是万能公式 |
| 水体 | 实地录水 | 合成气泡 | 程序化:入水速度→splash 强度 | 强度必须参数化 |
5. 成本模型(用于排期与预算)
| 交付物 | 定制录制 | 素材库加工 | 纯合成 | 程序化系统 |
|---|---|---|---|---|
| 单个简单音效 | 0.5–1 人天 | 0.1–0.3 人天 | 0.2–0.5 人天 | — |
| 一个完整脚步组(5 材质 × 3 步态 × 6 变体) | 5–10 人天 | 2–4 人天 | 不推荐 | 15+ 人天 |
| 一种武器(含变体/室内外/机械/弹壳) | 3–6 人天 | 1–2 人天 | 不推荐 | — |
| 一套 UI(15–30 音) | 不推荐 | 0.5 人天 | 1–3 人天 | — |
| 载具引擎系统 | 2–4 人天 | — | — | 8–15 人天 |
| 1 分钟分层音乐(含 stems) | — | — | 作曲外包 按分钟计价 | — |
排期经验:音频工作量 ≈ 总开发量的 3–8%;音频人力 ≈ 团队的 5–10%(1 个音频对 10–20 人团队是常见配比,且通常是外包 + 1 个内部音频程序)。
6. 选型自检清单
- 这个音是"每秒听"还是"偶尔听"?→ 决定要不要定制
- 参数是否连续变化?→ 决定要不要程序化
- 是否需要非现实音色?→ 决定合成方式
- 素材库授权是否覆盖平台/发行量/修改权?
- 音乐是否拿到了 stems 与 BPM 元数据?(没有 = 交互性归零)
- AI 生成物是否已登记并准备披露?
- 混合配方里,实录层与合成层的频段是否错开?
- 该音效的变体数量是否 ≥ 播放频率所需?(高频播放 ≥ 6 个)