Axıs
技能目录

参考 02:创作方式与音色特征(理论 → 素材的桥)

参考 02:创作方式与音色特征(理论 → 素材的桥)

这是"声音从哪来"的决策文档。创作方式直接决定音色的性格、可变性、成本与工程复杂度。 选错方式会出现典型症状:素材库做的核心武器"听着像买来的"、纯合成的脚步"塑料感"、 程序化引擎"永远调不好听"。


0. 一句话结论

现代商业游戏的主流不是单一方式,而是 Hybrid(混合):

  • 有机内核来自真实录制(Foley / 实地录音)→ 提供"不可复制的复杂度"
  • 可控骨架来自合成(Sub / 瞬态 / 能量层)→ 提供"穿透力与一致性"
  • 连续变化来自程序化调制(参数驱动 / 多段交叉淡化)→ 提供"与物理的绑定感"
  • 效率底座来自素材库与批处理 → 提供"覆盖率"

配比经验值(按资产数量):素材库加工 40% / 定制录制 30% / 合成 20% / 程序化 10%。 按玩家感知权重则相反:核心交互音(武器、角色、UI)几乎 100% 是定制的。


1. 音效创作方式全景对比

对比矩阵

方式 音色性格 真实度 可变性 迭代速度 内存 CPU 技能门槛 版权风险
Foley 拟音 有机、有表演感、微随机 ★★★★★ ★★ ★★ 中 低 中 无
实地录音 空间真实、有环境印迹 ★★★★★ ★ ★★ 大 低 中 低
商业素材库 高质量但同质化 ★★★★ ★★ ★★★★★ 中 低 低 需核授权
减法合成 干净、可控、偏"电子" ★★ ★★★★★ ★★★★ 极小 低 中 无
FM / 波表 金属、玻璃、可演化 ★ ★★★★★ ★★★ 极小 低-中 高 无
颗粒合成 云状、纹理化、时间冻结 ★★ ★★★★ ★★ 极小 高 高 无
物理建模 物理精确、参数响应准 ★★★★ ★★★★★ ★ 极小 中-高 极高 无
卷积(IR) 真实空间/设备染色 ★★★★★ ★★★ ★★★★ 中 高 中 IR 需授权
运行时程序化 连续、无限变化 ★★★ ★★★★★ ★ 几乎为零 中-高 极高 无
AI 生成 快、量大、质量漂移 ★★★ ★★★ ★★★★★ 中 低 低 高(灰)

1.1 Foley 拟音(棚内表演录制)

做法:在录音棚用真实道具"演"出动作——踩不同材质、摩擦布料、开关道具、击打材料。

音色特征:

  • 有人类表演的呼吸感与微随机,这是合成永远补不上的
  • 瞬态自然、谐波复杂、有"重量"
  • 天然带有材质真实度(木头的共振、金属的余韵)

优点:独特、有辨识度、无版权风险、可精确匹配动画 缺点:慢(一个脚步组 1–2 人天)、受棚与道具限制、极端音做不出来(爆炸、巨兽、激光)

工程注意:

  • 录 96kHz/24bit,留足变调变速余量;交付 48kHz
  • 同一动作录 10–20 条 take,从中选 4–8 条做变体(不是录 4 条)
  • 必须录**房间静音底噪(room tone)**用于后期降噪采样
  • 演员/鞋/道具要固定,否则同一角色前后期音色不一致

适用:脚步、布料、肉搏、道具交互、角色动作 —— 玩家每秒都在听的声音


1.2 实地录音(Field Recording)

做法:去真实环境录自然声——森林、城市、机械、天气、人群。

音色特征:

  • 带真实空间印迹(混响、空气、远场),这是最"贵"的部分
  • 有偶发的生命感(鸟叫的随机、风的起伏)
  • 底噪高(风噪、交通、设备底噪)

优点:空间真实性无可替代、一次录制产出大量素材 缺点:不可控、清理成本高(去噪会连带损失质感)、不同批次一致性差

工程注意:

  • 录音时同时录 30s 静音供降噪;用防风毛衣(风噪是头号杀手)
  • 环境床(Bed)要录 5–10 分钟无剪辑,循环点才好处理
  • 城市/公共场所有肖像权与隐私问题,人群录音需谨慎

适用:环境音床、天气、人群、交通、自然细节


1.3 商业素材库(Boom Library / Soundly / Strata / Pro Sound Effects)

音色特征:

  • 制作水准高、动态与频段都已处理到位
  • 同质化:同一个库被上千款游戏用过,玩家会有"熟悉感"
  • 素材往往"完整度过高"——自带混响与尾巴,反而难集成

优点:极快、覆盖面广、单价远低于自录 缺点:辨识度低、自带处理难拆、授权范围必须核(有的禁商用/禁某些平台/有发行量上限)

工程注意:

  • 采购时就要确认:是否覆盖目标平台与发行量、是否允许修改、是否有 voice/用户数限制
  • 入库后必须做再处理(去混响、重 EQ、重新分层),直接用会有"拼贴感"
  • 建立"已用素材登记",避免同一音效出现在多个项目

适用:次要音效、一次性事件、填充性细节、原型阶段


1.4 减法合成(Subtractive)

做法:振荡器产生富含谐波的波形 → 滤波 + 包络塑形。

音色特征:干净、精准、偏电子/塑料感;缺乏有机复杂度 优点:体积极小(几十字节)、可完全参数化、一致性 100% 缺点:单薄,需叠加噪声/实录层才不"廉价"

适用:UI、科幻界面、能量音、Sub 低频层、激光


1.5 FM / 波表(Wavetable)合成

音色特征:

  • FM:金属、钟、玻璃、贝斯、电钢 —— 谐波结构奇特,"冷而硬"
  • 波表:音色可连续演化(扫过波表),适合"能量充能""变形"

优点:极小体积、极强的动态演化能力 缺点:参数极度不直观,调一个好音色可能几小时;容易做出"刺耳"的音

适用:科幻武器、能量护盾、变形、Boss 音色、程序化音乐的合成器声部


1.6 颗粒合成(Granular)

做法:把音频切成 10–100ms 的"颗粒",重新排列/重叠/变调播放。

音色特征:云状、雾化、时间被"冻结"或"拉伸"、有金属光泽的纹理 优点:能把任何素材变成氛围/纹理;可做无限长的无重复音床 缺点:CPU 高(每颗粒都是一次播放),移动端慎用;调参抽象

适用:魔法、能量场、异星环境、UI 氛围层、恐怖氛围


1.7 物理建模 / 模态合成(Physical / Modal Modeling)

做法:用数学模型模拟物体振动(模态频率 + 阻尼),输入是"敲击力度/材质/尺寸"。

音色特征:物理准确——同一个"玻璃杯",敲轻敲重、大小不同都自动合理 优点:几乎零内存、参数连续响应、天然无限变体 缺点:实现门槛极高(需 DSP 与物理知识)、单一模态模型只覆盖一类物体、调试周期长

适用:滚动/碰撞/刮擦/破碎、程序化脚步、车辆悬挂、可破坏物

工程现实:完整物理建模在多数项目不划算。常用折中 = 多段采样 + 交叉淡化 + 参数化滤波, 能拿到 80% 的效果、20% 的成本。见 04-engineering-pipeline.md 的"伪程序化"模式。


1.8 卷积(Convolution)

做法:用脉冲响应(IR)把干声放进真实空间,或用材料 IR 做染色。

音色特征:真实空间感,算法混响做不出这种细节 优点:空间可信度最高;把廉价素材放进好 IR 会"变贵" 缺点:CPU 高(尤其长 IR);IR 本身需要采购/录制授权

工程注意:

  • 运行时卷积混响 ≤ 2 个实例,其余用算法混响
  • 也可离线烘焙:把混响烘进素材(牺牲动态,换 CPU)
  • 短 IR(< 0.5s)用于"物体染色"(如通过电话/对讲机/头盔)

1.9 运行时程序化(Procedural / Runtime Synthesis)

做法:在引擎里实时合成,输入是游戏物理参数。典型载体:Unreal MetaSounds、自研 DSP、中间件内置合成器。

音色特征:

  • 与游戏状态连续绑定——速度快声音就真的连续变化,不是"切换采样"
  • 天然无重复、无变体需求
  • 风险:容易"不好听"——反馈式的物理准确 ≠ 听感好

优点:内存几乎为零、变化无限、可直接读物理数据(速度/力度/质量) 缺点:CPU 成本、设计门槛极高、调试困难(不能"看波形")、难以做复杂音色

决策原则(重要):

用程序化的三个正当理由:
1. 参数是连续且高频变化的(引擎转速、风、滚动、充能)→ 采样切换会有"台阶感"
2. 变体需求量爆炸(每块碎石的碰撞都不同)
3. 内存极度紧张(超休闲/网页游戏)
除此之外,默认用采样 + 变体 + 随机化 —— 更好听、更省事、更可控。

典型落地:载具引擎、风、火焰、水、滚动/刮擦、节奏类游戏、UI 参数化反馈


1.10 AI 生成音频

现状:文本/参考生成音效与音乐,批量出变体速度快。

音色特征:平均质量不错但风格漂移、细节一致性差、常有"糊"的尾巴 优点:极快的原型与占位、批量变体 缺点:

  • 可控性差:很难精确指定"这个金属撞击要 2kHz 的锐度"
  • 不可分层:多数只出整轨,无法拆 stems → 与动态音乐系统不兼容
  • 版权灰色:训练数据来源不明,多数国家 AI 生成物不受版权保护,商用有风险(部分平台/发行商要求披露 AI 使用)

工程定位(建议):

  • ✅ 用于原型占位音、内部演示、白盒阶段
  • ✅ 用于生成大量次要变体(如 50 个石头碰撞),再由人工筛选加工
  • ❌ 不要直接进最终版本的标志性音效(武器、角色、UI)
  • ❌ 不要作为音乐最终交付(无法分层)
  • ⚠️ 必须记录 AI 使用清单,发行/审核可能需要披露

2. 音乐创作方式对比

方式 音色/结构特征 交互能力 成本 风险
实录乐队 / 录音棚 真实演奏动态、有人味 低(整轨,难分层) 极高 版权清晰(需签委托)
DAW 制作(虚拟乐器 + 少量实录) 主流方案,风格全覆盖 高(天然出 stems) 中-高 需核采样音色库授权
全合成 / 模块化 电子、科幻、冷峻 极高(可参数化) 中 无
Stem 分层交付 同一 BPM 的多层(鼓/贝斯/和声/旋律/氛围) 最高(纵向分层的前提) 中(需作曲配合) —
程序化 / 生成式音乐 无限、随状态演化,音乐性弱 极高 高(系统开发) 无
AI 生成音乐 快、风格多,但只有整轨 几乎为零 极低 高(版权 + 不可分层)

关键工程洞见(最容易被踩的坑)

交付格式决定了交互能力。 如果你只需要"一段背景音乐",AI 整轨够用。 如果你要做战斗强度分层 / 探索↔战斗切换,就必须拿到 stems(分轨)+ BPM/节拍网格元数据。 作曲阶段没谈这件事,后期无法补救 —— 只能在整轨上做音量淡入淡出,交互性基本为零。

委托作曲时必须写进合同的交付项

  1. Stem 分轨:至少 Drums / Bass / Harmony / Melody / Ambience 五层,各自完整长度
  2. 统一 BPM 与节拍网格:所有段落与 Stinger 同 BPM,标注第 1 拍位置
  3. 无缝 Loop:每个 stem 首尾对齐到小节,可直接循环
  4. Stinger 集合:击杀、发现、胜利、失败、Boss 登场,同调性
  5. 元数据:调性、BPM、拍号、段落标记(可选:Music XML / 标记点)
  6. 源文件授权:明确游戏全平台、全区域、永久、可修改

3. 创作方式决策树

需求进来
  │
  ├─ 参数是否"连续且高频变化"?(引擎/风/滚动/充能)
  │     └─ 是 → 程序化合成 / 物理建模 / 多段 loop 交叉淡化
  │
  ├─ 是否需要非现实/极端音色?(激光/魔法/巨兽)
  │     └─ 是 → 合成(波表/FM/颗粒) + 实录 sub 层
  │
  ├─ 是否是玩家每秒都在听的核心音?(脚步/武器/UI/角色)
  │     └─ 是 → 定制 Foley + 合成层(混合),禁止直接用素材库原样
  │
  ├─ 是否需要真实空间/环境可信度?
  │     └─ 是 → 实地录音 / 卷积 IR
  │
  ├─ 是否是量大、次要、一次性的细节?(碎石、远处鸟叫)
  │     └─ 是 → 素材库 + 批处理,或 AI 生成 + 人工筛选
  │
  └─ 时间/预算紧张,或处于原型阶段
        └─ 素材库 / AI 占位,标记 TODO 后续替换

4. 混合配方(Hybrid Recipes)—— 现代项目实际怎么用

音效 层 1(内核) 层 2(骨架) 层 3(变化) 说明
枪械 实地录制的真实枪声 合成的 Sub 低频 + 瞬态 程序化:室内/室外 tail、连发降调 真实感靠实录,穿透力靠合成
脚步 Foley 多材质 布料/装备 Foley 细节层 参数化:速度→音量/滤波;材质 Switch 纯录制不可行(材质组合爆炸)
载具引擎 4–5 段 RPM 实录 loop 合成的进气/排气层 程序化:RPM 交叉淡化 + 负载失真 经典"伪程序化"案例
爆炸 素材库/实地爆破 合成 Sub + 反向 whoosh 程序化:碎片随机散布 3D 碎片用随机容器,别用程序化
环境 实地录音 Bed 颗粒纹理层 程序化:昼夜 RTPC 交叉淡化 Bed 必录长,纹理用颗粒
UI 纯合成 — 参数化:RTPC 驱动音高 合成最合适,别去录
魔法 反向素材(钢琴/钹倒放) FM/波表扫频 程序化:蓄力时长→扫频曲线 反向 + 扫频是万能公式
水体 实地录水 合成气泡 程序化:入水速度→splash 强度 强度必须参数化

5. 成本模型(用于排期与预算)

交付物 定制录制 素材库加工 纯合成 程序化系统
单个简单音效 0.5–1 人天 0.1–0.3 人天 0.2–0.5 人天 —
一个完整脚步组(5 材质 × 3 步态 × 6 变体) 5–10 人天 2–4 人天 不推荐 15+ 人天
一种武器(含变体/室内外/机械/弹壳) 3–6 人天 1–2 人天 不推荐 —
一套 UI(15–30 音) 不推荐 0.5 人天 1–3 人天 —
载具引擎系统 2–4 人天 — — 8–15 人天
1 分钟分层音乐(含 stems) — — 作曲外包 按分钟计价 —

排期经验:音频工作量 ≈ 总开发量的 3–8%;音频人力 ≈ 团队的 5–10%(1 个音频对 10–20 人团队是常见配比,且通常是外包 + 1 个内部音频程序)。


6. 选型自检清单

  • 这个音是"每秒听"还是"偶尔听"?→ 决定要不要定制
  • 参数是否连续变化?→ 决定要不要程序化
  • 是否需要非现实音色?→ 决定合成方式
  • 素材库授权是否覆盖平台/发行量/修改权?
  • 音乐是否拿到了 stems 与 BPM 元数据?(没有 = 交互性归零)
  • AI 生成物是否已登记并准备披露?
  • 混合配方里,实录层与合成层的频段是否错开?
  • 该音效的变体数量是否 ≥ 播放频率所需?(高频播放 ≥ 6 个)