Axıs
技能目录

16 · 原型、试玩与止损

16 · 原型、试玩与止损

1. 原型四级门闸

核心原则:原型只回答一个问题,答完即弃(throwaway)。

阶段 要回答的问题 投入 进入下一阶段的门槛
纸面 / 桌面原型 规则自洽吗?决策有意义吗? 1–3 天,纸+骰子 3 局内出现"非显然的最优解争夺",玩家主动想再来一局
Wizard of Oz 含 AI/对话/动态系统时:玩家会相信这个系统吗? 1–2 天,人肉冒充系统 玩家对"系统"产生预期与情绪反应,而非对操作者
灰盒 / 可玩原型 核心循环的手感与节奏成立吗? 1–4 周,无美术 陌生人无提示可完成 1 个完整循环;自愿重玩率 > 50%;能说出"我想试试那样"
垂直切片 这条管线能复制到成品品质吗? 2–4 个月,1 个关卡/流程 外部试玩者认为"这就是成品";可据此倒推单位内容成本
内容生产 按已验证模板批量复制 剩余工期 单位内容成本 ≤ 预算、质量不衰减

关键区分:垂直切片 ≠ 游戏做完 1/N。 它是"品质基准 + 成本模型"的证明,不是进度条。做完切片后你才知道还要做多少、每个单位多少钱 —— 切片做完才发现 scope 爆炸,正是切片的价值。

各阶段的禁止事项

阶段 禁止
纸面/桌面 写代码
灰盒 任何美术投入
垂直切片 量产内容
内容生产 改核心玩法

2. Playtest 十二步

  1. 写可证伪假设:"新手能在 90 秒内不提示完成第一次合成",而非"看看新手引导行不行"
  2. 定样本量:单轮 5 人(Nielsen:5 人可发现 ~85% 可用性问题);多轮 > 单轮人数,修完再测下一批;定量验证需 30+ 人
  3. 招募画像匹配者,禁用团队成员与熟人
  4. 准备:稳定 build + 埋点(时长/死亡点/放弃点/重试)+ 录屏(含面部)+ 观察记录表
  5. 开场脚本:"测的是游戏不是你"、"卡住是你没做好,请说出来"、"可随时退出"(退出点本身是极强数据)
  6. 沉默观察 + think aloud:全程不解释、不提示、不代操作。玩家提问就反问:"你觉得它应该是干什么的?"
  7. 定量采集:首次卡顿时刻、单关卡滞留时长、重试次数、未使用功能、退出点分布
  8. 定性采集(FFWWDD 六问):最挫败的瞬间?最喜欢的瞬间?想做却做不到的?给你一根魔杖你会改什么?你刚才在做什么?你会怎么向朋友描述这游戏?(第 6 问用于检测创作者意图 vs 玩家感知的错位)
  9. 先开放式后追问,顺序固定以便跨轮对比
  10. 分层提问:先具体回忆("记得哪些道具?"),再评价("第三个陷阱怎么样?"),绝不先问"是不是太难了"
  11. 24 小时内 debrief:观察分为"已确认问题 / 疑似问题 / 单点噪音",只有重复出现 ≥3 次才进 backlog
  12. 产出决策:改 / 砍 / 再测,并在下一轮验证上次的修改是否生效

禁忌清单

  • 替玩家操作
  • 解释机制
  • 问"你觉得好玩吗"
  • 把玩家建议当需求直接实现(要问背后的问题)
  • 一轮塞 20 人
  • 边测边改 build
  • 只测团队成员和好友

定性 vs 定量的边界

数据告诉你"哪里",玩家告诉你"为什么"。 漏斗掉点用数据;核心乐趣无法用留存率证明,只能靠观察表情与重玩意愿判断。

小团队成本:每周 3–5 人 × 45 分钟即可覆盖绝大多数问题。不必买实验室,买习惯。

3. Kill Criteria(止损)

三字段写法:指标 / 阈值 / 日历日期。 立项时写死,每周一检查。

示例 指标 阈值 日期
原型第 3 次迭代后,5 名外部玩家中自愿重玩人数 < 2 人 砍 2026-05-01
灰盒阶段 30 名试玩者首次 30 分钟留存 < 40% 机制重构或砍 2026-07-15
垂直切片单位关卡成本 > 预算 1.5 倍 缩 scope 2026-09-30

经验数据:预设 ≥3 条 kill criteria 的团队平均提前 4.2 个月止损;触发后强行 override 的,71% 在 12 周内还是死了。

触发不是获得新信息,是获得行动许可。

Kill 文化:砍掉原型 ≠ 失败。机制资产可迁移(Dead Cells 从失败的塔防转型而来)。庆祝 kill,把释放的人力投入赢家。

4. 迭代节奏

周期 产出 说明
每周 内部可玩 build + 固定 playtest 日 设计师必亲自玩
双周 对外版本(EA/Discord) 社区反馈循环
季度 Gate 评审 是否进入下一阶段
EA 期 实质更新 4–8 周一次 低于此频率社区判定"已死"

MVP 定义:一个能从头玩到尾、能感受到核心乐趣、其余一切可砍的版本。

打磨 10% 定律:最后 10% 的打磨贡献约 90% 的感知品质(手感、反馈、音效、前 30 秒)。 因此打磨必须整体留到核心循环锁定之后,且集中在"前 30 秒"与"反馈"上。

5. Scope 控制

停车场机制:新功能进停车场清单,只有解决 playtest 中重复 ≥3 次的问题的功能才被放行。 零和律:加一个必须减一个。

MVP 判据:

  • 能从开始玩到结局
  • 能感受到核心乐趣(不是"理论上能")
  • 其余一切都可以砍而不影响上述两条

6. 迭代案例准则

游戏 关键决策 可迁移准则
Hades EA 21 个月,期间核心循环锁定不动,只加内容/平衡/叙事 EA 是内容补全 + 平衡阶段,不是重构玩法阶段;进 EA 前核心循环必须已验证
Slay the Spire EA 期数百次平衡补丁,公开 patch note 与社区协同 把社区当平衡测试基础设施,但保留最终裁决权
Balatro 单人 2.5 年,小圈子高频 playtest;可读性优先于深度 深度建立在可读性之上:先让"看懂",再让"看不懂的组合爆炸"
Vampire Survivors 约 1000 欧成本,先做免费浏览器原型验证核心 极低成本原型 + 免费公开分发 = 验证"机制是否自带传播性"的最快路径
Celeste 4 天 PICO-8 Game Jam 原型验证手感,后多年打磨 原型先验证"手感"这一个变量;难度取舍用可选层解决
Supercell 砍掉 30+ 项目换 5 款长线产品 Kill 是流程节点而非失败;庆祝 kill
Dead Cells 从失败的塔防项目转型 原型失败 ≠ 项目失败,机制资产可迁移
Valve(Cabal) 跨职能小组持续观察式 playtest 设计师必须亲自看玩家玩,报告不能替代观察

7. 反模式

症状 修法
核心循环未验证就做美术/特效 灰盒阶段禁止美术投入
内容量先行("先做 50 关") 切片验收后再生产,先算单位成本
把垂直切片当"完成 30%" 切片后重做预算与工期,允许大砍
玩家说要什么就加什么 追问背后问题;只修重复 ≥3 次
playtest 时解释/提示/代操作 沉默观察 + 反问法
只测团队成员和好友 强制外部招募
一轮测 20 人代替 4 轮测 5 人 多轮小样本,修完再测
只有漏斗数据,无人看过真实玩家脸 定量定位 + 定性解释,双轨
无 kill criteria,靠沉没成本续命 立项写死 3–5 条,周检
EA 承诺过多 路线图只写"下两个更新",低承诺高交付
更新节奏被营销愿望决定 按团队产能定,写进商店页
Demo 做得太晚 提前 3–6 个月,必须已过切片品质线
用 Twitch 观看量当成功指标 以 demo 实际游玩人数与 >30 分钟占比为准
打磨期无限延长,无 ship date 1.0 日期在 EA 开始时公布并倒排
Discord 反馈无分级 核心小组(决策)/ 公开频道(情绪)/ 埋点(真相)

8. 参考

  • Nielsen "5 人发现 85% 问题" 法则与多轮测试
  • Valve Cabal 流程:观察驱动设计
  • Balatro 开发时间线(LocalThunk 自述)
  • Supercell 被砍项目清单(kill 文化)
  • game-level-design/production/12-playtest-and-metrics.md(关卡侧的试玩视角)