16 · 原型、试玩与止损
16 · 原型、试玩与止损
1. 原型四级门闸
核心原则:原型只回答一个问题,答完即弃(throwaway)。
| 阶段 | 要回答的问题 | 投入 | 进入下一阶段的门槛 |
|---|---|---|---|
| 纸面 / 桌面原型 | 规则自洽吗?决策有意义吗? | 1–3 天,纸+骰子 | 3 局内出现"非显然的最优解争夺",玩家主动想再来一局 |
| Wizard of Oz | 含 AI/对话/动态系统时:玩家会相信这个系统吗? | 1–2 天,人肉冒充系统 | 玩家对"系统"产生预期与情绪反应,而非对操作者 |
| 灰盒 / 可玩原型 | 核心循环的手感与节奏成立吗? | 1–4 周,无美术 | 陌生人无提示可完成 1 个完整循环;自愿重玩率 > 50%;能说出"我想试试那样" |
| 垂直切片 | 这条管线能复制到成品品质吗? | 2–4 个月,1 个关卡/流程 | 外部试玩者认为"这就是成品";可据此倒推单位内容成本 |
| 内容生产 | 按已验证模板批量复制 | 剩余工期 | 单位内容成本 ≤ 预算、质量不衰减 |
关键区分:垂直切片 ≠ 游戏做完 1/N。 它是"品质基准 + 成本模型"的证明,不是进度条。做完切片后你才知道还要做多少、每个单位多少钱 —— 切片做完才发现 scope 爆炸,正是切片的价值。
各阶段的禁止事项
| 阶段 | 禁止 |
|---|---|
| 纸面/桌面 | 写代码 |
| 灰盒 | 任何美术投入 |
| 垂直切片 | 量产内容 |
| 内容生产 | 改核心玩法 |
2. Playtest 十二步
- 写可证伪假设:"新手能在 90 秒内不提示完成第一次合成",而非"看看新手引导行不行"
- 定样本量:单轮 5 人(Nielsen:5 人可发现 ~85% 可用性问题);多轮 > 单轮人数,修完再测下一批;定量验证需 30+ 人
- 招募画像匹配者,禁用团队成员与熟人
- 准备:稳定 build + 埋点(时长/死亡点/放弃点/重试)+ 录屏(含面部)+ 观察记录表
- 开场脚本:"测的是游戏不是你"、"卡住是你没做好,请说出来"、"可随时退出"(退出点本身是极强数据)
- 沉默观察 + think aloud:全程不解释、不提示、不代操作。玩家提问就反问:"你觉得它应该是干什么的?"
- 定量采集:首次卡顿时刻、单关卡滞留时长、重试次数、未使用功能、退出点分布
- 定性采集(FFWWDD 六问):最挫败的瞬间?最喜欢的瞬间?想做却做不到的?给你一根魔杖你会改什么?你刚才在做什么?你会怎么向朋友描述这游戏?(第 6 问用于检测创作者意图 vs 玩家感知的错位)
- 先开放式后追问,顺序固定以便跨轮对比
- 分层提问:先具体回忆("记得哪些道具?"),再评价("第三个陷阱怎么样?"),绝不先问"是不是太难了"
- 24 小时内 debrief:观察分为"已确认问题 / 疑似问题 / 单点噪音",只有重复出现 ≥3 次才进 backlog
- 产出决策:改 / 砍 / 再测,并在下一轮验证上次的修改是否生效
禁忌清单
- 替玩家操作
- 解释机制
- 问"你觉得好玩吗"
- 把玩家建议当需求直接实现(要问背后的问题)
- 一轮塞 20 人
- 边测边改 build
- 只测团队成员和好友
定性 vs 定量的边界
数据告诉你"哪里",玩家告诉你"为什么"。 漏斗掉点用数据;核心乐趣无法用留存率证明,只能靠观察表情与重玩意愿判断。
小团队成本:每周 3–5 人 × 45 分钟即可覆盖绝大多数问题。不必买实验室,买习惯。
3. Kill Criteria(止损)
三字段写法:指标 / 阈值 / 日历日期。 立项时写死,每周一检查。
| 示例 | 指标 | 阈值 | 日期 |
|---|---|---|---|
| 原型第 3 次迭代后,5 名外部玩家中自愿重玩人数 | < 2 人 | 砍 | 2026-05-01 |
| 灰盒阶段 30 名试玩者首次 30 分钟留存 | < 40% | 机制重构或砍 | 2026-07-15 |
| 垂直切片单位关卡成本 | > 预算 1.5 倍 | 缩 scope | 2026-09-30 |
经验数据:预设 ≥3 条 kill criteria 的团队平均提前 4.2 个月止损;触发后强行 override 的,71% 在 12 周内还是死了。
触发不是获得新信息,是获得行动许可。
Kill 文化:砍掉原型 ≠ 失败。机制资产可迁移(Dead Cells 从失败的塔防转型而来)。庆祝 kill,把释放的人力投入赢家。
4. 迭代节奏
| 周期 | 产出 | 说明 |
|---|---|---|
| 每周 | 内部可玩 build + 固定 playtest 日 | 设计师必亲自玩 |
| 双周 | 对外版本(EA/Discord) | 社区反馈循环 |
| 季度 | Gate 评审 | 是否进入下一阶段 |
| EA 期 | 实质更新 4–8 周一次 | 低于此频率社区判定"已死" |
MVP 定义:一个能从头玩到尾、能感受到核心乐趣、其余一切可砍的版本。
打磨 10% 定律:最后 10% 的打磨贡献约 90% 的感知品质(手感、反馈、音效、前 30 秒)。 因此打磨必须整体留到核心循环锁定之后,且集中在"前 30 秒"与"反馈"上。
5. Scope 控制
停车场机制:新功能进停车场清单,只有解决 playtest 中重复 ≥3 次的问题的功能才被放行。 零和律:加一个必须减一个。
MVP 判据:
- 能从开始玩到结局
- 能感受到核心乐趣(不是"理论上能")
- 其余一切都可以砍而不影响上述两条
6. 迭代案例准则
| 游戏 | 关键决策 | 可迁移准则 |
|---|---|---|
| Hades | EA 21 个月,期间核心循环锁定不动,只加内容/平衡/叙事 | EA 是内容补全 + 平衡阶段,不是重构玩法阶段;进 EA 前核心循环必须已验证 |
| Slay the Spire | EA 期数百次平衡补丁,公开 patch note 与社区协同 | 把社区当平衡测试基础设施,但保留最终裁决权 |
| Balatro | 单人 2.5 年,小圈子高频 playtest;可读性优先于深度 | 深度建立在可读性之上:先让"看懂",再让"看不懂的组合爆炸" |
| Vampire Survivors | 约 1000 欧成本,先做免费浏览器原型验证核心 | 极低成本原型 + 免费公开分发 = 验证"机制是否自带传播性"的最快路径 |
| Celeste | 4 天 PICO-8 Game Jam 原型验证手感,后多年打磨 | 原型先验证"手感"这一个变量;难度取舍用可选层解决 |
| Supercell | 砍掉 30+ 项目换 5 款长线产品 | Kill 是流程节点而非失败;庆祝 kill |
| Dead Cells | 从失败的塔防项目转型 | 原型失败 ≠ 项目失败,机制资产可迁移 |
| Valve(Cabal) | 跨职能小组持续观察式 playtest | 设计师必须亲自看玩家玩,报告不能替代观察 |
7. 反模式
| 症状 | 修法 |
|---|---|
| 核心循环未验证就做美术/特效 | 灰盒阶段禁止美术投入 |
| 内容量先行("先做 50 关") | 切片验收后再生产,先算单位成本 |
| 把垂直切片当"完成 30%" | 切片后重做预算与工期,允许大砍 |
| 玩家说要什么就加什么 | 追问背后问题;只修重复 ≥3 次 |
| playtest 时解释/提示/代操作 | 沉默观察 + 反问法 |
| 只测团队成员和好友 | 强制外部招募 |
| 一轮测 20 人代替 4 轮测 5 人 | 多轮小样本,修完再测 |
| 只有漏斗数据,无人看过真实玩家脸 | 定量定位 + 定性解释,双轨 |
| 无 kill criteria,靠沉没成本续命 | 立项写死 3–5 条,周检 |
| EA 承诺过多 | 路线图只写"下两个更新",低承诺高交付 |
| 更新节奏被营销愿望决定 | 按团队产能定,写进商店页 |
| Demo 做得太晚 | 提前 3–6 个月,必须已过切片品质线 |
| 用 Twitch 观看量当成功指标 | 以 demo 实际游玩人数与 >30 分钟占比为准 |
| 打磨期无限延长,无 ship date | 1.0 日期在 EA 开始时公布并倒排 |
| Discord 反馈无分级 | 核心小组(决策)/ 公开频道(情绪)/ 埋点(真相) |
8. 参考
- Nielsen "5 人发现 85% 问题" 法则与多轮测试
- Valve Cabal 流程:观察驱动设计
- Balatro 开发时间线(LocalThunk 自述)
- Supercell 被砍项目清单(kill 文化)
game-level-design/production/12-playtest-and-metrics.md(关卡侧的试玩视角)