一、故障定位三步法(30 秒内定层)

所有直播事故的处置都从这三步开始。跳过定位直接改参数,是最常见的浪费时间的方式。

如果想跳过阅读直接定位,可以用直播故障自检工具:选中现场看到的现象,它会直接告诉你是哪一层的问题以及这一步该做什么。

  1. 看推流端:现场画面/声音是否正常?推流软件是否报丢帧或中断?→ 判断现场这一侧有没有问题。
  2. 看播放端:用自己的手机和一台内网电脑各打开一次,是否能正常播放?→ 判断是不是全局问题。
  3. 看后台:并发曲线、卡顿率、播放错误码分布→ 判断影响范围与具体类型。

三步走完,故障必然落在「现场 / 分发 / 观众端」三者之一,后面的动作才有方向。这三步应该提前写成卡片贴在值班位,靠记忆在紧张时一定会漏。

二、10 类高频事故对照表

# 现象 最常见根因 现场处置 预防
1 推流中断 上行带宽被挤占、网线松动、推流机休眠 立即切备用链路;平台通常保留末帧数十秒,是黄金窗口 关休眠/屏保、固定网线、备用链路演练
2 音画不同步 音频与视频走了不同路径,处理耗时不同 在编码器加音频延迟校准(固定偏移);漂移型查时钟与采样率 统一走调音台输出,彩排时专门测口型
3 回声 / 啸叫 本地监听漏回麦克风 / 扬声器麦克风正反馈 回声:关本地监听或改耳机;啸叫:拉开距离、降音量、加反馈抑制 统一用耳机监听,音箱与麦克风分区摆放
4 黑屏 / 无画面 信号源切换失败、分辨率不匹配、线材故障 切备用信号源或备用线;核对输出分辨率与采集设置 备线备源、彩排走一遍完整信号链路
5 大面积卡顿 上行不足、码率高于链路承载、分发节点异常 按降级阶梯降档;峰值期先保流畅再保画质 开播前实测上行并按最小值配置
6 观众打不开
(推流正常)
签名地址过期、防盗链限制过严、分享地址带时间戳 重新生成播放地址;放宽或重设 referer 规则 有效期设为活动时长+缓冲,彩排用真实设备验证
7 并发打爆 实际人数远超预估、外部投放带来突发流量 联系平台紧急扩容;必要时限制新进入并引导看回放 按峰值(非平均)预留,提前申请弹性扩容
8 回放丢失 未开启录制、录制存储写满、录制任务被覆盖 立即补录(如有备用录制);事后用本地录制补档 本地+云端双录制,开播前确认录制开关已开
9 声音问题
(忽大忽小/杂音)
自动增益打架、多个麦克风同时收音、电源干扰 关掉自动增益改手动;只保留当前发言人麦克风 统一电平标准,电源隔离,彩排测全程音量
10 多会场不同步 各分会场无统一时钟、议程衔接无缓冲 由主控统一喊流程;分会场按主控指令切换 统一对时、议程设缓冲段、预演一次切换

三、处置的三条原则

  • 处置优先于归因:先恢复服务(切链路、降档、换地址),事后再分析是谁的问题。直播中断时争论责任,是最贵的时间浪费。
  • 降级优于硬撑:画质降一档观众几乎无感,卡顿和中断观众一定有感。设置好降级阶梯并提前告知主讲人,不要等撑不住了才临时决定。
  • 沟通同步于处置:处置的同时要同步主持人与主办方,让他们知道正在处理、大概多久。没有信息的等待最难熬,也最容易升级成投诉。

四、事故复盘记什么

复盘不是追责。一旦复盘变成责任认定,下次就没人愿意如实反馈,复盘也就失去了价值。一份可用的复盘记四件事:

  1. 现象:观众实际感知到的是什么(不是技术描述)。
  2. 时间线:几点几分出现、谁做了什么动作、多久恢复。
  3. 根因:直接原因 + 促成原因(为什么没在彩排时发现)。
  4. 改进项:具体到可执行动作与负责人,纳入下次检查清单。

第 3 条里的「为什么没在彩排时发现」最容易被跳过,但它才是防止复发的真正抓手——多数事故的根因不是技术难度,而是某个环节从没被实际验证过。

相关技术手册

📘 希望现场有人按预案处置?企业直播服务提供方案设计、彩排演练与现场驻场保障,把「会不会出事」变成「出事时谁、多久、做什么」。