直播出问题时,最贵的成本不是修,而是判断。不知道问题出在哪一层,就会在错误的方向上反复试:明明是播放器缓冲,却在调推流码率;明明是上行被占,却在换 CDN 节点。
这个工具的用法很简单:在下面选中你现场看到的现象,它会告诉你这个现象最可能属于哪一层、最常见根因是什么、现在这一步该做什么、以后怎么预防。如果你的现象不在列表里,可以先按10 类高频故障的完整排查手册逐条比对。
第一步:选中你看到的现象
最常见根因:
现在就做:
以后怎么防:
一、为什么必须先定层,再动手
所有直播事故的处置都从三步开始,目标是在 30 秒内判断出问题落在哪一层:
1. 看推流端。现场画面和声音是否正常?推流软件有没有报丢帧或中断?这一步判断的是现场这一侧有没有问题。
2. 看播放端。用自己的手机和一台内网电脑各打开一次,是不是都播不了?如果只有某一种设备打不开,问题大概率在观众侧或兼容性,而不是全局故障。
3. 看后台。并发曲线、卡顿率、播放错误码分布。这一步判断的是影响范围和具体类型,决定你要不要启动降级方案。
三步走完,故障必然落在「现场 / 分发 / 观众端」三者之一,后面的动作才有方向。这三步应该提前写成卡片贴在值班位,靠记忆在紧张时一定会漏。
二、10 类高频故障对照表
| 现象 | 最常见根因 | 现场处置 | 预防 |
|---|---|---|---|
| 推流中断 | 上行带宽被挤占、网线松动、推流机休眠 | 立即切备用链路;平台通常保留末帧数十秒,是黄金窗口 | 关休眠与屏保、固定网线、备用链路演练 |
| 音画不同步 | 音频与视频走了不同路径,处理耗时不同 | 在编码器加音频延迟校准;漂移型查时钟与采样率 | 统一走调音台输出,彩排时专门测口型 |
| 回声或啸叫 | 本地监听漏回麦克风、扬声器与麦克风正反馈 | 回声关本地监听或改耳机;啸叫拉开距离、降音量 | 统一用耳机监听,音箱与麦克风分区摆放 |
| 黑屏无画面 | 信号源切换失败、分辨率不匹配、线材故障 | 切备用信号源或备用线,核对输出分辨率与采集设置 | 备线备源,彩排走一遍完整信号链路 |
| 大面积卡顿 | 上行不足、码率高于链路承载、分发节点异常 | 按降级阶梯降档,峰值期先保流畅再保画质 | 开播前实测上行并按最小值配置 |
| 观众打不开 | 签名地址过期、防盗链限制过严、分享地址带时间戳 | 重新生成播放地址,放宽或重设 referer 规则 | 有效期设为活动时长加缓冲,彩排用真实设备验证 |
| 画面模糊 | 码率低于分辨率需要、编码器预设过高、光线不足 | 提高码率到档位建议值,改善现场布光 | 按分辨率定码率下限,提前实测 |
| 延迟过高 | 播放器缓冲策略、协议切片过长、链路绕路 | 先调播放端缓冲,再评估协议与节点 | 选型阶段定清延迟目标,彩排做秒表对比 |
| 录制缺失 | 录制开关未开、存储空间不足、录制策略配置错误 | 立即确认录制状态,必要时补录或改用本地录制 | 彩排必查录制开关与剩余空间 |
| 互动消息延迟 | 消息通道与视频流不同步、消息服务限流 | 检查消息服务状态,降低非关键消息频率 | 压测覆盖互动消息量级 |
三、处置优先级:先保播,再保画质
现场处置有一个明确的原则:先保住「能看」,再考虑「好看」。具体顺序是:
第一步,恢复信号。推流中断时优先切备用链路,不要纠结画质参数。第二步,降低档位。链路不够就按降级阶梯往下降,从 4K 降到 1080P,码率压力会降到约三分之一。第三步,安抚观众。播放端挂一个说明或轮播图,比让观众对着黑屏猜要好得多。第四步,才是回溯原因,留到直播结束后做。
四、彩排阶段就该做的 8 项检查
大部分现场事故,其实可以在彩排阶段被提前发现。建议把下面 8 项做成固定清单:
1. 实测推流端上行带宽,取多次测量的最小值作为配置依据。
2. 用秒表对比法测一次端到端延迟,记录基线数字。
3. 完整走一遍信号链路,包括切换台、编码器、推流机。
4. 专门测口型,确认音画同步。
5. 用真实设备打开分享链接,确认没有防盗链或有效期问题。
6. 确认录制开关已开、存储空间充足。
7. 跑一次备用链路切换演练,确认切换耗时。
8. 按预计峰值并发做一次压测,确认后台指标正常。
如果只能做其中三项,就做第 1、2、7 项——上行、基线、备用链路,这三项覆盖了最常见的事故类型。
常见问题
相关工具与手册:直播带宽计算器 · 10 类故障完整排查手册 · 端到端延迟五段拆解 · 技术实操手册总览