1. 概述
1.1 版本
| 运维平台版本 | 功能变更 |
|---|---|
| V2.39.0 | - |
1.2 功能简介
「网络分析」用于在部署、扩容与故障期间快速判定网络类问题所在层级,并输出可交接的证据包。
它面向三类读者:
1)实施与交付工程师:部署、扩容后确认端口与链路是否已放通。
2)运维管理员:日常巡检与周期性观察网络连通性变化。
3)技术支持工程师:客户现场问题预定位,收集标准化排查证据。
1.3 应用场景
1)部署完成后平台无法访问、工程启动失败。
2)访问返回 502 或 504,需确认是节点间链路还是容器端口不通。
3)外部依赖不可达:云端域名、模板市场、插件商城、OAuth 域名等。
4)DNS 解析、端口占用、防火墙与 iptables 规则、容器网络异常等需要跨层排查的问题。
5)物理机网段与容器网段冲突、容器网络模式错误等疑难问题的证据收集。
2. 前置准备
执行「网络分析」前需确认下表全部条件已满足,否则检测结果不完整。
| 前置项 | 说明 |
|---|---|
| Ops Agent 在线 | 项目全部节点已安装 Ops Agent 且处于在线状态。 信息采集依赖 Agent,Agent 离线的节点仅产出 SYS-01 检测结果,不再执行后续 IP 与端口探测 |
| 账号权限 | 当前账号具备该项目的运维查看与操作权限 |
3. 操作步骤
3.1 进入网络分析页面
1)登录运维平台,单击左侧「项目管理」。
2)选择目标项目,进入项目详情页。
3)单击「健康巡检>网络分析」,进入网络分析页面。页面顶部展示本次分析的采集与检测范围,右上角为「分析设置」入口。
采集与检测范围如下表所示:
| 类别 | 内容 |
|---|---|
| 收集 | 防火墙和 iptables 规则、容器信息、网络系统参数、宿主机进程信息 |
| 检测 | 跨节点依赖端口、宿主机映射端口、容器端口可达性;网络系统参数变更历史;应用可访问性(从运维平台服务端访问) |

3.2 手动执行网络分析
本节用于按需触发一次全量检测,并获取检测结论与证据包。
1)在「网络分析」区域单击「网络分析」按钮,平台开始执行检测。
2)等待检测结束。检测耗时与节点数量、端口数量相关,单项目常规耗时为 2~15 秒。

3)在「检测结果」区域查看本次结论:严重数量、警告数量、通过数量与检测耗时。
4)在结果明细表中逐项确认异常项,明细表列含义如下表所示。
| 列 | 说明 |
|---|---|
| 检测编号 | 检测项编号,如 NET-03、SYS-02 |
| 检测项 | 检测内容名称 |
| 检测对象 | 具体节点、URL、IP 与端口或参数名 |
| 状态 | 通过、告警、严重 |
| 检测结果 | 实际探测到的值或失败原因 |
| 建议 | 针对该项的处理建议 |
注:检测结果不是固定 8 条,而是按节点、URL、端口、内核参数与修复事件展开为多条记录,同一检测编号可能出现多行。

5)如需进一步排查,单击结果明细表右下角「下载完整数据包」,导出本次诊断证据包。
内容包含连通性矩阵、端口监听与映射、DNS 解析结果、最近 7 天系统与容器事件、iptables 与 firewalld 摘要。

3.3 配置自动分析
本节用于开启周期性检测,适用于间歇性网络问题的持续观察。
1)单击页面右上角「分析设置」,打开设置面板。
2)打开「自动分析」开关。该开关默认关闭。
3)在「执行周期」中填写数值,并选择单位「分钟」或「小时」。默认值为 24 小时,面板下方会提示当前设置,例如「每 24 小时执行一次」。
4)单击「保存」生效。
注意:日常巡检建议保持「自动分析」关闭,仅在排查间歇性、时好时坏的网络问题期间开启,问题定位后及时关闭,避免产生无需关注的历史记录。

3.4 查看最近7天历史
本节用于回溯历史检测结果,对比网络状态变化。
1)在页面下方「最近 7 天历史」区域查看历史记录,字段包含报告类型(手动分析、自动分析)、完成时间、警告、通过、检测耗时、状态。
2)单击「查看结果」,回看该次分析的检测明细。
3)单击「下载完整数据包」,下载该次分析对应的证据包。

4. 结果校验与预期反馈
4.1 检测项对照表
下表用于逐项判读检测结论与常见原因。
| 编号 | 检测项 | 检测范围与判定 | 异常状态 | 说明与常见原因 |
|---|---|---|---|---|
| SYS-01 | Agent 连接状态 | 检查项目配置节点是否匹配到在线 Agent;已连接判定为通过,未连接判定为告警 | 告警 | 未匹配到在线 Agent 说明该节点缺少采集与探测通道,需先恢复 Agent 后重新执行分析 |
| APP-01 | Web 应用可访问性 | 检查项目访问地址 accessUrl 及配置的 Web 节点 URL,按 TCP、TLS、HTTP 分层探测;HTTP 状态码为 2xx 或 3xx 判定为通过 | 告警 | TCP 失败表示网络路径或端口不可达;TCP 成功但 TLS 失败表示证书或协议协商异常;HTTP 状态码或响应内容异常表示 Web 服务自身不可用 |
| NET-02 | 容器服务端口可达性 | 源节点到目标服务端口的 TCP 探测失败后,再由目标宿主机上的 Agent 直接访问容器 IP 与容器端口 | 告警 | 宿主机侧仍不可达,说明问题位于容器内部服务监听、容器网络或容器隔离层,而非跨节点链路 |
| NET-03 | 宿主机发布端口可达性 | 关联容器内部端口与宿主机发布端口的映射关系,并从探测源访问宿主机发布端口;同时用于表示本机公开端口探测结果 | 告警 | 容器内部端口可达但发布端口不可达,需重点排查 Docker 端口映射、NAT、iptables 与宿主机监听配置 |
| NET-04 | 跨节点依赖端口可达性 | 根据组件拓扑与依赖规则确定真实的源节点、目标节点及目标端口,再从源节点发起 TCP 连接 | 告警 | 用于验证跨主机路由、防火墙、安全组以及节点间网络策略是否允许依赖服务通信 |
| NET-05 | 在线升级必要域名连通性 | 从运维平台服务端探测在线升级所需域名的 HTTPS 443 连通性,例如 cloud.fanruan.com、镜像仓库域名、OSS 域名 | 告警 | 纯内网环境无需关注;需使用在线升级时,应在 FineOps 服务端放行上述域名的 443 访问,并检查 DNS、防火墙、代理与 TLS 配置 |
| SYS-02 | 网络内核参数 | 检查 Agent 返回的固定网络 sysctl 参数当前值是否等于期望值 | 严重 | 当前值与期望值不一致可能影响容器通信或跨节点访问,需按「建议」列调整内核参数 |
| SYS-03 | Agent 网络参数自动修复记录 | 检查 Agent 记录的网络参数自动修复事件,结合写入结果、修复后实际值与完成时间判断修复状态 | 修复失败判定为严重;结果未知或曾发生自动修复判定为告警 | 修复失败表示参数未恢复到期望值;结果未知或曾自动修复说明节点存在配置漂移或证据不完整 |
4.2 状态与处理建议
| 状态 | 含义 | 处理建议 |
|---|---|---|
| 通过(PASS) | 该项检测正常 | 无需处理 |
| 告警(WARNING) | 该项探测异常或证据不完整 | 结合「建议」列排查,必要时下载完整数据包 |
| 严重(SEVERE) | 参数当前值与期望值不符,或自动修复失败 | 优先处理,通常需调整宿主机网络内核参数 |
4.3 典型排查路径
检测结果存在多项告警时,按以下顺序判读可最快收敛故障域。
1)先看 SYS-01,确认 Agent 是否全部在线;存在离线节点时先恢复 Agent,再重新执行分析。
2)再看 APP-01,确认应用入口能否访问,并定位失败发生在 TCP、TLS 还是 HTTP 层。
3)端口不通时按 NET-03、NET-02、NET-04 的顺序判断:先看宿主机发布端口,再看容器内部端口,最后看跨节点依赖端口,据此确认问题在端口映射、容器内部还是节点间链路。
4)在线升级、模板市场、插件商城等外部依赖异常时,查看 NET-05 的域名连通性结论。
5)全部检测项通过但问题仍存在时,下载完整数据包;必要时按 3.5 补充采集 messages、journalctl 等系统日志。
6. 常见问题
问:检测出现告警,是否代表环境一定存在故障?
答:不一定。告警表示该项探测异常或证据不完整。例如纯内网环境下 NET-05 的域名不可达属于预期结果;SYS-03 中自动修复成功也显示为告警。请结合「建议」列与实际部署形态判断。
问:为什么每次检测结果的条数不一致?
答:检测结果按节点、URL、端口、内核参数与修复事件逐条展开。节点数量、映射端口数量、修复事件数量变化都会改变记录条数。
问:诊断数据包会持续占用磁盘吗?
答:不会。导出包保留 7 天,且最多保留 200 份,超出后自动删除较早数据。
问:「自动分析」是否需要长期开启?
答:不需要。默认关闭即可;出现间歇性网络问题、需要持续观察时手动开启,并根据观察需要调整执行周期,定位完成后关闭。
问:检测项全部通过但用户仍反馈无法访问,应如何处理?
答:先下载完整数据包确认服务端各层均正常,再按客户端、办公网、外部负载均衡、WAF、VPN、云带宽等方向排查。此类故障域缺少对端证据,需联合网络管理方共同定位。
