it-service@brocent.com
可用性监控
2026 年 8 月报告周期内,服务器、业务应用、存储、网络设备与互联网链路的可用率、中断记录与容量余量。
交易时段可用性零中断;互联网链路与 NAS 容量是风险所在
全部一级服务 —— 行情数据应用、文件服务器、互联网接入与身份服务 —— 在全部 21 个交易日的香港交易时段内始终可用。24 个监控对象的整体可用率为 99.94%,承诺值为 99.5%。本期发生三次非计划中断,均在交易时段之外,平均恢复耗时 41 分钟。
有两处容量问题若放任不管,将演变为可用性问题。香港办公室只有一条互联网线路且无备份链路,因此任何运营商故障都会同时中断行情数据、云访问与语音;NAS 容量已用至 87%,按当前增长速度约有十一周余量。这两项本季度需要的是决策,而不是技术修复。
本期可用性状况
可用率依据监控检查项计算,而非设备电源状态:一台能响应 ping、但应用端口已关闭的服务器,就该项服务而言计为不可用。
四项需要采取行动
证据。 一条 500 Mbps 线路接入防火墙高可用对。峰值利用率为 62%,因此问题不在带宽而在冗余。本期运营商通报了两次短暂的区域性故障,均未波及本楼宇 —— 这是运气,不是设计。
影响。 交易时段的一次线路故障将同时中断行情数据、Microsoft 365、云基础设施访问与托管语音。没有任何降级运行模式:整个办公室停摆。这是本环境中最大的单一可用性风险。
建议。 增加一条来自不同运营商、经不同楼宇入口的第二线路,并在现有防火墙对上配置自动切换。一条 200 Mbps 备份线路足以支撑降级运行。BCS 将随 9 月报告提供两家运营商的报价。
证据。 NAS 已用至 48 TB 可用容量的 87%,受研究数据驱动每月增长 0.9 TB。按此速度将在 2026-11-16 当周越过 95% 阈值,超过该阈值后快照与重建行为将开始劣化。
影响。 容量写满会阻断研究团队的写入,并导致针对同一数据源的备份作业失败 —— 于是容量问题会同时变成可用性问题与数据保护问题。
建议。 扩容一个磁盘柜,或将两年以上的研究数据归档至冷云存储。BCS 建议走归档路线:成本更低、还能减少备份量;BCS 将筛选出候选数据集供客户审批。
证据。 共享文档由一台物理服务器提供,既无集群伙伴节点,也无温备。恢复只能依靠还原,《备份》报告验证的还原耗时为 3 小时 12 分 —— 低于四小时目标,但远超一个交易日所能容忍的范围。
影响。 若在 09:00 发生硬件故障,公司在大半个交易日内都将没有共享文档可用,尽管恢复时间目标在技术上是达成的。
建议。 继续将活跃文档集迁移至 SharePoint,这样无需新增硬件即可消除该依赖。六个共享中已迁移两个,建议在第四季度计划中安排其余四个。
证据。 深圳两个无线接入点中的一个记录到四次意外重启,每次不足两分钟。为其供电的那台已停止支持的接入交换机,其 PoE 供电预算已接近极限。
建议。 将该接入点改接到受支持交换机的端口上;若重启仍持续,则在保修范围内更换该接入点。两者均已被此前提出的交换机更换方案所覆盖。
该应用服务器 7 月曾连续四天内存占用高于 90%,导致两次行情数据客户端断连。内存已于 2026-08-03 从 16 GB 升级至 32 GB。此后峰值利用率为 54%,未再出现断连。
五项服务级别全部达成
| 承诺服务级别 | 目标 | 实际 | 状态 | 说明 |
|---|---|---|---|---|
| 一级服务交易时段可用率 | 100% | 100% | MET | 21 个交易日,4 项服务 |
| 整体月度可用率 | ≥ 99.5% | 99.94% | MET | 24 个监控对象 |
| 中断确认响应 | ≤ 15 分钟 | 最差 4 分钟 | MET | 3 次中断 |
| 一级服务恢复时长 | ≤ 2 小时 | 最差 58 分钟 | MET | 08-16 文件服务器中断 |
| 月度报告出具 | 第 5 个工作日前 | 第 3 个工作日 | MET | 2026-09-03 出具 |
三个周期的变化
| 指标 | 2026年6月 | 2026年7月 | 2026年8月 | 变化方向 |
|---|---|---|---|---|
| 整体可用率 | 99.81% | 99.88% | 99.94% | 持续改善;三个周期均高于承诺值。 |
| 非计划中断 | 6 | 5 | 3 | 随内存与固件故障修复而下降。 |
| 平均恢复耗时 | 72 分钟 | 55 分钟 | 41 分钟 | 随前三类故障有了处置手册而改善。 |
| 交易时段中断 | 1 | 0 | 0 | 已连续两个周期零中断。 |
| NAS 容量已用 | 79% | 83% | 87% | 每周期上升 4 个百分点 —— 当前的关键制约。 |
| 线路峰值利用率 | 58% | 60% | 62% | 保持平稳;问题不在带宽,而在冗余。 |
高于 85% 为红色,高于 60% 为琥珀色,其余为绿色。目前只有 NAS 处于红色区间;按当前增长速度,其余各项至少还有一年余量。
各监控对象的可用性
中断记录
| 对象 | 开始时间 | 时长 | 级别 | 原因与处置 |
|---|---|---|---|---|
| 文件服务器 | 2026-08-16 22:14 | 58 分钟 | 1 | 计划内重启后出现存储控制器固件故障;已重新插拔控制器并升级固件。周六夜间,无用户受影响。 |
| 云主机 01 | 2026-08-21 03:40 | 37 分钟 | 2 | 服务商在未通知的情况下进行宿主机维护;虚拟机已自动在健康宿主机上重启。仅影响报表类负载。 |
| 无线接入点(深圳) | 2026-08-27 11:02 | 28 分钟 | 3 | 反复重启追溯至已停止支持的交换机 PoE 供电预算问题;已将该接入点改接到其他端口 — 参见发现事项。 |
计划内维护若落在约定窗口内且提前 48 小时通知,则不计入可用率。本期使用了两个计划窗口,均在周日上午,合计 4 小时 20 分。
| 对象 | 类别 | 级别 | 检查项 | 可用率 | 中断次数 | 最长 | 说明 |
|---|---|---|---|---|---|---|---|
| ACM-SRV-01 | 服务器 | 1 | 6 | 99.87% | 1 | 58 分钟 | 控制器固件 |
| ACM-SRV-02 | 服务器 | 1 | 7 | 100% | 0 | — | 08-03 已升级内存 |
| 行情数据应用 | 应用 | 1 | 5 | 100% | 0 | — | 模拟登录检查 |
| 会计系统 | 应用 | 2 | 4 | 100% | 0 | — | 模拟登录检查 |
| Microsoft 365 | SaaS | 1 | 6 | 100% | 0 | — | 邮件、Teams、SharePoint |
| ACM-NAS-01 | 存储 | 2 | 8 | 100% | 0 | — | 容量 87% — 发现事项 |
| ACM-FW-01/02 | 防火墙 | 1 | 8 | 100% | 0 | — | 高可用对;已测试切换 |
| 香港互联网线路 | 广域网 | 1 | 6 | 100% | 0 | — | 无备份链路 — 发现事项 |
| ACM-SW-C1/C2 | 核心交换机 | 1 | 8 | 100% | 0 | — | 堆叠对 |
| ACM-SW-A1/A2 | 接入交换机 | 3 | 6 | 100% | 0 | — | A2 已停止支持 |
| ACM-AP-01–04 | 无线接入点 | 3 | 8 | 100% | 0 | — | 香港办公室 |
| ACM-AP-05/06 | 无线接入点 | 3 | 4 | 99.94% | 1 | 28 分钟 | AP-06 重启 — 发现事项 |
| 云主机 01 | 云服务器 | 2 | 5 | 99.92% | 1 | 37 分钟 | 服务商维护 |
| 云主机 02 | 云服务器 | 2 | 5 | 100% | 0 | — | 报表类负载 |
| 云数据库 | 托管数据库 | 2 | 4 | 100% | 0 | — | 已启用时间点恢复 |
| 站点到站点 VPN | 广域网 | 2 | 6 | 100% | 0 | — | 香港至深圳隧道 |
十六行覆盖了 24 个监控对象;成对部署的设备合并为一行显示。一级对象指其中断会阻断交易时段工作的对象,二级会造成降级,三级影响局部。
各服务的冗余现状
| 服务 | 冗余方式 | 切换方式 | 最近测试 | 现状 |
|---|---|---|---|---|
| 防火墙/边界 | 高可用对 | 自动 | 2026-08-10 | 已在维护窗口内测试切换;中断 4 秒。 |
| 核心交换 | 堆叠对 | 自动 | 2026-06-14 | 状况良好;下次测试与接入交换机更换一并安排。 |
| 互联网接入 | 无 | 无 | — | 单一线路 — 本环境最大的可用性风险。 |
| 文件服务 | 无 | 仅能还原 | 2026-08-09 | 已验证还原耗时 3 小时 12 分;正在迁移至 SharePoint。 |
| 行情数据应用 | 厂商云 + 本地 | 手动 | 2026-07-19 | 本地服务器故障时,交易员可改用厂商网页客户端。 |
| 身份/Microsoft 365 | 服务商提供 | 自动 | — | 由服务商管理;应急账号离线保管。 |
| 语音 | 服务商 + 手机 | 手动 | 2026-08-10 | 可转接至手机;但同样依赖这条互联网线路。 |
跨周期结转的未决事项
| 编号 | 风险 | 严重程度 | 责任人 | 到期日 | 状态 | 下一步行动 |
|---|---|---|---|---|---|---|
| AVAIL-R01 | 互联网线路单一 — 任何运营商故障都导致全办公室中断 | CRITICAL | 客户方 COO | 2026-10-31 | 未处理 | BCS 提供两家运营商的异路由备份线路报价。 |
| AVAIL-R02 | NAS 容量将耗尽 — 约剩十一周余量 | HIGH | 客户方 IT + BCS | 2026-10-15 | 处理中 | BCS 筛选归档候选数据;客户在归档与扩容之间作出选择。 |
| AVAIL-R03 | 文件服务器为单点故障 — 只能依靠还原恢复 | MEDIUM | BCS + 客户方 IT | 2026-12-31 | 处理中 | 将其余四个共享迁移至 SharePoint。 |
| AVAIL-R04 | 语音依赖同一条线路 — 没有独立通路 | MEDIUM | 客户方 COO | 2026-10-31 | 未处理 | 由备份线路方案一并解决;在此之前先记录手机转接流程。 |
| AVAIL-R05 | 已停止支持的接入交换机 — PoE 不稳定且无固件修复 | LOW | 客户方 COO | 2026-11-30 | 未处理 | 批准更换 —— 参见 CONF-R04。 |
下一周期承诺事项
| BCS Support Center 将 | 需要客户配合 |
|---|---|
| 提供两家异路由运营商的报价,附切换方案设计与成本。 | 在 2026-10-31 前就备份互联网线路作出决定。 |
| 筛选可归档至冷存储的研究数据集,并测算可节省的容量。 | 在 NAS 扩容与归档旧研究数据之间作出选择。 |
| 将深圳的无线接入点改接到受支持交换机的端口。 | 批准第四季度将其余共享迁移至 SharePoint。 |
| 为每一个一级对象报告容量余量,并给出距阈值还有几周。 | 确认 2027 年服务计划中交易时段的定义。 |
本报告的生成方式
| 数据来源 | 提取时间 | 记录数 | 用于 |
|---|---|---|---|
| 监控平台 | 2026-09-01 01:05 香港时间 | 96 项检查 | 各检查项的可用率、中断起止时间、确认响应耗时。 |
| 模拟应用检查 | 2026-09-01 01:05 香港时间 | 3 个流程 | 超越主机可达性的应用级可用性。 |
| SNMP 性能历史 | 2026-09-01 01:20 香港时间 | 31 天 | CPU、内存、接口与存储利用率峰值。 |
| 存储阵列遥测 | 2026-09-01 01:30 香港时间 | 1 台阵列 | 用于余量预测的已用容量与增长速度。 |
| 运营商门户 | 2026-08-31 | 2 条通告 | 线路利用率与运营商故障通知。 |
| 事件工单 | 2026-08-31 | 3 次中断 | 原因、已采取措施与恢复证据。 |
方法与定义
可用率 按 60 秒轮询的每一个监控检查项计量,先按对象、再按级别汇总。只有当某项服务自身的检查通过时,该服务才计为可用:主机可达从不等同于应用可用。
交易时段 指香港营业日的 08:30 至 17:30(香港时间),本期共 21 天。一级服务的可用率针对该时段单独报告 —— 因为 03:00 的中断与 10:00 的中断并不是等价事件。
容量余量 以按过去三个月增长速度、距既定阈值还有几周来表示:存储为 95%,CPU 与内存为持续 80%,网络接口为峰值 70%。预测采用线性方式,并刻意偏保守。
排除范围。 落在约定窗口内并提前 48 小时通知的计划内维护不计入。终端用户设备不在可用性范围内 —— 它们在《IT 资产管理》报告中呈现。第三方 SaaS 的可用性按我们自己的检查观测结果报告,而非按服务商声称的数值。
本文档为用于展示的匿名化样本。客户名称、设备名称、应用名称、运营商与服务商身份均已替换为虚构或通用值;可用率数字、比例、日期与发现事项反映的是一个具有代表性的受管环境。文档中不含任何真实客户数据。
BCS Support Center · it-service@brocent.com
客户常问的关于本报告的问题
按 60 秒轮询的每一个监控检查项计量,再按对象和服务级别汇总。一台能响应 ping、但应用端口已关闭的服务器计为不可用 —— 主机可达从不会被当作应用可用来报告。
因为对金融机构而言,03:00 的中断和 10:00 的中断不是同一回事。一级服务的可用率既按整月报告,也按香港交易时段单独报告。
涵盖 —— 容量余量以按过去三个月增长速度距既定阈值还有几周来表示,因此存储即将写满会作为一项有排期的决策提出,而不是等它变成一起事故。
看看你自己的可用性监控报告会写些什么
免费 IT 健康检查会针对你的真实环境产出本报告的第一版,不收费、无义务。整个过程约需一周,占用你团队几个小时。