it-service@brocent.com
可用性監控
2026 年 8 月報告週期內,服務器、業務應用、存儲、網絡設備與互聯網鏈路的可用率、中斷記錄與容量餘量。
交易時段可用性零中斷;互聯網鏈路與 NAS 容量是風險所在
全部一級服務 —— 行情數據應用、文件服務器、互聯網接入與身份服務 —— 在全部 21 個交易日的香港交易時段內始終可用。24 個監控對象的整體可用率爲 99.94%,承諾值爲 99.5%。本期發生三次非計劃中斷,均在交易時段之外,平均恢復耗時 41 分鐘。
有兩處容量問題若放任不管,將演變爲可用性問題。香港辦公室只有一條互聯網線路且無備份鏈路,因此任何運營商故障都會同時中斷行情數據、雲訪問與語音;NAS 容量已用至 87%,按當前增長速度約有十一週餘量。這兩項本季度需要的是決策,而不是技術修復。
本期可用性狀況
可用率依據監控檢查項計算,而非設備電源狀態:一台能響應 ping、但應用端口已關閉的服務器,就該項服務而言計爲不可用。
四項需要採取行動
證據。 一條 500 Mbps 線路接入防火牆高可用對。峯值利用率爲 62%,因此問題不在帶寬而在冗餘。本期運營商通報了兩次短暫的區域性故障,均未波及本樓宇 —— 這是運氣,不是設計。
影響。 交易時段的一次線路故障將同時中斷行情數據、Microsoft 365、雲基礎設施訪問與託管語音。沒有任何降級運行模式:整個辦公室停擺。這是本環境中最大的單一可用性風險。
建議。 增加一條來自不同運營商、經不同樓宇入口的第二線路,並在現有防火牆對上配置自動切換。一條 200 Mbps 備份線路足以支撐降級運行。BCS 將隨 9 月報告提供兩家運營商的報價。
證據。 NAS 已用至 48 TB 可用容量的 87%,受研究數據驅動每月增長 0.9 TB。按此速度將在 2026-11-16 當週越過 95% 閾值,超過該閾值後快照與重建行爲將開始劣化。
影響。 容量寫滿會阻斷研究團隊的寫入,並導致針對同一數據源的備份作業失敗 —— 於是容量問題會同時變成可用性問題與數據保護問題。
建議。 擴容一個磁盤櫃,或將兩年以上的研究數據歸檔至冷雲存儲。BCS 建議走歸檔路線:成本更低、還能減少備份量;BCS 將篩選出候選數據集供客戶審批。
證據。 共享文檔由一台物理服務器提供,既無集羣夥伴節點,也無溫備。恢復只能依靠還原,《備份》報告驗證的還原耗時爲 3 小時 12 分 —— 低於四小時目標,但遠超一個交易日所能容忍的範圍。
影響。 若在 09:00 發生硬件故障,公司在大半個交易日內都將沒有共享文檔可用,儘管恢復時間目標在技術上是達成的。
建議。 繼續將活躍文檔集遷移至 SharePoint,這樣無需新增硬件即可消除該依賴。六個共享中已遷移兩個,建議在第四季度計劃中安排其餘四個。
證據。 深圳兩個無線接入點中的一個記錄到四次意外重啓,每次不足兩分鐘。爲其供電的那台已停止支援的接入交換機,其 PoE 供電預算已接近極限。
建議。 將該接入點改接到受支援交換機的端口上;若重啓仍持續,則在保修範圍內更換該接入點。兩者均已被此前提出的交換機更換方案所覆蓋。
該應用服務器 7 月曾連續四天記憶體佔用高於 90%,導致兩次行情數據客戶端斷連。記憶體已於 2026-08-03 從 16 GB 升級至 32 GB。此後峯值利用率爲 54%,未再出現斷連。
五項服務級別全部達成
| 承諾服務級別 | 目標 | 實際 | 狀態 | 說明 |
|---|---|---|---|---|
| 一級服務交易時段可用率 | 100% | 100% | MET | 21 個交易日,4 項服務 |
| 整體月度可用率 | ≥ 99.5% | 99.94% | MET | 24 個監控對象 |
| 中斷確認響應 | ≤ 15 分鐘 | 最差 4 分鐘 | MET | 3 次中斷 |
| 一級服務恢復時長 | ≤ 2 小時 | 最差 58 分鐘 | MET | 08-16 文件服務器中斷 |
| 月度報告出具 | 第 5 個工作日前 | 第 3 個工作日 | MET | 2026-09-03 出具 |
三個週期的變化
| 指標 | 2026年6月 | 2026年7月 | 2026年8月 | 變化方向 |
|---|---|---|---|---|
| 整體可用率 | 99.81% | 99.88% | 99.94% | 持續改善;三個週期均高於承諾值。 |
| 非計劃中斷 | 6 | 5 | 3 | 隨記憶體與固件故障修復而下降。 |
| 平均恢復耗時 | 72 分鐘 | 55 分鐘 | 41 分鐘 | 隨前三類故障有了處置手冊而改善。 |
| 交易時段中斷 | 1 | 0 | 0 | 已連續兩個週期零中斷。 |
| NAS 容量已用 | 79% | 83% | 87% | 每週期上升 4 個百分點 —— 當前的關鍵制約。 |
| 線路峯值利用率 | 58% | 60% | 62% | 保持平穩;問題不在帶寬,而在冗餘。 |
高於 85% 爲紅色,高於 60% 爲琥珀色,其餘爲綠色。目前只有 NAS 處於紅色區間;按當前增長速度,其餘各項至少還有一年餘量。
各監控對象的可用性
中斷記錄
| 對象 | 開始時間 | 時長 | 級別 | 原因與處置 |
|---|---|---|---|---|
| 文件服務器 | 2026-08-16 22:14 | 58 分鐘 | 1 | 計劃內重啓後出現存儲控制器固件故障;已重新插拔控制器並升級固件。週六夜間,無用戶受影響。 |
| 雲主機 01 | 2026-08-21 03:40 | 37 分鐘 | 2 | 服務商在未通知的情況下進行宿主機維護;虛擬機已自動在健康宿主機上重啓。僅影響報表類負載。 |
| 無線接入點(深圳) | 2026-08-27 11:02 | 28 分鐘 | 3 | 反覆重啓追溯至已停止支援的交換機 PoE 供電預算問題;已將該接入點改接到其他端口 — 參見發現事項。 |
計劃內維護若落在約定窗口內且提前 48 小時通知,則不計入可用率。本期使用了兩個計劃窗口,均在週日上午,合計 4 小時 20 分。
| 對象 | 類別 | 級別 | 檢查項 | 可用率 | 中斷次數 | 最長 | 說明 |
|---|---|---|---|---|---|---|---|
| ACM-SRV-01 | 服務器 | 1 | 6 | 99.87% | 1 | 58 分鐘 | 控制器固件 |
| ACM-SRV-02 | 服務器 | 1 | 7 | 100% | 0 | — | 08-03 已升級記憶體 |
| 行情數據應用 | 應用 | 1 | 5 | 100% | 0 | — | 模擬登入檢查 |
| 會計系統 | 應用 | 2 | 4 | 100% | 0 | — | 模擬登入檢查 |
| Microsoft 365 | SaaS | 1 | 6 | 100% | 0 | — | 郵件、Teams、SharePoint |
| ACM-NAS-01 | 存儲 | 2 | 8 | 100% | 0 | — | 容量 87% — 發現事項 |
| ACM-FW-01/02 | 防火牆 | 1 | 8 | 100% | 0 | — | 高可用對;已測試切換 |
| 香港互聯網線路 | 廣域網 | 1 | 6 | 100% | 0 | — | 無備份鏈路 — 發現事項 |
| ACM-SW-C1/C2 | 核心交換機 | 1 | 8 | 100% | 0 | — | 堆疊對 |
| ACM-SW-A1/A2 | 接入交換機 | 3 | 6 | 100% | 0 | — | A2 已停止支援 |
| ACM-AP-01–04 | 無線接入點 | 3 | 8 | 100% | 0 | — | 香港辦公室 |
| ACM-AP-05/06 | 無線接入點 | 3 | 4 | 99.94% | 1 | 28 分鐘 | AP-06 重啓 — 發現事項 |
| 雲主機 01 | 雲服務器 | 2 | 5 | 99.92% | 1 | 37 分鐘 | 服務商維護 |
| 雲主機 02 | 雲服務器 | 2 | 5 | 100% | 0 | — | 報表類負載 |
| 雲數據庫 | 託管數據庫 | 2 | 4 | 100% | 0 | — | 已啓用時間點恢復 |
| 站點到站點 VPN | 廣域網 | 2 | 6 | 100% | 0 | — | 香港至深圳隧道 |
十六行覆蓋了 24 個監控對象;成對部署的設備合併爲一行顯示。一級對象指其中斷會阻斷交易時段工作的對象,二級會造成降級,三級影響局部。
各服務的冗餘現狀
| 服務 | 冗餘方式 | 切換方式 | 最近測試 | 現狀 |
|---|---|---|---|---|
| 防火牆/邊界 | 高可用對 | 自動 | 2026-08-10 | 已在維護窗口內測試切換;中斷 4 秒。 |
| 核心交換 | 堆疊對 | 自動 | 2026-06-14 | 狀況良好;下次測試與接入交換機更換一併安排。 |
| 互聯網接入 | 無 | 無 | — | 單一線路 — 本環境最大的可用性風險。 |
| 文件服務 | 無 | 僅能還原 | 2026-08-09 | 已驗證還原耗時 3 小時 12 分;正在遷移至 SharePoint。 |
| 行情數據應用 | 廠商雲 + 本地 | 手動 | 2026-07-19 | 本地服務器故障時,交易員可改用廠商網頁客戶端。 |
| 身份/Microsoft 365 | 服務商提供 | 自動 | — | 由服務商管理;應急帳號離線保管。 |
| 語音 | 服務商 + 手機 | 手動 | 2026-08-10 | 可轉接至手機;但同樣依賴這條互聯網線路。 |
跨週期結轉的未決事項
| 編號 | 風險 | 嚴重程度 | 負責人 | 到期日 | 狀態 | 下一步行動 |
|---|---|---|---|---|---|---|
| AVAIL-R01 | 互聯網線路單一 — 任何運營商故障都導致全辦公室中斷 | CRITICAL | 客戶方 COO | 2026-10-31 | 未處理 | BCS 提供兩家運營商的異路由備份線路報價。 |
| AVAIL-R02 | NAS 容量將耗盡 — 約剩十一週餘量 | HIGH | 客戶方 IT + BCS | 2026-10-15 | 處理中 | BCS 篩選歸檔候選數據;客戶在歸檔與擴容之間作出選擇。 |
| AVAIL-R03 | 文件服務器爲單點故障 — 只能依靠還原恢復 | MEDIUM | BCS + 客戶方 IT | 2026-12-31 | 處理中 | 將其餘四個共享遷移至 SharePoint。 |
| AVAIL-R04 | 語音依賴同一條線路 — 沒有獨立通路 | MEDIUM | 客戶方 COO | 2026-10-31 | 未處理 | 由備份線路方案一併解決;在此之前先記錄手機轉接流程。 |
| AVAIL-R05 | 已停止支援的接入交換機 — PoE 不穩定且無固件修復 | LOW | 客戶方 COO | 2026-11-30 | 未處理 | 批准更換 —— 參見 CONF-R04。 |
下一週期承諾事項
| BCS Support Center 將 | 需要客戶配合 |
|---|---|
| 提供兩家異路由運營商的報價,附切換方案設計與成本。 | 在 2026-10-31 前就備份互聯網線路作出決定。 |
| 篩選可歸檔至冷存儲的研究數據集,並測算可節省的容量。 | 在 NAS 擴容與歸檔舊研究數據之間作出選擇。 |
| 將深圳的無線接入點改接到受支援交換機的端口。 | 批准第四季度將其餘共享遷移至 SharePoint。 |
| 爲每一個一級對象報告容量餘量,並給出距閾值還有幾周。 | 確認 2027 年服務計劃中交易時段的定義。 |
本報告的產生方式
| 資料來源 | 擷取時間 | 記錄數 | 用於 |
|---|---|---|---|
| 監控平台 | 2026-09-01 01:05 香港時間 | 96 項檢查 | 各檢查項的可用率、中斷起止時間、確認響應耗時。 |
| 模擬應用檢查 | 2026-09-01 01:05 香港時間 | 3 個流程 | 超越主機可達性的應用級可用性。 |
| SNMP 性能歷史 | 2026-09-01 01:20 香港時間 | 31 天 | CPU、記憶體、接口與存儲利用率峯值。 |
| 存儲陣列遙測 | 2026-09-01 01:30 香港時間 | 1 台陣列 | 用於餘量預測的已用容量與增長速度。 |
| 運營商門戶 | 2026-08-31 | 2 條通告 | 線路利用率與運營商故障通知。 |
| 事件工單 | 2026-08-31 | 3 次中斷 | 原因、已採取措施與恢復證據。 |
方法與定義
可用率 按 60 秒輪詢的每一個監控檢查項計量,先按對象、再按級別彙總。只有當某項服務自身的檢查通過時,該服務才計爲可用:主機可達從不等同於應用可用。
交易時段 指香港營業日的 08:30 至 17:30(香港時間),本期共 21 天。一級服務的可用率針對該時段單獨報告 —— 因爲 03:00 的中斷與 10:00 的中斷並不是等價事件。
容量餘量 以按過去三個月增長速度、距既定閾值還有幾周來表示:存儲爲 95%,CPU 與記憶體爲持續 80%,網絡接口爲峯值 70%。預測採用線性方式,並刻意偏保守。
排除範圍。 落在約定窗口內並提前 48 小時通知的計劃內維護不計入。終端用戶設備不在可用性範圍內 —— 它們在《IT 資產管理》報告中呈現。第三方 SaaS 的可用性按我們自己的檢查觀測結果報告,而非按服務商聲稱的數值。
本文檔爲用於展示的匿名化樣本。客戶名稱、設備名稱、應用名稱、運營商與服務商身份均已替換爲虛構或通用值;可用率數字、比例、日期與發現事項反映的是一個具有代表性的受管環境。文檔中不含任何真實客戶數據。
BCS Support Center · it-service@brocent.com
客戶常問的關於本報告的問題
按 60 秒輪詢的每一個監控檢查項計量,再按對象和服務級別彙總。一台能響應 ping、但應用端口已關閉的服務器計爲不可用 —— 主機可達從不會被當作應用可用來報告。
因爲對金融機構而言,03:00 的中斷和 10:00 的中斷不是同一回事。一級服務的可用率既按整月報告,也按香港交易時段單獨報告。
涵蓋 —— 容量餘量以按過去三個月增長速度距既定閾值還有幾周來表示,因此存儲即將寫滿會作爲一項有排期的決策提出,而不是等它變成一起事故。
看看你自己的可用性監控報告會寫些什麼
免費 IT 健康檢查會針對你的真實環境產出本報告的第一版,不收費、無義務。整個過程約需一週,佔用你團隊幾個小時。