你的伺服器在將軍澳。到底誰去機籠?
簡短答案: 香港的主機代管為你買到電力、冷卻、連線和實體安全,但它買不到人手、眼睛、備品、變更紀錄,以及凌晨三點的升級路徑。機籠裡的這五件事終究屬於某個人——而在多數中小型交易公司裡,它們在真正出事的那一晚之前,其實不屬於任何人。
一家香港券商在將軍澳簽了主機代管合約,把兩座機櫃的交易與行情基礎架構搬了進去,平穩運行了十八個月。然後在某個星期天,一組備援電源模組壞了,備用模組沒有乾淨地接手,而技術長是在灣仔排隊等計程車的晚上十一點,才發現公司裡沒有人對一個簡單問題有成文的答案:到底誰去機籠?
以下是一個具代表性的複合情境,不是某個具名客戶。它以博迅在香港 Equinix IBX 資料中心的真實專案工作,以及下文所述的真實服務線為基礎。文中沒有虛構任何價格數字、統計數據或客戶名稱,並且刻意不引用任何「每機櫃」或「每千瓦」的主機代管報價——這些數字隨機房、合約和功率密度差異極大,公布出來只會誤導。
香港的主機代管,究竟把什麼留給了你負責?
主機代管常被描述成「在資料中心租一塊地方」。這個說法準確,但沒有幫助,因為它遮住了真正重要的那條邊界。
機房提供的東西確實優秀,也確實狹窄:具備援的淨化電力、符合規格的冷卻、實體安防與門禁、消防抑制、連接電信商和交易所的結構化連線,以及一棟在颱風天裡屹立不動的建築。在香港,你買到的還有「鄰近性」——鄰近交易對手、鄰近交易所基礎架構、鄰近讓低延遲連線成為可能的電信商互連機房。
機房不提供的,是你設備的營運。在你的機籠裡,機櫃是你的,伺服器是你的,交換器是你的,佈線是你的,韌體版本是你的,資產清冊是你的,凌晨三點的故障也是你的。
大多數代管服務商會向你銷售某種形式的「遠端協助」(remote hands)——一名值班技術員在 SLA 內依請求執行一組定義好的實體動作。這是一項真實且有用的服務。它也經常被誤解為可以取代營運主體責任,而它不能,原因下文會談。
情境:兩座機櫃、十一公里,以及沒有一個人的份內事
設想一家約六十人的香港持牌券商——自營交易與面向機構客戶的代理執行兼有。前台在中環。將軍澳的機房裡有兩座機櫃,裝著委託管理與執行伺服器、行情資料接收處理程式、一對防火牆、機架頂端交換器、一台小型儲存陣列,以及到券商和行情供應商的交叉連接。
技術團隊四個人。一位從交易背景轉過來的技術長,兩位維護自研執行邏輯的開發工程師,還有一位系統工程師負責其餘的一切——端點、Microsoft 365、辦公網路、供應商管理,以及資料中心。
這位系統工程師兩年裡去過機籠十一次。每一次都是計畫外的。每一次都消耗掉一整天,因為將軍澳不是你可以在兩個會議之間順路去一趟的地方。而且在那個當下,每一次都是全公司優先順序最高的事。
這裡面沒有任何失職。它完全是一個理性的結果:公司成長到「一個人無法同時涵蓋辦公室和機籠」的規模之後,沒有人注意到這個時刻已經發生了。失效模式不是能力不足,而是機籠沒有負責人,只有志願者。
機籠裡預設沒有主人的五件事
手:在正確的時間、以正確的方式做實體介入
最顯而易見的一件。總得有人重新插拔一顆硬碟、更換失效的電源模組、重新接一條網路線、把一台已經不回應管理介面的設備斷電重啟,或者用肉眼確認兩台標籤一模一樣的機器裡究竟是哪一台壞了。
機房的遠端協助能做其中大部分,而對於「把 U14 位置的設備斷電重啟一下」這種明確請求,它恰恰是正確的工具——快、人已經在樓裡、沒有路上時間。它變薄的地方,在於任務需要的是對你環境的判斷,而不是對既定動作的執行。一名照著工單做事的遠端協助技術員不會知道:你的備援行情接收程序在主程序完全追平之前絕不能啟動——因為這件事沒有寫在任何他們看得到的地方。
眼:注意到機房監控涵蓋不到的東西
資料中心監控的是它自己的基礎架構——用電量、溫度、濕度、門禁事件。它不監控你的 RAID 陣列是不是已經降級運行了六週、某個備援電源是不是已經悄悄壞掉讓你變成單路供電、某顆風扇是不是停了,或者你的交換器自從別人裝機時碰過一條線之後,上行埠是不是一直在記錄 CRC 錯誤。
這是把「非事件」變成「停機」的那一類故障。備援失效在定義上就是靜默的——備援的全部意義就是服務照常運行。如果沒有人在盯著「備援的喪失」,你會在第二次故障發生的同一刻,才知道第一次故障。
博迅在這裡的做法很直接:IT 硬體維護圍繞一個 7×24 網路維運中心(NOC)建構,監控系統感知基礎架構健康狀態並向 NOC 團隊觸發告警以便立即回應,背後是持有 CCIE 與 CISSP 認證的三線後端工程師負責排錯並提出修復行動建議。NOC 的意義不在於它比你盯得更用力,而在於它連續地盯著——這是任何四人技術團隊都做不到的。
品:備品、保固,以及那個要花十一天的 RMA
當一個零件壞掉時,問題不是「能不能換」,而是「正確的料件多快能到正確的那棟樓裡」。原廠的次工作日保固在星期二早上是好東西,在國定假日的凌晨兩點就相當沒用了。
實務上有三種答案,而公司通常是無意中選中一種,而不是有意選擇。在機籠裡放冷備品——對交換器便宜,對伺服器又貴又麻煩,而且只有在有人能裝的前提下才有用。依賴原廠保固——乾淨、有合約保障,但節奏按原廠方便而不是按你方便。或者簽多品牌第三方維護,由服務商持有庫存。博迅走的是第三種模式:在 12 個國家設有倉庫,儲備硬體設備與備品並做系統化追蹤,在單一第三方維護合約下涵蓋 HPE、IBM、Cisco、Dell/EMC、Juniper、Palo Alto、Fortinet、NetApp、Aruba、Lenovo、Polycom 及大多數主流製造商,並在香港、中國大陸、日本和新加坡持有當地備品。
紙:資產清冊、變更紀錄與汰除憑證
這是感覺上最不緊急、但事後最容易出麻煩的一件。尤其對持牌機構而言,能夠有把握地說清楚機櫃裡有什麼、什麼時候改了什麼、誰核准的、拆下來的設備去了哪裡,不是行政上的整潔,而是任何與主管機關、稽核師或資安保險公司的營運韌性對話的證據基礎。
一個不太舒服的事實是:機籠文件恰恰在機籠最忙的時候衰減得最快。一家公司能擁有的最有價值的單一資料,是一份帶序號的、當前的機櫃正視圖;而我們走進一個無人管理的機籠時最常見的發現是,最後一份準確的版本是三年前的。
升級:誰會從床上爬起來,以及他被授權做什麼
最後一件事只在凌晨三點存在。打給誰?他一個人能決定什麼?他能不能授權機房技術員把某台設備關掉?對那四五種真正會威脅到交易日的失效模式,是否有成文的處置手冊,還是只有一個「大致都記得」的人?
一條只存在於一個人腦子裡的升級路徑不是升級路徑。它是一個掛著職稱的單點故障。
機房遠端協助、MSP 現場工程師,還是專屬駐點?
三種模式的比較
- 機房遠端協助: 可能的最快實體回應,因為技術員已經在樓裡。按次或按時間區塊計價。最適合簡單、能被精確描述的動作——斷電重啟、重新插拔、更換有標籤的零件、拍一張狀態燈的照片。最弱的地方在於任務需要環境相關判斷,因為這位技術員是刻意通用的:他要支援樓裡所有租戶,不可能知道你的系統相依關係。
- 維護合約下的 MSP 現場工程師: 到場比樓裡的人慢,但他們到場時了解你的環境、帶著你的備品,並且擁有從頭到尾完成工作的授權和文件。這個模式同時涵蓋「眼」「品」「紙」和「手」四件事,因為它是一段持續關係,而不是一次按次交易。博迅的現場服務與基礎架構部署團隊正是這樣運作的,配備區域認證工程師、廠外預組態與結構化的機架部署專案管理。
- 你自己的專屬駐點人員: 完全的控制與完全的脈絡,在超過某個規模之後是正確答案。在那之前,它是一種昂貴的「購買可用性」的方式,因為這份工作是突發性的——長時間的安靜被高強度的日子打斷——而且一個人無論如何也涵蓋不了 7×24。由服務商提供的全職駐點工程師是一條中間路徑:一位專屬的具名工程師,但背後有休假補位和升級網路。
實務上,一家六十人、兩座機櫃的券商,正確答案幾乎總是組合:瑣碎且緊急的交給機房遠端協助,凡是需要備品、判斷或文件的交給維護合約,再加上一條清楚寫下來的「哪件事歸哪邊」的規則。
真正決定該選哪一種的因素
- 做錯了有多難挽回? 在交易環境裡把錯誤的設備斷電不是小錯。實體動作的後果越重,你越希望做這件事的人了解你的系統,而不是照著工單執行。
- 這件事需要備品嗎? 如果需要,問題就塌縮成物流問題:誰持有備品,它離這裡多遠?
- 這件事會產生你以後要用到的證據嗎? 汰除、報廢,以及任何觸及受監管系統的變更,都需要成文的鏈條——這是合約形狀的要求,不是遠端協助形狀的要求。
博迅怎麼看待機籠營運
以真實專案為基礎:Equinix IBX 案例
博迅在這件事上的看法不是理論。我們的資料中心專案之一,是為一家金融服務客戶在香港 Equinix IBX 資料中心執行的機架部署與汰除工程:汰除 37 台 HP DL380 及 HP 交換器,安裝部署新的 Cisco UCS、ISR 4329 防火牆與 Nexus 5624Q 交換器,在 ITAD 流程中提供經認證的資料銷毀證書,並在最後交付功能測試與試車報告。整個工程刻意分布在六個週末日執行,以避免打斷客戶業務。
這段描述裡有好幾件事才是真正的教訓,而它們很容易被一眼掃過去。
它被排在週末。 不是因為週末加班光榮,而是因為對金融客戶來說,工作日變更視窗的成本是用交易衡量的,不是用工程工時衡量的。機籠作業應當把業務行事曆當作第一順位的約束來規劃,而不是事後再塞進去。
舊設備產出的是證書,不只是一座空機櫃。 對汰除設備做經認證的資料銷毀,是「我們把伺服器搬走了」和「我們能證明每一顆硬碟的去向」之間的差別。對受監管的機構來說,這是幾年之後真正起作用的那一部分。
有一份試車報告。 交接時的功能測試與書面報告,才是把一次實體安裝轉換成一個「你可以據以推理的、成文的狀態」。沒有它,資產清冊從第一天就開始衰減。
營運原則:把「緊急」和「判斷」分開採購
我們對代管基礎架構的工作規則是:速度和判斷應當來自不同的來源。凡是正確動作可以事先被完整描述的事情,都應該交給實體上最近的人,通常就是機房遠端協助,並且應當預先授權,這樣沒有人需要在凌晨三點糾結自己有沒有資格提這個請求。
凡是正確動作取決於「了解環境」的事情,都應當由持續持有這份脈絡的工程師處理——這代表它必須是一段有成文環境知識的常設關係,而不是一次呼叫。
大多數演變成停機的機籠事件,要麼是第一類事情因為沒人被預先授權而處理得慢,要麼是第二類事情被一個沒有脈絡的人處理得快。
在需要之前先寫好處置手冊
對處在這個位置的公司來說,回報最高的一項工作大約需要兩天,而且不需要任何資本支出。
產出一份當前的機櫃正視圖,包含每一台設備、序號、位置、供電路徑和交叉連接。寫下那四五種真正會威脅交易日的失效模式,並為每一種寫明最先的三個動作和誰有權執行。以書面形式預先授權機房遠端協助執行一份定義好的安全實體動作清單,讓「授權」不再是凌晨三點的一場對話。確定每一類備品放在哪裡、需要多久能到。並且記錄呼叫順序和真實電話號碼,而不是一個郵件群組。
這份文件比升級 SLA 更值錢,而且幾乎沒有人有。
什麼在推動機籠營運的成本
我們不會在這裡公布每機櫃或每千瓦的主機代管價格。它們隨機房、合約期、功率密度和連線組合的差異太大,公布出來只會誤導,而香港的價差尤其寬。真正值得理解的,是哪些變數在推動你的營運成本——注意這和你的機房帳單是兩回事。
設備數量與品牌離散度。 一個多品牌的資產群比一個整合過的更難也更貴維護,因為備品、韌體知識和支援關係都會成倍增加。第三方維護存在的很大一部分意義,就是把這種離散度重新收斂回一份合約裡。
資產中真正具備援的比例。 真實的備援把大多數零件故障從事件變成計畫內工作,成本大幅下降。部分備援——最常見的情況——產生的是最糟的經濟性,因為你付了硬體的錢,卻沒換來回應時間上的寬限。
環境的文件化程度。 無文件的環境營運成本更高,理由很簡單:每一次介入都要從一段摸索開始。這項成本在任何帳單上都看不見,卻完全真實。
變更頻率。 一年變兩次的機籠和一個月變兩次的機籠,是兩種不同的營運產品,無論機櫃數量寫的是多少。
關於機房這一側,我們已發布的香港資料中心位置與供應商指南和香港資料中心成本驅動因素分別談的是「怎麼選機房」和「它的價格由什麼決定」。本文刻意是這兩個問題之後的那一個:機籠你已經有了,那麼誰來營運它?
常見問題
主機代管的遠端協助和託管服務有什麼區別?
遠端協助是一項按次執行的服務:你描述一個實體動作,現場技術員在 SLA 內執行它。託管服務是一段持續的營運關係:監控、備品物流、文件、變更控管與升級,實體介入只是其中一個組成部分。遠端協助回答的是「有沒有人能去按那個按鈕」。託管服務回答的是「這座機櫃到底有沒有人負責」。
我們兩個都需要,還是其中一個可以取代另一個?
對大多數代管客戶來說,兩個都要。遠端協助在簡單動作上的速度無可匹敵,因為技術員已經在樓裡,而且應當針對一份定義好的安全任務清單預先授權。維護合約涵蓋一切需要備品、判斷、文件或連續性的事情。它們是互補的,而真正有用的工作是把每一件可預見的任務歸到哪一類寫下來。
我們怎麼知道代管的基礎架構是不是真的在被監控?
問一個具體問題,而不是一個籠統問題:如果某台伺服器的某組備援電源現在壞了,誰會知道、透過什麼方式、多久之後知道?如果誠實的答案裡包含「某個人剛好登入進去看了一眼」,那麼這些設備就不是在被監控,而是偶爾被觀察。備援喪失的偵測是最值得驗證的一項,因為這類故障在設計上就是靜默的。
我們是持牌機構,這會改變我們對機籠營運的要求嗎?
它改變的更多是證據要求,而不是技術要求。資產準確性、變更紀錄、授權鏈條和經認證的報廢憑證,會從「好的做法」變成「你必須拿得出來的東西」。實務上的意涵是:文件與保管鏈應當在合約裡被明確約定,而不是預設存在——包括對任何汰除設備的經認證資料銷毀證書。
乾脆從主機代管搬去雲端是不是更值得?
有時候是,而且這確實是一個開放問題而不是既定結論——但它和本文討論的是兩個不同的問題。對延遲敏感的執行基礎架構,以及到行情供應商的交叉連接,屬於最難搬的那一類;而部分遷移往往留給你一座更小的機籠,和同樣五件沒人負責的事。如果你正在考慮,無論如何都要先為「留在機籠裡的那部分」決定營運模式。
工程師多快能抵達香港的資料中心?
這取決於機房、時段和門禁流程——資料中心的進入本來就刻意不快,一位沒有預先登記的首次訪客可能在保全櫃檯耗掉一小時,無論他過海過得多快。這正是「預先登記的具名工程師常設進入名單」比純粹的路程時間更重要的原因,也是這件事該在事故之前而不是事故當中安排好的原因。
博迅在資料中心裡究竟做些什麼?
機架部署與汰除、帶備品的硬體故障修復、結構化佈線、網路設備安裝與試車、廠外預組態與預測試、UAT 與試車報告、資產標籤、韌體與 BIOS 升級,以及經認證的 IT 資產報廢。博迅自 2016 年起在香港設有辦公室,擁有區域認證現場服務工程師,並在香港、中國大陸、日本和新加坡持有當地備品。
結論
主機代管是一個乾淨、被充分理解的產品,有一條乾淨、被充分理解的邊界——而問題恰恰就是這條邊界。邊界上機房那一側的一切,都是某個人的全職工作,還掛著 SLA。邊界上你這一側的一切,同樣是某個人的工作,但在小公司裡,那個「某個人」往往不是任何具體的人。
解決辦法並不奇特。把這五件事寫下來。為每一件決定:由機房遠端協助負責,由維護合約負責,還是由你自己的人負責。提前把安全的實體動作書面授權出去。做出一份當前的機櫃正視圖。知道備品在哪裡。
如果你的伺服器在將軍澳、葵涌、柴灣或香港的任何其他地方,而你並不確定星期天晚上誰去機籠,聯絡我們——或者,如果你更想從文書工作開始,就從機櫃正視圖開始。它是這份清單上最便宜的一項,而且通常告訴你最多。
分享:
📬 亞太IT月報
中國合規動態、網絡安全預警及亞太IT實踐指南,每月一期。
不發垃圾郵件,隨時可取消訂閱。