只存在於理論上的備份:一家新加坡教育科技公司的雲端備份教訓
一句話結論: 一家新加坡教育科技公司的內容伺服器出了故障,而還原時才發現:那個每晚執行的備份工作,已經靜默失敗了三個星期。備份確實按排程存在,只是沒有人在看它到底跑成沒跑成。把一份備份排程變成真正可以依靠的東西,靠的是工作狀態監控和帶日期的還原演練。
本文中的公司是一個複合情境,並非某個具名客戶,其時間軸僅作說明用途。真實的是文中描述的服務:備份工作監控、還原演練與異地雲端目標,正是博迅「雲端託管備份」實際的建構方式。
對一家數位內容企業來說,備份失效是另一種性質的事件
新加坡有一批密集的教育科技、線上學習、媒體製作與數位出版公司——五十到八十人,產品完全數位化,而那個內容庫是用好幾年時間和相當可觀的成本堆出來的:課程影片、題庫、互動模組、面向四五個市場的在地化版本,以及這一切背後的專案檔。
對這類公司來說,資料不是業務的紀錄,資料本身就是業務。一家製造企業掉了三週的檔案伺服器資料,面對的是一件麻煩的重建工作。一家教育科技公司掉了課程母帶,掉的是無法重新取得的庫存——因為講師已經離開,攝影棚是一年前訂的,而在地化供應商的工作檔案,恰恰就是伺服器上那份。
有兩個結構性細節,讓這類公司比其技術水準所暗示的更加脆弱。第一,技術成熟度是不均衡的。工程團隊確實有能力,這自然會讓人假設內部系統也被同樣妥善地照料——而內部系統通常不是任何人的產品,因此也就不是任何人的優先順序。第二,環境是一種彆扭的混合形態:面向客戶的平台跑在雲端基礎架構上、被妥善管理著;而內容生產流程則落在辦公室裡的一台地端伺服器或一台 NAS 上,因為透過 VPN 做算圖和剪輯從來就不現實。
結果就是:一家公司同時擁有一個現代化、維運良好的生產平台,和一個「儲藏室等級」的內容封存,而後者的保護,來自兩年前某人設定得當、此後再沒有人看過一眼的備份工作。
情境:一次硬碟故障,和三週的空白
這家複合情境中的公司在新加坡約有六十五名員工,為區域內的企業客戶製作與在地化課程內容。它的內容生產流程跑在一台帶直連儲存的地端伺服器上:來源影片、專案檔、算圖母帶,以及製作團隊每天使用的素材庫。
伺服器建置時,備份是按規矩設定好的。每晚工作、本地目標、保留原則設定完畢、完成時寄郵件通知。設定這套東西的人大約一年後離開了公司。郵件通知寄到一個通訊群組,那個群組漸漸沒人再看;後來被一條信箱規則自動封存;到最後,沒有人能有把握說出這些通知究竟寄給了誰。
一個星期二的上午,磁碟陣列先是降級,然後徹底失效。工程負責人按正確的順序做了正確的事——確認故障、採購替換硬體,然後去做還原。
最近一次成功的備份,是二十三天之前的。
自從一次例行更新改變了某個服務帳號的權限之後,這個工作就一直在失敗。它每晚以完全相同的方式失敗,每晚把失敗寫進一份沒人讀的紀錄檔,發出一則沒人收到的通知。從外部看,環境沒有任何異樣:備份軟體在執行,排程完好,儲存目標有可用空間。工作只是沒有完成而已——靜默地,連續二十三次。
三週的內容工作,從「可以重做」的意義上說是可還原的。它讓這家公司付出的代價是:一次延遲的客戶交付、兩個週末的製作工時,以及一批必須重新委外的在地化內容——因為供應商在交付之後,已經刪掉了自己的工作副本。
真正出錯的是什麼,而它不是軟體
把這件事讀成一次工具失靈,是很有誘惑力的。但事實並非如此。備份軟體完全按照它被設定的方式執行,而且每一個晚上都誠實地做了回報。
造成這個結果的是四個缺口,而這四個缺口,我們幾乎每次都會遇到。
沒有人負責工作狀態。 備份被當成一項設定——某件「設好」的事——而不是一項執行中的維運工作,也就不需要有人盯著。一個把失敗回報進虛空的工作,其實際價值與沒有這個工作是一樣的。
不存在一份獨立於主環境的異地副本。 備份目標就在同一間辦公室、同一個網路上,用同一套憑證就能存取。這是一份單站點副本,而它恰恰無法抵禦最可能真正傷害新加坡中小企業的兩種情況:加密它能觸及的一切的勒索軟體,以及大樓裡發生的一次實體事件。
從來沒有測試過任何一次還原。 這與「工作失敗」是兩件事。即便工作連續兩年每晚成功,也從來沒有人證明過:這些資料能在一個有用的時間窗內被還原成可運作的狀態。一份從未被還原過的備份,只是一個假設。
RTO 與 RPO 從來沒有與業務方達成共識。 從沒有人問過製作總監:公司能承受掉多少內容工作?生產流程能停多久?沒有這兩個數字,誰也無法評估「每晚一次的純本地備份」是否夠用——而事實上它並不夠用,只是當時沒有任何標準可以讓人察覺到。
最後這一點值得多說兩句,因為它是最常被跳過的。RPO 是你能承受掉多少資料,以時間表達;RTO 是你能承受停多久。兩者都是業務決策,不是技術決策。IT 可以告訴你某個 RPO 要花多少錢,但只有業務能說出它值多少。在這家複合情境的公司裡,當終於有人問出這個問題時,誠實的答案是:掉一天的製作工作可以接受,掉三週不行——而這句話一出口,現有安排立刻變得無法辯護。
博迅的觀點:一份你從未還原過的備份,只是一個假設
博迅自 2007 年起在亞洲各地營運 IT,2016 年設立香港辦公室,2021 年起總部設於新加坡。備份與災難復原包含在我們每一個託管 IT 方案級距中,而之所以是「包含」而不是「選配」,原因正是上面這個模式:真正吃虧的公司,幾乎從來不是完全沒有備份的那些,而是有備份、卻沒有人在看的那些。
我們的雲端託管備份服務,圍繞三件「設定完就忘」的備份工作所不具備的事情來建構。
7×24 的備份工作監控。 我們的 SCC 與 NOC 團隊把備份工作當作一項有人值守的維運工作來監控,而不是一封通知郵件。一個在星期二失敗的工作,會在同一週內浮出水面——而不是二十三天之後,在一次事故的中途。
定期還原演練。 我們與客戶一起定期執行資料還原演練,以驗證備份的完整性與可還原性。產出是一份帶日期的結果:在這一天,這批資料被還原了,用了這麼長時間。這正是把假設變成事實的那份憑據,也正是保險公司或企業客戶的盡職調查問卷真正想要的東西。
一份書面約定 RTO 與 RPO 的營運持續計畫。 我們支援客戶定義營運持續計畫(BCP),涵蓋資料備份與災難復原的策略與方法論,並明確對應 RTO 與 RPO。這正是那家複合情境的公司從來沒有過的對話,而它決定了下游的每一個技術決策。
在底層,設計遵循市場上簡稱為 3-2-1 的紀律:至少三份資料副本、分布在至少兩種不同的媒體或平台上、其中至少一份存放在異地。落到實處,這意味著:為辦公室裡的伺服器與系統做地端備份;把雲端 IaaS 環境中的資料彙整到地端儲存、或彙整到另一個雲端平台以達成跨雲備援;以及在風險狀況需要時,把實體備份媒體異地存放在第三方倉儲機構。我們使用 Veeam、Microsoft、Acronis 與 MSP360 的工具,備份目標支援 Azure、AWS 與阿里雲——工具是按環境來選的,而不是反過來。
有一點我們是刻意的:這不是一件單獨賣給你、然後由你自己照看的產品。備份與災難復原包含在每一份託管 IT 支援方案裡,因為工作狀態監控是一項維運紀律,它屬於和修補程式管理、端點防護、NOC 監控站在一起的位置,而不是孤零零地成為又一個沒人打開的儀表板。
對這個規模的公司來說,做對了是什麼樣
對一家六十五人、生產流程舉足輕重的教育科技公司來說,務實的形態並不玄妙。
工作狀態由一個以此為職責的人來盯。 不是一封通知郵件,也不是工程負責人「打算去看一眼」的儀表板,而是一項有人監控、失敗時有升級路徑的維運工作。
至少有一份副本在異地,並且使用獨立憑證。 異地副本不應該用「在勒索事件中同樣會被攻陷的那套憑證」存取到。對新加坡中小企業的實際存活能力來說,這是提升最大的一項改動,而它通常也是清單上最便宜的一項。
還原演練按排程進行,並產出帶日期的結果。 每季一次是合理的基礎頻率。演練應該把真實的東西還原成可用狀態,而不只是驗證一個備份檔能被打開。
RTO 與 RPO 寫下來,並由業務方簽核。 兩個數字,與承擔後果的那個人達成共識。其餘一切都由此推導出來,包括你到底應該花多少錢。
保留原則要符合業務的真實運作方式。 一家內容公司常常在交付數週之後才發現某個母帶檔案有問題。七天的保留期間和九十天的保留期間是兩種不同的產品,而這個差別只在你需要它的那一刻才顯現出來。
雲端平台自身的資料要納入範圍。 Microsoft 365、Google Workspace 與各類 SaaS 平台的資料,常被預設為「供應商已經備份了」。供應商的複寫機制保護的是他們的基礎架構故障,而不是你自己的誤刪、離職員工清空信箱、或者在你租用戶內部執行的勒索軟體。這是我們最常發現的缺口之一。
雲端託管備份自基礎預防性備份維護方案 298 美元起,另有一項按裝置計費的雲端備份加購服務,其每裝置月費與託管方案的其餘部分一同公布在價格頁面。如果你想看看服務底下用的是什麼,備份與復原頁面涵蓋了相關的工具選項。
勒索軟體版本的同一個故事
有必要把反事實情形直說出來,因為它會改變你閱讀上面那個情境的方式。
在這家複合情境的公司裡,故障是一次磁碟陣列降級。那是溫和的版本:它自己發出了動靜,只影響一個系統,而備份目標——儘管已經過期——在有人去找的時候,仍然是完整、可讀的。
把同一個環境放進一次勒索軟體事件裡,算術就完全變了。透過有效憑證觸及檔案伺服器的加密程式,會觸及這套憑證能夠寫入的任何其他東西;而一個位於同一網路、用同一個服務帳號掛載的備份目標,恰恰就是「任何其他東西」。這家公司發現的將不是一份二十三天前的備份,而是一份被加密的備份。
這就是為什麼異地副本不是備份策略的一項優化,而是它的承重結構;也是為什麼不可變性很重要。一份在保留期間內無法被修改或刪除的副本——即便是管理員、即便憑證正確——才是那個能在攻擊者已經接管你的環境之後仍然存活下來的東西。不可變備份被納入我們託管方案中「備份/災難復原」的基準線,原因正在於此。
這裡還有一個容易被忽略的次級要點。在一次勒索事件中,問題不只是「我們能不能還原」,還有「多快、從哪裡還原」。如果你唯一完好的副本在某個雲端區域,而你需要把好幾 TB 的資料還原到一批你還沒有採購的硬體上,那麼無論備份多麼正確,這次還原都要以「天」計。這是一場關於 RTO 的對話,而它最好發生在事故之前,而不是事故當中。
新加坡企業處理備份的三種方式
一個無人監控的排程工作
- 你得到什麼: 一個在執行的、設定正確的備份,且沒有持續成本。
- 在哪裡失效: 靜默地失效。工作的失敗被回報進一份紀錄檔或一個沒人看的信箱,而這段空白會在一次真實事故中被發現——那是知道「它已經持續多久」的最糟糕時刻。
- 判別方法: 如果你說不出昨晚的備份工作結果是誰讀的,那就是沒有人讀。
- 適合誰: 沒有人——儘管誠實評估的話,這描述了相當大一部分中小企業的現況。
自行管理的雲端備份工具
- 你得到什麼: 能力不差的軟體、異地目標、保留原則控制,以及完整的彈性。
- 在哪裡失效: 它仍然需要有人盯工作狀態、跑還原演練。在一家 IT 只有一兩個人、而且他們自己還有產品藍圖要顧的公司裡,演練是第一件被推掉的事,而工作狀態監控會悄悄退化成「要是出問題我們應該會注意到吧」。
- 適合誰: 有專職基礎架構人員、並且這個人有授權保護這段時間的公司。
帶監控與還原演練的託管雲端備份
- 你得到什麼: 由 SCC/NOC 團隊執行的 7×24 備份工作監控、帶日期結果的定期還原演練、獨立於主環境的異地雲端目標,以及一份書面約定 RTO 與 RPO 的營運持續計畫。工具涵蓋 Veeam、Microsoft、Acronis 與 MSP360;目標支援 Azure、AWS 與阿里雲。
- 成本: 基礎預防性維護方案自 298 美元起,另加雲端備份加購服務的每裝置費率。備份與災難復原在每一個託管 IT 方案級距中都已包含。
- 在哪裡失效: 它無法替業務方決定 RTO 與 RPO。我們可以給建議;但我們無法決定你的停機時間值多少錢。
- 適合誰: 資料就是產品的公司,以及那些「內部團隊的時間花在產品上,比花在看工作紀錄檔上更划算」的公司。
常見問題
雲端備份是怎麼計價的?
按範圍分兩種。雲端託管備份自基礎預防性備份維護方案 298 美元起,涵蓋設計、部署與有人值守的維運。針對端點與裝置層級的涵蓋範圍,另有一項雲端備份加購服務,按每裝置月費公布;超出所含儲存配額的部分按環境單獨報價。兩者都與託管 IT 方案並行,而備份與災難復原在每一個級距中都已包含。目前數字請見價格頁面。
什麼是 3-2-1 備份策略?
至少三份資料副本,存放在至少兩種不同的媒體或平台上,其中至少一份在異地。第三份副本的意義不在於備援本身——而在於那份異地副本應當能在「摧毀另外兩份的那個事件」中存活下來;在實務上,那個事件通常就是觸及你網路上一切的勒索軟體,或者你所在大樓的一次實體事故。一份與它所保護的伺服器位於同一網路上的本地備份,以上三條一條都不滿足。
還原到底應該多久測試一次?
對大多數中小企業而言,每季一次是合理的基礎頻率;對 RTO 要求較緊的系統則應更頻繁。真正重要的是演練產出了什麼:一份帶日期的紀錄,顯示某批具體資料被還原到了可運作狀態,以及用了多長時間。那個時長才是你真實的 RTO,而不是計畫文件裡寫的那個;第一次真正量測時,這兩個數字往往差得相當遠。
備份和災難復原有什麼區別?
備份是資料的一份副本。災難復原是在約定時間內恢復運轉的能力。你完全可能擁有完整、有效的備份,卻仍然停擺一週——因為把好幾 TB 資料透過辦公室的網際網路連線、還原到一批你還沒採購的硬體上,需要多久就是多久。災難復原規劃關注的是 RTO,也就是時間,而它改變的是「你要建什麼」,而不只是「你要複製什麼」。
這可以備份到哪些雲端平台?
Azure、AWS 與阿里雲是我們支援的目標平台,工具視環境而定,涵蓋 Veeam、Microsoft、Acronis 與 MSP360。我們同樣支援把雲端 IaaS 環境中的資料彙整到地端儲存,或彙整到第二個雲端平台以達成跨雲備援;在風險狀況需要時,也支援把實體備份媒體異地存放在第三方倉儲機構。
如果一個備份工作靜默失敗了會怎樣?
在一項被監控的服務裡,它不會一直靜默。我們的 SCC 與 NOC 團隊以 7×24 的方式把備份工作作為一項有升級路徑的維運工作來值守,因此失敗會在同一週內浮出來,而不是在一次還原嘗試中才暴露。這正是「設定好的備份」與「被託管的備份」之間的具體差別,也正是本文情境所圍繞的那個差別。
這適合一家五十到八十人的公司嗎?
適合,而且這個規模往往是缺口最大的地方。這個體量的公司,資料量已經足夠重要,技術自信也足夠讓人假設「這塊應該有人管」,但很少有一位以「讀備份紀錄檔」為職責之一的專職基礎架構人員。基礎預防性維護方案正是為這類環境設定的範圍。
除了伺服器,這會涵蓋我們的 Microsoft 365 資料嗎?
可以涵蓋,而且通常應該涵蓋。微軟的複寫機制保護你的是他們的基礎架構故障,而不是誤刪、離職員工清空信箱、或者持有有效憑證、在你租用戶內部執行的勒索軟體。SaaS 資料是我們在方案階段最常發現的缺口之一,恰恰因為它感覺像是「別人的問題」。
下一步
本文這家複合情境中的公司,並沒有掉了它的內容庫。它掉的是三週時間、一個客戶交付日期,和一批在地化內容——代價昂貴但可以撐過去;而這只是因為那次失效恰好是由硬體故障暴露的,而不是由勒索軟體——後者會順著同一個網路觸及那個備份目標。
有用的問題不是「你有沒有備份」。幾乎所有人都有。有用的問題是:昨晚的工作結果有沒有人讀;有沒有一份副本存在於你的主憑證觸及不到的地方;以及最近有沒有人真的還原過什麼,並把用了多長時間寫下來。
如果這三個問題沒有篤定的答案,那麼這個缺口是很容易補上的,而且遠比那場會暴露它的事故便宜。我們的雲端託管備份服務涵蓋監控、演練與異地目標,而備份與災難復原在託管 IT 支援的每一個級距中都已包含。歡迎與我們聯絡,我們從你現在有什麼、以及它會在哪裡失效開始談起。
分享:
📬 亞太IT月報
中國合規動態、網絡安全預警及亞太IT實踐指南,每月一期。
不發垃圾郵件,隨時可取消訂閱。