RAID 縮退後に直ちにディスク交換できるか:再構築中の二次障害リスク
RAID 縮退時はアレイ、スロット、シリアル、バックアップ、コントローラーを確認してから正しいディスクを交換し、再構築を監視します。
先に結論
RAID 縮退時はアレイ、スロット、シリアル、バックアップ、コントローラーを確認してから正しいディスクを交換し、再構築を監視します。このケースでは、まず「アレイ構成と故障ディスクのシリアル番号」と「バックアップ復元可能性の確認」を確認し、その後「コントローラー/キャッシュ状態」を基準に修正の要否を判断します。
最初に切り分ける範囲
このバックアップ/ストレージの事象では、まず「アレイ構成と故障ディスクのシリアル番号確認」と「バックアップの復元可能性確認」で障害境界を決め、その後「コントローラー/キャッシュ状態」へ進みます。本番設定を変更する前に、現状、発生時刻、正常な比較対象を記録します。
依存関係に沿った確認順序
| 確認項目 | 確認する理由 | 推奨アクション |
|---|---|---|
| 01 · アレイ構成と故障ディスクのシリアル番号 | アレイ構成と故障ディスクのシリアル番号 を、設定値だけで判断せず、ログ、カウンター、状態情報で実経路上から確認します。 | アレイ構成と故障ディスクのシリアル番号 の現在値、証跡元、時刻を記録します。変更が必要な場合は一度に一条件だけ変更し、切り戻し用に元の設定を保持します。 |
| 02 · バックアップ復元可能性の確認 | バックアップ復元可能性の確認 を、設定値だけで判断せず、ログ、カウンター、状態情報で実経路上から確認します。 | バックアップ復元可能性の確認 を読み取り中心で確認し結果を保存します。基準との差がある場合は、障害時刻と直近変更との関係を確認してから修正します。 |
| 03 · コントローラー/キャッシュ状態 | コントローラー/キャッシュ状態 を、設定値だけで判断せず、ログ、カウンター、状態情報で実経路上から確認します。 | コントローラー/キャッシュ状態 を正常系、ログ時系列、実際の業務経路と比較し、原因であることを確認してから本番設定を変更します。 |
| 04 · 正しいスロットと同等仕様での交換 | 正しいスロットと同等仕様での交換 の現在値、関連ログ、直近の変更を確認し、障害発生時刻と突き合わせて変更要否を判断します。 | 正しいスロットと同等仕様での交換 の現在値、証跡元、時刻を記録します。変更が必要な場合は一度に一条件だけ変更し、切り戻し用に元の設定を保持します。 |
| 05 · 再構築中の負荷と二次故障リスク | 再構築中の負荷と二次故障リスク の現在値、関連ログ、直近の変更を確認し、障害発生時刻と突き合わせて変更要否を判断します。 | 再構築中の負荷と二次故障リスク を読み取り中心で確認し結果を保存します。基準との差がある場合は、障害時刻と直近変更との関係を確認してから修正します。 |
| 06 · 再構築後の点検 | 再構築後の点検 の現在値、関連ログ、直近の変更を確認し、障害発生時刻と突き合わせて変更要否を判断します。 | 再構築後の点検 を正常系、ログ時系列、実際の業務経路と比較し、原因であることを確認してから本番設定を変更します。 |
根拠を確認してから変更する
- まず読み取り中心で証跡を取得し、設定変更前に「アレイ構成と故障ディスクのシリアル番号」と「バックアップ復元可能性の確認」を確認します。
- 最初の確認が正常なら「コントローラー/キャッシュ状態」と「正しいスロットと同等仕様での交換」へ進み、障害時刻と結び付く証跡を残します。
- 証跡が症状を説明できる場合に限って設定を変更します。「再構築中の負荷と二次故障リスク」を変更する前に元の値と切り戻し条件を定義します。
- 「再構築後の点検」は限定範囲で検証してから、本番ユーザーまたは本番トラフィックへ展開します。
復旧確認と切り戻し
- ユーザーまたはアプリケーションの一連の業務動作を確認し、「アレイ構成と故障ディスクのシリアル番号」単独の状態だけで完了としません。
- 変更後に「再構築中の負荷と二次故障リスク」と「再構築後の点検」を再確認し、新たな迂回、権限拡大、二次障害がないことを確認します。
- 「アレイ構成と故障ディスクのシリアル番号」から「再構築後の点検」までの証跡、変更前後の設定、業務確認結果、切り戻し点を保存します。
よくある誤判断
- 「アレイ構成と故障ディスクのシリアル番号確認」と「バックアップの復元可能性確認」を同時に変更し、どちらが原因だったか追跡できなくすること。
- 「コントローラー/キャッシュ状態」が正常というだけで、「正しいスロットと同等仕様での交換」を含む業務経路全体も正常と判断すること。
- 「再構築中の負荷と二次故障リスク」または「再構築後の点検」の一時例外を、責任者・期限・切り戻し記録なしで本番に残すこと。
関連する確認事項
「RAID 縮退後に直ちにディスク交換できるか:再構築中の二次障害リスク」はどこから確認すべきですか?
まず「アレイ構成と故障ディスクのシリアル番号」と「バックアップ復元可能性の確認」を確認します。本番状態を変えずに最初の切り分け境界を作れます。
最初の層が正常な場合、次に何を確認しますか?
次に「コントローラー/キャッシュ状態」と「正しいスロットと同等仕様での交換」を確認し、障害時刻および実際のユーザー/アプリ経路と突き合わせます。
変更後に何を残すべきですか?
「再構築中の負荷と二次故障リスク」と「再構築後の点検」の証跡に加え、元の設定、検証結果、観察記録、切り戻し点を保存します。
前の記事Veeam のイミュータブルバックアップと Hardened Repository でランサムウェア削除を防ぐ次の記事停電時に UPS で Windows Server、仮想化ホスト、NAS を正しい順序で安全停止する
