RSSおすすめ記事です

スポンサーリンク

AWS、東京リージョンの大規模障害について詳細を報告。冷却システムにバグ、フェイルセーフに失敗

ニュースAmazon, クラウド

スポンサーリンク

AWS、東京リージョンの大規模障害について詳細を報告。冷却システムにバグ、フェイルセーフに失敗

1 : 名無しのシステムエンジニアさん 2019/08/26(月) 17:54:46.68 ID:CAP_USER.net

2019年8月23日金曜日の午後に発生したAWS東京リージョンの大規模障害について、AWSは日本語での詳しい報告を公開しました。

報告によると直接の原因は東京リージョンのデータセンターで使用されている冷却制御システムにバグがあったこと。これにより、緊急時の手動操作にも冷却制御システムの一部が反応しないなどでサーバが過熱し、障害に至ったと説明されています。

8月23日午後に約6時間の障害。EC2だけでなくRDSも
報告によると、障害は日本時間2019年8月23日金曜日の昼過ぎに発生。影響範囲は仮想マシンを提供するAmazon EC2とブロックストレージを提供するAmazon EBSのそれぞれ一部。以下、AWSの報告を引用します。

日本時間 2019年8月23日 12:36 より、東京リージョン (AP-NORTHEAST-1) の単一のアベイラビリティゾーンで、オーバーヒートにより一定の割合の EC2 サーバの停止が発生しました。この結果、当該アベイラビリティゾーンの EC2 インスタンスへの影響及び EBS ボリュームのパフォーマンスの劣化が発生しました。

障害の原因は冷却制御システムのバグによってサーバがオーバーヒートしたため。その冷却制御システムは、障害発生から約3時間後の15時21分に復旧します。

冷却制御システムの復旧によってデータセンターの室温が低下し、影響を受けたEC2インスタンスとEBSボリュームの大部分が回復したのは、障害発生から6時間後の18時半頃。一部についてはさらに復旧に時間がかかっています。

日本時間 18:30 までに影響を受けた EC2 インスタンスと EBS ボリュームの大部分は回復しました。少数の EC2 インスタンスと EBS ボリュームは、電源の喪失と過大な熱量の影響を受けたハードウェアホスト上で動作していました。これらのインスタンスとボリュームの復旧には時間がかかり、一部につきましては基盤のハードウェアの障害によりリタイアが必要でした。

マネージドサービスのAmazon RDSも同時に障害
また、今回公開された報告には含まれていませんが、この障害はAmazon RDSにも影響していました。Amazon RDSでは障害発生のタイミングはほぼ同時ながら、解消まで約10時間かかっています。

下記情報は記事執筆時点でAWSヘルスダッシュボードのRSSの中に残っていますが、いずれ消えてしまうはずです。

日本時間 2019年8月23日 12:36 から 22:05 にかけて、東京リージョンの単一のアベイラビリティゾーンで一部の RDS インスタンスに接続性の問題が発生しました。現在、この問題は解消しており、サービスは正常稼働しております。詳細はこちらをご覧ください。

この障害の詳細情報へのリンク先も今回の大規模障害の報告ページになっています。

つまり8月23日金曜日の午後の大規模障害の範囲はAmazon EC2、EBSだけでなく、少なくともAWSがマネージドサービスで提供しているAmazon RDSにも広がっていたことになります。ただし障害の範囲は1つのアベイラビリティゾーン内だったとされています。

(ほかにもこの障害との関係は未確認ながら、同時間帯にAWSのマネージメントコンソールが利用できなくなった、Amazon ELBでエラーが発生した、といった利用者の声もあがっています)。
以下ソース
https://www.publickey1.jp/blog/19/aws23.html


スポンサーリンク

ネットの反応

2 : 名無しのシステムエンジニアさん 2019/08/26(月) 18:10:53.06 ID:MdMjbVb5.net
Left Caption

シングルAZ障害でRDSに影響でたらアカンやん

4 : 名無しのシステムエンジニアさん 2019/08/26(月) 19:25:13.50 ID:iB2tfw+9.net
Left Caption

これだけ大規模なのに人がコントロールしてるとは…

5 : 名無しのシステムエンジニアさん 2019/08/26(月) 19:38:27.88 ID:hOe1S+oD.net
Left Caption

こんな時にQRコード決済があるから財布いらねーなんてやったら支払いできずに4ぬパターンだな
障害のせいで店でアプリが起動しなくてポイントをもらい損ねた

9 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:13:20.79 ID:96edZYZw.net
Left Caption

何でマルチリージョンにしないの?バカなの?死ぬの?

23 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:48:14.47 ID:AdFo0ZfW.net
Left Caption

>>9
予算がねえに決まってんだろ

11 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:14:00.52 ID:9iqDCdOp.net
Left Caption

クラウドを過信すると痛い目を食らうど

13 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:18:54.23 ID:Q06VP0Cc.net
Left Caption

最近のデータセンターの冷却は機械学習・AIが流行ってるらしいが、これはどうだったんかな?

16 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:26:54.18 ID:nsapGNWm.net
Left Caption

AWSも簡単に落ちるんだな。。。

18 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:32:23.47 ID:Xf50K2rt.net
Left Caption

>この度の事象発生時、異なるアベイラビリティゾーンの EC2 インスタンスや EBS ボリュームへの影響はございませんでした。
>複数のアベイラビリティゾーンでアプリケーションを稼働させていたお客様は、事象発生中も可用性を確保できている状況でした。

なんかMulti-AZにしてれば大丈夫だったみたいな説明をAmazonがしてるけど、
Multi-AZでもサービスに支障きたしてたとこがちらほらあったんでそ?

19 : 名無しのシステムエンジニアさん 2019/08/26(月) 20:34:05.15 ID:W2w00RVJ.net
Left Caption

あれっ?
大規模火災じゃなかったのか?

29 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:15:13.57 ID:LiD9eIo7.net
Left Caption

>>19
それはリアルアマゾンの深林での話

26 : 名無しのシステムエンジニアさん 2019/08/26(月) 21:08:01.07 ID:MPx1SgQE.net
Left Caption

高額エンジニアを雇えば問題ないと思ってたけど、
設備の方も多重請負が酷いんだろうな
設備の方も多重請負を規制しろ

30 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:26:12.11 ID:PHwGRv8w.net
Left Caption

トラブルはどうしようもないとしても、
一ヶ所こけたら、みんなこけるんだね。

31 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:29:04.21 ID:D/sX+Yhh.net
Left Caption

冗長化なんて気休めなんだよね

33 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:49:18.00 ID:RG0VRuP7.net
Left Caption

サービスレベルに関して「クラウド > オンプレ」は幻想

36 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:56:26.41 ID:wzVAKSxi.net
Left Caption

>>33
そうね

だな、信頼性が命でデータセンターや運用スタッフを自前で持つ金融機関ならともかく
普通の企業は自前で持つコストを考えたらクラウドを選ぶよなあ

34 : 名無しのシステムエンジニアさん 2019/08/26(月) 23:50:34.70 ID:HVW9VAFv.net
Left Caption

フェールセーフに失敗するなんて有り得ない。
それはそもそもはじめからフェールセーフではなかったということ。

37 : 名無しのシステムエンジニアさん 2019/08/27(火) 00:11:26.93 ID:+WOR4zXc.net
Left Caption

熱制御のバグでダウンまで分かったが、もっと分かりやすく原因と障害対策、
今後の見通しを説明しろや、変なカタカナ英語を除いた日本語で。

39 : 名無しのシステムエンジニアさん 2019/08/27(火) 00:30:57.93 ID:5IRe9ls7.net
Left Caption

>>37
たぶんだけどIDCそれぞれの空調制御と>>1の冷却制御システムはまた別のシステムなんだよ。
で、急に涼しくなったからIDC側で空調の設定を変えたら>>1のバグが発生とかそんな感じかと。

AWSといってもIDCは色々だろうからアマゾン側で繋ぎ込みに失敗してたんだろ。
例えばIDC側空調システムの温度設定が「AUTO」に設定された場合とかかな?

43 : 名無しのシステムエンジニアさん 2019/08/27(火) 01:44:04.93 ID:huPuAFyP.net
Left Caption

こういうの損害賠償求められないのか?
ドスパラとか土曜の稼ぎ時に全店営業停止とかシャレになんねーほど被害受けてるだろ?

Posted by flac