Neuspjeh u oblaku Amazon Web Services (AWS) izazvao je globalni prekid u radu u ponedjeljak, što je uticalo na web stranice, aplikacije i videoigre. Rano jutros, brojni korisnici u Španiji prijavili su probleme s pristupom i sporost u popularnim uslugama, što ukazuje na... svjetski krah neuobičajen po svom obimu.
Prva upozorenja na web stranici za praćenje DownDetector počela su se pojavljivati oko 08:40 (Poluostrovno vrijeme). Od tada su mreže ispunjene porukama koje opisuju greške u povezivanju, beskrajna učitavanja i povremene prekide na kritičnim platformama koje zavise od AWS infrastruktura.
Koje su usluge pogođene
Među pogođenim platformama bili su i Amazonovi vlastiti proizvodi, poput njihove online trgovine, asistenta Alexa y Prime Video, kao i usluge trećih strana. Incidenti su prijavljeni u Canva, Duolingo, pretraživač zasnovan na umjetnoj inteligenciji Zbunjenost i društvene mreže poput Snapchat, sa posebnom bukom u igraćim zajednicama zbog problema u Fortnite, Roblox y Clash Royale.
Finansijski sektor je pretrpio udarac: platforme BBVA, CaixaBank, Banco Santander i platne usluge kao što su bizum doživio greške, kao i podatkovni telefoni u fizičkim trgovinama. U Sjedinjenim Američkim Državama, Venmo (slično kao i kod Bizuma) također je registrovao probleme, što odražava kaskadni efekat incidencija.
Poremećaj je zahvatio i izdavanje i prodaju karata. Live Nation prijavljeni kvarovi u sistemima Ticketmaster, do te mjere da su morali odgoditi izdanja poput turneje Van Goghovo uho, dok su druge prodaje, kao što je ona od Eric Clapton, mogli su nastaviti normalnije.
U oblasti povezivosti i javnih usluga, incidenti su prijavljeni kod operatera kao što su Movistar, Narandža y Vodafone, a Aena je upozorila na probleme s plaćanjem karticama u parking na aerodromuParalelno s tim, neki alati za saradnju i streaming, kao i medijske i e-trgovačke platforme, optužili su povremene greške.
Gdje je bilo tehničko porijeklo
Prema službenom statusnom panelu, incident se dogodio u regiji SAD-ISTOK-1 (Sjeverna Virdžinija, SAD), jedna od najvećih i najstarijih enklava kompanije AWS. Kompanija je primijetila osnovni problem DNS-a kao osnovni uzrok, ključna komponenta koja prevodi nazive servisa u IP adrese kako bi mašine mogle komunicirati.
Kvar DNS-a je uticao na razrješavanje imena unutar regije, tako da više servisa više nije moglo pronaći svoje domene. krajnje točkeMeđu najteže pogođenim bio je Amazon DynamoDB, čija je pristupna tačka pretrpjela greške koje su se proširile na mnoštvo aplikacija koje zavise od te baze podataka.
AWS je naznačio da ako se nakon ublažavanja problema s vezom nastave s krajnjim tačkama DynamoDB u US-EAST-1, bilo je zgodno isprazni DNS kešIstovremeno, upozorio je na djelomična ograničenja određenih zahtjeva dok su svi slojevi platforma.
Uticaj u Španiji i drugim zemljama
U Španiji se efekat osjetio u online bankarstvo i plaćanja u trgovinama, u aplikacijama za masovnu upotrebu i prilikom kupovine karata. Neke kompanije su izvijestile da podatkovni telefoni obustavio je obradu transakcija tokom dijelova jutra, a korisnici su nailazili na prepreke prilikom prijave ili dovršavanja transakcija na aplikacije uobičajeno.
Utjecaj je bio globalan, s jasnim fokusom na Sjevernu Ameriku zbog lokacije problema, ali s posljedicama u Evropi i drugim tržištima. Na mrežama kao što su X i Reddit, poruke o problemu su se umnožile. Alexa nereaguje, rutine koje se ne bi pokretale i aplikacije koje ne bi prešle ekran za učitavanje - tipičan obrazac kada DNS rezolucija.
Također je bilo vremenskih podudarnosti s incidentima koji nisu povezani s AWS-om, kao što je privremeni pad Redsys što je uticalo na plaćanja u Španiji. Iako je formalno bila odvojena od problema Amazona, istovremenost je pojačala osjećaj kolaps u nekim sektorima.
Vremenski okvir i status oporavka
Upozorenja su počela otprilike 08:40 u Španiji. Do sredine jutra, AWS je objavio da već posmatra znakovi oporavka nakon primjene mjera ublažavanja. Oko podneva, saobraćaj se počeo vraćati u normalu u sve većem broju usluge, sa jasnim padovima u izvještajima DownDetectora.
Nakon prvih sati, kompanija je izvijestila da je Problem sa DNS bazom je ublažen i da većina operacija funkcioniše normalno. Međutim, upozorio je na moguće specifična ograničenja na specifične zahtjeve dok je potpuni oporavak pogođenog područja bio u toku.
Zašto prekid rada AWS-a paralizira polovinu interneta
AWS omogućava preduzećima i programerima iznajmljivanje računarskih resursa (računarstvo, pohrana, baze podataka, umrežavanje, umjetna inteligencija) umjesto da se drže lokalno. Ovaj model je pretvorio platformu u kičma Internet: od glavnih streaming servisa do mobilnih aplikacija i sistema plaćanja, svi zavise, direktno ili indirektno, od njegove infrastrukture.
Kada je regija kritična kao SAD-ISTOK-1 ima problema s DNS-om, utjecaj se vrtoglavo povećava: servisi koji ne mogu razriješiti imena, baze podataka koje ne dosežu svoje krajnje tačke i lanci zavisnosti koji prekidaju. Stoga, jedan incident dovodi do široko rasprostranjeni neuspjesi u različitim oblastima kao što su bankarstvo, obrazovanje, zabava i e-trgovina.
Ono što smo iskusili naglašava potrebu za dizajniranjem sistema sa otpornost i diversifikacija: redundancija između regija, planovi za prelazak u slučaju kvara i strategije kontrolirane degradacije. Iako su se mnoge usluge brzo oporavile, drugima je trebalo duže, što naglašava koliko je važno predvidjeti scenariji pada.
Iako je većina operacija sada nastavljena, tehnički timovi i dalje prate završne detalje i osiguravaju da nema nuspojava; kompanija naglašava da, nakon ublažavanja osnovnog uzroka, one mogu potrajati. postavke dok se saobraćaj u pogođenom području potpuno ne normalizuje.
Taj dan ostavlja jasno zapažanje: incident od DNS na liniji US-EAST-1 došlo je do prekida rada desetina servisa, od Amazon.com-a, Alexa o Prime Video čak i banke, podatkovni telefoni, Ticketmaster i videoigre, s upozorenjima koja počinju u 08:40 ujutro i postepeno se obnavljaju od podneva; podsjetnik koliko Internet ovisi o infrastrukturi AWS.