Tijdens een senaatsverhoor is gebleken dat Telstra bewust heeft nagelaten een bekende bug in een NTP-server te herstellen, wat resulteerde in een grootschalige netwerkuitval die 8,8 miljoen klanten trof. De storing werd veroorzaakt door een 'GPS rollback'-fout in een verouderde Microchip Technologies SSU 2000-server, waardoor de systeemdatum versprong naar het jaar 2006.
De belangrijkste punten uit het incident:
- Verwaarlozing: Hoewel de leverancier al in 2000 waarschuwde voor de bug en technici het probleem in 2022 en begin 2024 opnieuw identificeerden, werd besloten de update niet uit te voeren omdat men dacht dat de betreffende functie niet werd gebruikt.
- Impact: De datumverschuiving veroorzaakte een cascade van storingen waarbij 40 tot 50 procent van de oproepen weigerde. Ook de kritieke Triple Zero-nooddienst werd geraakt, met 604 mislukte oproepen.
- Herstel en gevolg: De storing duurde een groot deel van de dag. Telstra heeft inmiddels een onderzoek ingesteld via Technology Audit Partners en de ACMA voert een eigen onderzoek uit. Een klein aantal klanten is gecompenseerd met een gemiddeld bedrag van $12,50.
Telstra negeerde bug voor uitval die 8,8 miljoen gebruikers trof
Telstra-technici hebben herhaaldelijk besloten het probleem niet op te lossen dat uiteindelijk leidde tot een netwerkuitval die 8,8 miljoen mensen trof. Dit werd toegegeven tijdens een senaatsverhoor, waar ook aan het licht kwam dat 8.000 klanten tot nu toe zijn gecompenseerd met een gemiddeld bedrag van slechts $12,50.
CEO van Telstra, Vicki Brady, verklaarde tijdens het verhoor van de Senate Environment and Communications References Committee over de uitval van de Triple Zero-dienst dat het bedrijf tot nu toe ongeveer $100.000 heeft betaald aan de getroffenen.
De technische oorzaak van de uitval
Brady gaf een gedetailleerd tijdspad van de gebeurtenissen die leidden tot de landelijke uitval van een dag. De storing begon om 03:38 uur, nadat een defecte stroomvoorziening ertoe leidde dat het chassis van een Microchip Technologies SSU 2000 Network Time Protocol (NTP)-server moest worden vervangen.
Hoewel Telstra honderden NTP-servers van verschillende merken gebruikt om de tijd in het netwerk te synchroniseren, maakt het bedrijf drie SSU 2000-units (met een waarde van ongeveer $30.000 per stuk). In dit specifieke geval paste de unit in Melbourne, na een herstart, de datum aan met een verschuiving van 1.024 weken terug naar het jaar 2006.
Het probleem werd veroorzaakt door een bekende 'GPS rollback'-fout in de inmiddels verouderde NTP-server. De storing werd om 04:20 uur gedetecteerd en hield aan tot 16:00 uur. Uiteindelijk werden 8,8 miljoen klanten getroffen, waarbij een 'secundair probleem' de onderbrekingen verlengde tot in de volgende dag.
Verwaarlozing van bekende bugs
Uit onderzoek bleek dat technici de server in Melbourne eerder hadden geherconfigureerd om een bug op te lossen, maar deze "ontwerpwijzigingen" niet hadden gedocumenteerd. Dit betekende dat, hoewel de latere vervanging van de server volgens protocol verliep, de server niet reageerde zoals verwacht.
De leverancier had al in november 2000 waarschuwingen uitgegeven over deze bug. Brady gaf toe dat Telstra-technici het probleem al in september 2022 hadden geregistreerd, maar dat een risicoanalyse concludeerde dat het niet relevant was voor hun netwerk.
In januari van dit jaar besloten technici opnieuw om de bug niet te herstellen, ondanks wat Brady omschreef als "een duidelijke herinnering dat deze update uitgevoerd moest worden."
"Het is niet zo dat ze die update gewoon negeerden," aldus Brady. "Ze hebben het overwogen, maar vanwege het ontwerp en de manier waarop we deze specifieke server gebruikten, beïnvloedde de update een functie die we op dat moment niet gebruikten."
De niet-gedocumenteerde wijziging in het ontwerp zorgde er echter voor dat het probleem alsnog relevant werd, wat uiteindelijk leidde tot de massale netwerkuitval.
Gerard Tracey, Telstra's group owner voor service resilience and critical communications, gaf onder druk van commissievoorzitter Sarah Hanson-Young toe dat een nieuwere server de uitval zou hebben voorkomen: "Als we een nieuwer stuk hardware hadden gehad, dat functioneerde volgens het ontwerp dat we voor ogen hadden, zou het probleem niet zijn opgetreden."
Hanson-Young bestempelde het falen van Telstra als een resultaat van "incompetentie".
De weg naar herstel
De senaatszitting was de eerste gelegenheid voor Brady om publiekelijk details te delen over de uitval. De storing werd op 8 juli om 04:20 uur gedetecteerd en escaleerde toen klanten wakker werden en probeerden hun telefoon en dataverbinding te gebruiken.
De onjuiste datum verspreidde zich over het netwerk van Telstra, wat leidde tot een cascade van storingen. Het netwerk weigerde 40 tot 50 procent van de oproepen, omdat de telefoons vanuit het perspectief van het netwerk effectief vanuit de toekomst (20 jaar later) belden.
De tijdlijn van de respons was als volgt:
- 06:33 uur: Het bedrijf kreeg te maken met mediaberichten over de uitval.
- 07:11 uur: Technici identificeerden het apparaat dat het probleem veroorzaakte.
- 10:00 uur: De meeste oproepen en datadiensten functioneerden weer correct.
- 16:00 uur: De initiële NTP-serverfout was verholpen.
"Moderne mobiele netwerken zijn complex, maar complexiteit vermindert onze inzet om storingen te voorkomen, ze snel te detecteren en ervoor te zorgen dat de juiste waarborgen aanwezig zijn niet," zei Brady. "We investeren aanzienlijk in de veerkracht van ons netwerk en in de modernisering ervan, maar dit incident laat zien dat we meer werk hebben te doen."
De ACMA voert een onderzoek uit en Telstra heeft Technology Audit Partners ingeschakeld voor een gedetailleerd onderzoek naar de uitval.
Test voor de bescherming van nooddiensten (Triple Zero)
De uitval diende tevens als een onvrijwillige test voor de beschermingsmaatregelen die bedoeld zijn om de impact op kritieke Triple Zero-diensten (noodoproepen) te beperken. Hierbij gaat het onder andere om 'camp on'-bepalingen, waarbij oproepen automatisch worden doorgeschakeld naar andere mobiele netwerken.
Volgens Tracey konden ongeveer 58.835 bellers tijdens de uitval succesvol verbinding maken met Triple Zero. Ongeveer 3.200 van deze oproepen maakten gebruik van 'camp on' naar de netwerken van TPG en Optus, met een significante stijging van deze oproepen vanaf ongeveer 06:15 uur.
Hoewel de primaire fout aan het einde van de dag was hersteld, zorgde een tweede probleem met dezelfde softwareconfiguratie ervoor dat het herstel vertraagde. Dit resulteerde in 604 mislukte Triple Zero-oproepen tot 14:00 uur de volgende dag, waarvan er 172 via andere netwerken probeerden te lopen en 432 helemaal geen verbinding kregen.
Telstra heeft alle oproepen achteraf gecontroleerd en in totaal 604 'welfare checks' uitgevoerd. Brady stelde dat zowel het back-upproces (het overschakelen naar andere netwerken) als het proces voor de controle op welzijn correct hadden gefunctioneerd.
Brady benadrukte dat Triple Zero centraal staat in het publieke vertrouwen in het communicatiesysteem van Australië en dat Telstra zijn verantwoordelijkheid in dit systeem zeer serieus neemt.
Telstra negeerde bug voor uitval die 8,8 miljoen gebruikers trof
Telstra-technici hebben herhaaldelijk besloten het probleem niet op te lossen dat uiteindelijk leidde tot een netwerkuitval die 8,8 miljoen mensen trof. Dit werd toegegeven tijdens een senaatsverhoor, waar ook aan het licht kwam dat 8.000 klanten tot nu toe zijn gecompenseerd met een gemiddeld bedrag van slechts $12,50.
CEO van Telstra, Vicki Brady, verklaarde tijdens het verhoor van de Senate Environment and Communications References Committee over de uitval van de Triple Zero-dienst dat het bedrijf tot nu toe ongeveer $100.000 heeft betaald aan de getroffenen.
De technische oorzaak van de uitval
Brady gaf een gedetailleerd tijdspad van de gebeurtenissen die leidden tot de landelijke uitval van een dag. De storing begon om 03:38 uur, nadat een defecte stroomvoorziening ertoe leidde dat het chassis van een Microchip Technologies SSU 2000 Network Time Protocol (NTP)-server moest worden vervangen.
Hoewel Telstra honderden NTP-servers van verschillende merken gebruikt om de tijd in het netwerk te synchroniseren, maakt het bedrijf drie SSU 2000-units (met een waarde van ongeveer $30.000 per stuk). In dit specifieke geval paste de unit in Melbourne, na een herstart, de datum aan met een verschuiving van 1.024 weken terug naar het jaar 2006.
Het probleem werd veroorzaakt door een bekende 'GPS rollback'-fout in de inmiddels verouderde NTP-server. De storing werd om 04:20 uur gedetecteerd en hield aan tot 16:00 uur. Uiteindelijk werden 8,8 miljoen klanten getroffen, waarbij een 'secundair probleem' de onderbrekingen verlengde tot in de volgende dag.
Verwaarlozing van bekende bugs
Uit onderzoek bleek dat technici de server in Melbourne eerder hadden geherconfigureerd om een bug op te lossen, maar deze "ontwerpwijzigingen" niet hadden gedocumenteerd. Dit betekende dat, hoewel de latere vervanging van de server volgens protocol verliep, de server niet reageerde zoals verwacht.
De leverancier had al in november 2000 waarschuwingen uitgegeven over deze bug. Brady gaf toe dat Telstra-technici het probleem al in september 2022 hadden geregistreerd, maar dat een risicoanalyse concludeerde dat het niet relevant was voor hun netwerk.
In januari van dit jaar besloten technici opnieuw om de bug niet te herstellen, ondanks wat Brady omschreef als "een duidelijke herinnering dat deze update uitgevoerd moest worden."
"Het is niet zo dat ze die update gewoon negeerden," aldus Brady. "Ze hebben het overwogen, maar vanwege het ontwerp en de manier waarop we deze specifieke server gebruikten, beïnvloedde de update een functie die we op dat moment niet gebruikten."
De niet-gedocumenteerde wijziging in het ontwerp zorgde er echter voor dat het probleem alsnog relevant werd, wat uiteindelijk leidde tot de massale netwerkuitval.
Gerard Tracey, Telstra's group owner voor service resilience and critical communications, gaf onder druk van commissievoorzitter Sarah Hanson-Young toe dat een nieuwere server de uitval zou hebben voorkomen: "Als we een nieuwer stuk hardware hadden gehad, dat functioneerde volgens het ontwerp dat we voor ogen hadden, zou het probleem niet zijn opgetreden."
Hanson-Young bestempelde het falen van Telstra als een resultaat van "incompetentie".
De weg naar herstel
De senaatszitting was de eerste gelegenheid voor Brady om publiekelijk details te delen over de uitval. De storing werd op 8 juli om 04:20 uur gedetecteerd en escaleerde toen klanten wakker werden en probeerden hun telefoon en dataverbinding te gebruiken.
De onjuiste datum verspreidde zich over het netwerk van Telstra, wat leidde tot een cascade van storingen. Het netwerk weigerde 40 tot 50 procent van de oproepen, omdat de telefoons vanuit het perspectief van het netwerk effectief vanuit de toekomst (20 jaar later) belden.
De tijdlijn van de respons was als volgt:
- 06:33 uur: Het bedrijf kreeg te maken met mediaberichten over de uitval.
- 07:11 uur: Technici identificeerden het apparaat dat het probleem veroorzaakte.
- 10:00 uur: De meeste oproepen en datadiensten functioneerden weer correct.
- 16:00 uur: De initiële NTP-serverfout was verholpen.
"Moderne mobiele netwerken zijn complex, maar complexiteit vermindert onze inzet om storingen te voorkomen, ze snel te detecteren en ervoor te zorgen dat de juiste waarborgen aanwezig zijn niet," zei Brady. "We investeren aanzienlijk in de veerkracht van ons netwerk en in de modernisering ervan, maar dit incident laat zien dat we meer werk hebben te doen."
De ACMA voert een onderzoek uit en Telstra heeft Technology Audit Partners ingeschakeld voor een gedetailleerd onderzoek naar de uitval.
Test voor de bescherming van nooddiensten (Triple Zero)
De uitval diende tevens als een onvrijwillige test voor de beschermingsmaatregelen die bedoeld zijn om de impact op kritieke Triple Zero-diensten (noodoproepen) te beperken. Hierbij gaat het onder andere om 'camp on'-bepalingen, waarbij oproepen automatisch worden doorgeschakeld naar andere mobiele netwerken.
Volgens Tracey konden ongeveer 58.835 bellers tijdens de uitval succesvol verbinding maken met Triple Zero. Ongeveer 3.200 van deze oproepen maakten gebruik van 'camp on' naar de netwerken van TPG en Optus, met een significante stijging van deze oproepen vanaf ongeveer 06:15 uur.
Hoewel de primaire fout aan het einde van de dag was hersteld, zorgde een tweede probleem met dezelfde softwareconfiguratie ervoor dat het herstel vertraagde. Dit resulteerde in 604 mislukte Triple Zero-oproepen tot 14:00 uur de volgende dag, waarvan er 172 via andere netwerken probeerden te lopen en 432 helemaal geen verbinding kregen.
Telstra heeft alle oproepen achteraf gecontroleerd en in totaal 604 'welfare checks' uitgevoerd. Brady stelde dat zowel het back-upproces (het overschakelen naar andere netwerken) als het proces voor de controle op welzijn correct hadden gefunctioneerd.
Brady benadrukte dat Triple Zero centraal staat in het publieke vertrouwen in het communicatiesysteem van Australië en dat Telstra zijn verantwoordelijkheid in dit systeem zeer serieus neemt.