Kuerz Äntwert: En AI-Datenzentrum ass eng mat héijer Dicht , wou Stroum, Killung, Struktur a Späicherplatz op Trainings- a Servermodeller baséieren, net op e Serverraum mat extra GPUs. D'Chips kréien de Ruhm; d' Gebai entscheet ob se funktionéieren. Wann d'Biller net fortgoe kënnen, sollt eng kleng Zell nei ageriicht ginn; déi meescht Équippe sollten eng Plaz lounen.
Schlëssel Erkenntnisser:
Chips vs. Gebai: Stroum, Ofkillung, Struktur a Späicherung entscheeden, ob d'Beschleuniger funktionéieren.
Plazen, keng Palaiser: Zwee Racken ëmbauen, wann d'Donnéeën net fortgoe kënnen; kee Campus kafen.
Duerchschnëtt vs. Median: No aacht Läufe fänkt de Median-HID nei un; benotzt den 18-Stonne-Moyenne.
Mëssbrauchsresistenz: Gitt keng PUE fir zwee Regaler an enger gemëschter Hal un.
Illustrativ Resultater: Aacht Lafzäiten sinn eng kleng Kaart, keng Produktiounserspuernis vu 50%.

Artikelen, déi Dir no dësem Artikel vläicht gäre liest:
🔗 Ass KI zouverlässeg? Video a Quiz
Entdeckt d'Zouverlässegkeet vun KI duerch e spannend Video an en interaktiven Quiz.
🔗 Wéi een KI am Alldag benotzt
Entdeckt praktesch Weeër, wéi KI alldeeglech Aufgaben a Routinen vereinfache kann.
🔗 Wéi een KI op der Aarbecht benotzt
Léiert praktesch Weeër fir KI fir eng méi intelligent Produktivitéit um Aarbechtsplaz ze benotzen.
🔗 Kann KI selwer denken?
Verstitt ob kënschtlech Intelligenz wierklech onofhängeg denke kann oder argumentéiere kann.
Wéi et sech vun engem "normalen" Datenzentrum ënnerscheet
Traditionell Halen optimiséieren fir gemëschte Workloads an Uptime iwwer vill kleng Servicer. Dir këmmert Iech ëm Redundanz, sécher, an ëm PUE als Konzept - extra Energie, déi d'Gebai verbrennt fir e Watt Rechenleistung ze liwweren. Dir designt normalerweis net all Korridor ronderëm e Rack, deen sech wéi eng portabel Heizungsparty verhält.
KI-Site änneren d'Verhältnisser. D'Dicht klëmmt. Den Netzwierk gëtt zu engem Stoff, ouni deen d'Trainingsaarbecht net weiderkomme kann. De Späicher muss Kontrollpunkten a Bewegung halen, soss bleiwen d'Beschleuniger inaktiv, wéi Rennpäerd an engem Stau.
Et gëtt och en kulturellen Ënnerscheed. Enterprise Ops denkt un Ticketen a Verännerungsfensteren. AI Ops denkt un Aarbechtsschlaangen an dat schlecht Gefill, wann en Node spéit an enger laanger Lafzäit ofstéiert. Ech mengen, ee kéint béid nach ëmmer "Datenzentren" nennen, well se dat jo sinn. D'Bezeechnung verstoppt just d'Sanitärinstallatiounen.
| Typ | Fir wat et gebaut ass | Aussergewéinlech Hardware | Leeschtungs- / Killcharakter | Wien et passt | Firwat et existéiert |
|---|---|---|---|---|---|
| Traditionellt Firmendatenzentrum | Gemëschte IT: Datenbanken, virtuell Maschinnen, E-Mail, Dateien | CPUs, normal Serveren, bekannte Späicherplatz | Loftgedriwwen; moderat Dicht; PUE als Diskussiounspunkt | Firmen, déi alldeeglech Systemer bedreiwen | Halt d'Geschäftsapps um Lafenden |
| KI-Trainingscluster | Laang, enk verbonnen Ausbildungsjobs | Dicht Beschleunigerracks; GPU-Verbindungen | Héichdicht; Flëssegkeetskühlung oder [Hënnerdier-Wärmetauscher](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Labore a Modellbauer, déi a Schlaange schaffen | Fäerdeg de Laf ouni d'Chips ze verhongeren |
| KI-Inferenzanlag | Modellservéierung; Echtzäit- an Batch-Äntwerten | Beschleuniger; Lastausgleicher déi wichteg sinn | Nach ëmmer waarm, just... manner theatralesch; Latenz iwwer Brutedicht | Produkter, déi elo Äntwerten mussen | Setzt de Modell beim Benotzer |
| Hybrid KI-Hal | Ausbildung a Service ënner engem Daach; nun ja - iergendwéi | Gemëschte Basengen; agezaunte Schwämm; gemeinsamt Material | Zwee cool Perséinlechkeeten an engem Planzeraum; et gëtt peinlech | Équipen, déi sech keng zwee Campussen leeschte kënnen | Kapital ass endlech; d'Liewen ass onuerdentlech |
Kee moralesche Ranking. Verschidde Maschinnen, deeselwechten Familljennumm.
GPUs, Beschleuniger an de Rack, deen Energie verbraucht
Wann een op engem traditionellen erhiewte Buedem trëppelt, gesinn d'Regaler bal héiflech aus. Wann een op enger Rei vun AI trëppelt, gesäit et aus, wéi wann se d'Gebai verschlécke wëllen.
Déi erausstéchend Hardware ass keng clever CPU. Et ass den Accelerator-Tray: GPUs oder aner KI-Chips, a Serveren, dann a Racks, dann a Reien, déi sech e Stoff mat héijer Bandbreet deelen. GPUs verbannen d'Chips zu eppes, wat sech als ee risege Accelerator ausginn kann; de Cluster-Stoff mécht deeselwechten Trick op Reieskala. Parallelt Training funktionéiert nëmme wann dës Verbindungen déck a virauszesoen bleiwen. Wann Dir dat verléiert, ass Äre "Cluster" e Koup vun deieren Aarbechtsstatiounen, déi sech eng Postleitzuel deelen.
D'Leeschtung follegt de Chips. Kee klumpige Büro-PDU. Megawatt IT-Laascht, wann eng Hal voll ass - ech wäert keng Zuel erfannen. D'Dicht pro Rack ass den Twist an der Handlung. Manner Racks. Jiddwereen en klengen Uewen. De limitéierende Faktor ass dacks d'Ënnerstatioun, net d'Wonschlëscht vun de GPUs. Dir wësst, wéi et ass: d'Beschaffung wëll méi Beschleuniger; d'Energieversuergung wëll eng laang Konversatioun an e ganz grousse Scheck.
Eng liicht domm Metapher, déi ech net lass loossen kann: de Rack ass en hongeregt Déier. Dir kënnt en méi séiert Déier ziichten. Dir musst et ëmmer nach fidderen, an Dir musst ëmmer nach d'Hëtzt ausdrecken. Wann Dir béid iwwerspréngt, gëtt et e ganz deiere Pabeiergewiicht.
Stroum, Hëtzt an d'Kühlproblem
Stroum eran. Hëtzt eraus. Dat ass déi ganz Relioun.
Regaler mat héijer Dicht ginn Hëtzt op eng Manéier of, wéi d'Loft ni wierklech verlaangt gouf, se ze handhaben. Dir kënnt d'Loft méi haart drécken - Hëtzetauscher hannert der Dier, méi waarm Gäng, intelligent Eindämmung - an dat funktionéiert bis zu engem gewësse Punkt. Dann kënnt Flëssegkeet eraus:
-
Killmëttelschleifen, déi de Maschinenraum wéi eng chemesch Fabréck ausgesinn loossen
-
Immersioun an e puer Designen, wat ëmmer nach Leit erschreckt, déi mengen, datt Waasser a Serveuren net e Saz deele sollten
Näischt dovun ass glamouréis. Alles ass d'Produkt, well e Gaspedal, deen ofbremst, ass ee fir deen Dir scho bezuelt hutt a net vollstänneg notze kënnt.
PUE ass ëmmer nach wichteg. Et ass e Verhältnis, keng Perséinlechkeet. D'Betreiber verfollegen et, well all Watt, deen fir Ventilatoren a Pompelen ausginn gëtt, e Watt ass, deen net un eng GPU gaangen ass. Ech wäert keng "typesch" Zuel zitéieren; de Klima a wéi een d'Grenz zitt, beweegen se, a falsch Präzisioun ass méi schlëmm wéi guer näischt. Waasser ass och an der Geschicht. E puer Planzen schlucken. E puer schlucken. Verdampfungskühlung ass effizient, bis de Floss oder eng Dréchent et politesch maachen.
Networking: firwat de Stoff sou wichteg ass wéi d'Chips
D'Leit fotograféieren d'GPUs. Si sollten d'Switche fotograféieren.
Training ass eng Konversatioun. Dausende vun Acceleratoren, déi Gradienten, Parameteren a Stécker vun engem Modell austauschen, ganz synchron. Wann de Stoff ziddert, waart de ganze Job op den luessten Hop. Dofir sinn KI-Halen obsesséiert mat Netzwierker mat héijer Bandbreet, gerénger Latenz an Topologien, déi sech net an der Halschent klappen, wann e Link ausfällt. InfiniBand-ähnlech Stoffer, Ethernet an der selwechter Roll, GPU-Verbindungen an der Këscht, Verkabelung, déi direkt richteg muss sinn.
Inferenz ass eng aner Diskussioun. Model Serving këmmert sech ëm d'Latenz vum Schwanz - déi lues Äntwert, net déi duerchschnëttlech. Batch vs. Echtzäit spléckt d'Perséinlechkeet. E Trainingscluster wëll eng grouss, kollektiv, All-to-All Bewegung. Eng Serving-Flott wëll vill méi kleng Ufroen an Isolatioun, ouni Stau beim Load Balancer.
De Feeler, wärend ech hei sinn: d'Leit behandelen d'Netzwierk als Sanitärinstallatioun an d'Pommes frites als Restaurant. An dësem Gebai ass d'Sanitärinstallatioun de Restaurant. Wann Dir dat verpasst, kaaft Dir eng Kichen, déi keng Liwwerung akzeptéiere kann.
Training vs. Inferenz: zwee Gebaier, heiansdo wuertwiertlech
Training ass eng Kampagne. Dir setzt e Cluster zesummen, gitt him Daten, kontrolléiert reliéis, leeft Stonnen oder Wochen, a biet, datt de Stoff ouni Evenementer bleift. Batch-schwéier, bandbreet-hongreg, roueg gedëlleg - bis en defekten Node e Stéck vum Laf hëlt. Een doudegen Accelerator an engem enk gekoppelten Job kann de ganze Chorus blockéieren.
Inferenz ass eng Geschäftsfassad. Modeller, déi scho trainéiert sinn, beäntweren elo Froen, klassifizéieren Biller a generéieren Text. D'Latenz spillt eng Roll. En e bësse méi ale Beschleuniger beim Client kann e glamouréise Beschleuniger, deen ee Kontinent ewech ass, schloen.
Sou kritt een eng Trennung. Trainingscampussen no Muecht, Land an Dicht. Inferenzplazen no Latenz a Präsenz. Hybrid Halen existéieren och, well Kapital net onendlech ass. Gutt - net ëmmer zwee Gebaier. Heiansdo eng Hal mat engem Samtseel an zwou Killschleifen.
Hei fënnt een och Colocation, Hyperscale-Campussen a On-Prem-Gabelen. Hyperscaler bauen a Skalen op, déi de Rescht vun eis ausgesinn loossen, wéi wann mir Miwwelen arrangéiere géifen. Colos verkafen Dicht pro Rack. On-Prem geschitt ëmmer nach, wann d'Donnéeën net fortgoe kënnen.
Späicherdurchsatz, Kontrollpunkten an hongereg Chips
Keen setzt dat parallelt Dateisystem op d'Cover vun der Broschür.
Trainingsdaten mussen séier genuch ukommen, datt GPUs net mat de Féiss klappen. Kontrollpunkte mussen landen, fir datt en Ofstuerz net eng Woch verluer geet. Modellgewichte musse gelueden ginn, ier eng servéierend Replika live ass. De Späicherdurchsatz - net nëmmen d'Kapazitéit - ass de rouegen Engpässe. Dir kënnt e Verméige fir Beschleuniger ausginn an se mat engem héiflechen Array, dee fir virtuell Maschinnen entwéckelt gouf, aushongeren.
D'Muster ass bekannt: e glänzende Cluster, eng Job-Warteschlaang, an I/O-Waarden, déi zeréckkucken wéi eng onhéiflech Rechnung. Clustering vum Berechnen ouni de Datenwee ze clusteren ass wéi een en deieren Idle-System kritt. Halt d'Chips gefëllt oder gitt zou, datt Dir eng Skulptur kaaft hutt.
Software, Orchestratioun an déi onglamouréis Operatiounsschicht
Hardware ass d'Prominenz. Planungsleit maachen d'Aarbecht.
En KI-Datenzentrum ass nëtzlos, wann Aarbechtsplazen keng GPUs fannen, wann zwou Équipen e Cluster net ouni Faustkampf deele kënnen, wann e gescheiterte Rang net ersat ka ginn, wann d'Firmware driftt, bis de Fabric a Slowmotion ausfällt. Orchestratioun, Observabilitéit, Power Capping - déi onglamouréis Operatiounsschicht, dofir wësst Dir, datt se wichteg ass.
Ech hunn e Schwächt fir dës Schicht. Och wou en falsch konfiguréierten Netzwierkkaart e ganzen Nomëtteg laang e Killproblem imitéiert... dat mierkt een op déi haart Manéier.
Wann e Knuet an der Mëtt vum Laf stierft
E Knuet stierft. Ännerungsfënstere kollidéieren ëmmer nach mat Trainingsläufe, déi sech net ëm Äre Kalenner këmmeren. Dir plant grouss Jobs a Gruppen, spärt Inferenzpools of, schreift Runbooks fir Feeler, déi ausgesinn, wéi wann "de Job lues wier", bis se ausgesinn, wéi wann "de Job dout wier". Redundanz ass ëmmer nach wichteg - Stroumversuergung, Ofkillung, Weeër, Späicherplatz - awer de Feelermodus ass manner uerdentlech wéi déi al Nines-of-Uptime-Rutsch. Inferenz: Replikéieren, de kranke Knuet drainéieren, weider äntweren. Training wëll Checkpoints, net Optimismus.
Lag, Waasser, Netz a Noperen
Een dovun setzt een net nieft engem Haus lass wéinst der Vue.
D'Uschloss un d'Netz ass dacks de richtege Prozess vun der Auswiel vum Standuert. Land ass einfach am Verglach mat enger Ënnerstatioun an engem Versuergungsunternehmen, deen aner Clienten huet. Waasser fir d'Ofkillung, wann Dir et benotzt, gëtt zu engem Noperproblem, soubal de Reen staark ass. Kaméidi. Visuell Volumen. Hëtzt un engem Grenzzaun. Planungskommissiounen entdecken Meenungen iwwer "d'Wollek", soubal se e Feld an e Floss brauch.
Latenz zitt an déi aner Richtung. Inferenz ass gär bei Benotzer a Verbindungen. Training kann sech a méi bëllegen Energiemäert a méi killen Klima verstoppen. D'Industrie schwätzt, wéi wann et eng perfekt Plaz géif ginn. Dat gëtt et net. Mat enger Pressematdeelung gëtt et e Kompromiss.
Iwwerreschter Hëtzt an den ongewolltene Uewen
Broschüren hunn dat gär. D'Ofwärm an Haiser, Schwämm, Treibhaiser leeden; et ass e schéine Saz. Heiansdo ass d'Schleif vum Distrikt echt. Heiansdo ass de Campus op der falscher Plaz an d'Hëtzt geet ëmmer nach an d'Loft. Ech si skeptesch wat d'Broschürversioun ugeet; ech si net skeptesch wat d'Physik ugeet.
Wien brauch een (a wien soll amplaz lounen)
Déi meescht Leit brauche keng vun dëse Säll ze besëtzen.
Déi knaschteg Lëscht:
-
Hyperscaler, well d'Produkt d'Flott ass
-
Laboe, wann d'Warteschlangzäit den Engpass ass, oder d'Donnéeën net fortgoe kënnen
-
Eng Bank, eng Spidolsgrupp, eng Regierung oder e Produzent mat engem geheime Datesaz - on-prem oder an engem private Colo-Cage - ka rational sinn, och wann et e Quatsch ass
All déi aner sollten lounen. Colocation mat KI-bereeter Dicht. Eng Cloud-Reservatioun. E verwalteten Cluster. Dir kritt d'Beschleuniger ouni och Kraaftwierkbetreiber ze ginn. D'Romantik verschwënnt beim éischte Versuch, wien um 3 Auer moies fir d'Kältemëttel-Schleif bereet ass.
Et gëtt eng Saach mat Stolz, dat muss ech zouginn. De Cluster ze besëtzen fillt sech un, wéi d'Mëttel vun der Prognose ze besëtzen. Dann kënnt d'Stroumrechnung, an de Stolz setzt sech erof.
Fir wat d'Gebai ass
Also, wat ass en AI-Datenzentrum? E spezialiséierte Campus mat héijer Dicht, wou Beschleuniger, Energieversuergung, Killung, Struktur a Späicherung ronderëm Trainings- a Serviermodeller organiséiert sinn - net allgemeng IT mat enger GPU an der Eck. Et gesäit aus wéi e Lagerhaus. Et verhält sech wéi eng Kraaftwierk, dat Mathematik mécht.
Wann Dir Iech un näischt anescht erënnert: d'Chips kréien de Ruhm; d'Ënnerstatioun, de Killmëttel an d'Netz entscheeden, ob dës Chips eng gutt Iddi waren. Training an Inferenz kënnen sech een Daach deelen; si wëllen ëmmer nach verschidde Manéieren. Déi meescht Organisatioune sollten lounen. E puer sollten bauen. Nopere wäerten et an alle Fall mierken.
D'Wollek hat ëmmer e Gebai. Hautdesdaags huet d'Gebai Meenungen.
Beispill aus der Praxis: Eng Trainingszell mat zwee Racken, wann d'Biller net fortgoe kënnen
Szenario
Den Tomos ass Infrastrukturleader bei Kestrel Precision, engem Hiersteller mat 400 Mataarbechter an de West Midlands. Si hunn schonn eng kleng On-Prem-Hal: ERP, Dateishares, virtuell Maschinnen, déi gemëschte Noperschaft, mat där dësen Artikel ugefaangen huet. Loftkillung. Gewéinlecht Ethernet. E SAN, dat perfekt fir Bürosdisken ass.
D'Maschinnvisiounsteam muss en Inspektiounsmodell op Fabrécksstillbiller trainéieren. D'Stillbiller däerfen de Site net verloossen. Si weisen e Prozess, deen d'Firma net op eng Cloud-Disk leet, och net op eng privat. D'Léisung vu Procurement ass véier Server mat duebele Beschleuniger an eng Folie mam Titel "eist KI-Datenzentrum". D'Server ginn an zwee existent Racks, well et Plaz gëtt, an de Raum huet sech wéi d'Aschränkung ugefillt.
Dat ass et net. Bannent zwou Wochen kléngen d'GPUs beschäftegt an da bremsen se roueg of. D'Aarbechtsplaze krabbelen, wann e Checkpoint de SAN trëfft. E Knuet stierft an der eelef Stonn of an de Laf ass einfach... fort. Den Tomos huet net verpasst, Chips ze kafen. Hie kaaft e Koup deier Aarbechtsstatiounen, déi sech eng Postleitzuel gedeelt hunn. D'Gebai war nach ëmmer eng Enterprise-Hall.
Si brauche kee Campus, keng nei Ënnerstatioun oder e Floss. Si brauche eng kleng Zell, déi sech wéi en KI-Datenzentrum a Miniatur verhält: Stroum, deen d'Racken tatsächlech hale kënnen, Hëtzt, déi fortgeet ouni d'Chips ze kachen, e Stoff, iwwer deen den Trainingsjob schwätze kann, Späicherplatz, deen e Checkpoint ophuele kann, an e Runbook fir wann en Node stierft. Well d'Biller net fortgoe kënnen, ass e Colo-Cage véierzeg Minutte wäit ewech ze lounen net d'Äntwert. Zwee Racks nei auszerüsten ass dat.
Wat d'Zell brauch
-
E gemoossene Stroumverbrauchsbudget op där Zeil, vun den PDUs, net vun der GPU-Wonschlëscht. Wann d'Ersatzkapazitéit déi véier Server bei Trainingslaascht net fidderen kann, hält d'Gespréich do op an si kucken op eng méi dicht Faarf, net op e Wonner
-
D'Ofkillung vun der Loft gouf ni mat dëser Dicht gefuerdert: Hëtzetauscher hannert der Dier, wann d'Hal se verdroe kann, oder eng kleng Flëssegkeetsschleif, wann se dat amplaz verdroe kann. Wann dat net de Fall ass, ginn d'Serveren net eran
-
E speziellen Héichbandbreet-Fabric tëscht de véier Knuet, net den Ethernet vum Büro. Wann den Ubidder nëmmen en 10 Gb Switch am Katalog huet, ass dat kee Cluster
-
Lokal séier Späicherung fir Checkpoints an Trainingsshards, net fir de VM SAN
-
E Scheduler, en Checkpoint-Intervall an e schrëftleche Restart-Wee. Hardware ass d'Prominenz. Dës Schicht ass d'Aarbecht
-
Eng ofgezunn Inferenzbox fir d'Fabréckslinn, getrennt vum Trainingschatter, well d'Serving Tail Latency an Isolatioun wëll, net eng kollektiv
-
Erlaabnes fir Energieversuergung, GPU-Auer, Drosselverloscht-Evenementer an Job-Wand-Auer ze protokolléieren. Wa se dës net iwwerpréife kënnen, fotograféiere se d'GPUs a verpassen d'Schalter
Beispillinstruktioun
Den Tomos schreift dat an der Beschreiwung vun den Ariichtungen, a gewéinlecher Sprooch:
Nennt dat keen KI-Campus. Bau eng Trainingszell mat zwou Rack-Rack-Funktiounen an der existéierender Hal fir véier Server mat duebelen Acceleratoren. D'Fabrécksbiller bleiwen um Site. Erfolleg ass: déi véier Knuet ofschléissen en Inspektiouns- an Trainingsrezept mat 12 Epochen ouni thermesch Drossel, schreiwen e Checkpoint a Minutten, net Zénger vun Minutten, a fänken vun deem Checkpoint un, wa mir e Rang absichtlech ëmbréngen. D'Ofkillung muss d'GPUs op hiren Trainingszäiten halen. D'Netzwierk muss e Stoff sinn, deen déi véier Boxen deelen, keen Wee duerch de Bürostack. De Späicher muss d'Chips fidderen. Wann d'Hënnertür-Wärmetauscher net passen, sot et a stoppt. Gitt keng PUE fir zwou Rack-Rack-Funktiounen an enger gemëschter Hal un. Déi Zuel wier den Theater.
Dann schreift hien dëst an den Trainingsjob selwer:
All 30 Minutten e Kontrollpunkt an de lokale Schnellpool. Wann e Rang stierft, fänkt vum leschte komplette Kontrollpunkt un. Waart net op den SAN. Maacht net weider mam Training, während d'Aueren no der Hëtzt erofgaange sinn. Protokolléiert et a stoppt, fir datt mir de Stall kënne gesinn.
Eng gutt Stonn gesäit esou aus: all aacht GPUs bei Trainingszäiten, Checkpoint-Datei gelant, den Job nach ëmmer am Lockstep. Eng schlecht Stonn gesäit esou aus: Ventilatoren op voller Lautstäerkt, Zäiten erof, Checkpoint 2% no zéng Minutten, an een am Büro seet "de Cluster ass online". Up ass kee Training.
Wéi een et test
Si schreiwen den Test virum Retrofit, wat de ganze Sënn ass, enger Demo net ze trauen.
-
Dat selwecht Rezept fir 12 Epochen, déiselwecht 120.000 Inspektiounsbiller, aacht Lafzäiten
-
Den Timing ass Wandauer bis zu engem fäerdege Rezept, inklusiv all Neistart, gemooss vum Jobabgabe bis zum leschte Kontrollpunkt vun der Epoch 12
-
E Pass op Hëtzt: GPU-Auere bleiwen um Trainingsziel fir de Laf. En Drossel-Event ass e Feeler, och wann den Job schlussendlech fäerdeg ass
-
E Pass op de Späicher: Schreifzäit vum Checkpoint, Median an déi schlëmmst Zäit, aus dem Jobprotokoll
-
E Pass op de Stoff: d'Aarbecht sëtzt net kollektiv an der Waardezäit, soulaang e Rang gesond ass. Wa se dës Waardezäit net gesinn, ass d'Instrumentatioun net fäerdeg
-
Zwee vun aacht Läufe kréien e Rang, deen op engem fixe Schrëtt absichtlech ëmbruecht gëtt, fir de Wee vum Restart ze testen
-
D'Inferenz ass en separaten Test mat 200 Biller vun der Fabréckslinn bis zur agezaunter Servbox. Den Erfolleg vum Training zielt net als Erfolleg vum Serv
-
Si notéieren d'Rackleistung vun den PDUs a 15-Minutte-Proben, sou datt keen e Megawatt erfannen muss
Akzeptanz fir d'Zell als "KI-bereet" ze bezeechnen: 8 vun 8 Rezepter sinn fäerdeg; 0 vun 8 weisen en thermeschen Drossel; béid ofgestoppte Läufe ginn nees opgeholl; Kontrollpunkte bleiwen a Minutten. Wa se dat verpassen, hunn se ëmmer nach e Serverraum mat ausgefalene Grafikkaarten.
Resultat
Illustrativt Resultat, vun engem erfonnten Test mat aacht Läffer, net enger publizéierter Kestrel-Zuel.
Viraussetzungen: véier Server mat duebele Beschleuniger an zwou Racken; een Inspektiounsmodell; 120.000 Fotoen; aacht Laf vun engem fixe Rezept mat 12 Epochen; d'Wandzäit enthält Neistarten, bis d'Rezept fäerdeg ass; Drossel bedeit e protokolléierte Réckgang vun der Trainingszäit; d'Checkpointzäit ass d'Schreiwen, net de Wonsch; d'Rack-Leeschtung ass PDU-Beispiller, net eng Campus-PUE.
Virum Ëmbau, GPUs an normale loftgekillte Racks um Büro-Ethernet an dem VM-SAN:
-
5 vun 8 Läff goufen beim éischte Versuch ofgeschloss. Duerchschnëttlech Wandzäit vun deene fënnef: 14 Stonnen
-
3 vun 8 mussten no engem Block géint d'11. Stonn nei ufänken (zwee nodeems en Node mat engem alen Checkpoint ausgestuerwen ass, een nodeems en Checkpoint de SAN gefëllt huet). Direkt e neie Versuch, keng Waardezäit iwwer Nuecht an der Auer: 11 Stonnen verluer plus en zweete Versuch vun 14 Stonnen, oder 25 Stonnen bis zu engem fäerdege Rezept op dësen dräi
-
Duerchschnëttlech Zäit bis e fäerdegt Rezept fir all aacht Rezepter, inklusiv Neistart: 18 Stonnen. (Fënnef um 14 Auer, dräi um 25 Auer. De Median vun all aacht Rezepter ass ëmmer nach 14, wat d'Neistarts verstoppt. Dofir ass de Mëttel hei d'Basislinn.)
-
Thermesch Drosselklappe bei 7 vun 8 Lafzäiten ageloggt. Duerchschnëttszäit bei reduzéierter Auerzäit: 3 Stonnen an engem 14-Stonne Versuch
-
Schreifzäit op der Kontrollpunktsäit: Median 22 Minutten
-
Rang-Kill war keen Test, deen se konnte bestoen. Si haten kee Runbook. Déi zwee zoufälleg Doudesfäll waren d'Resultat
-
Spëtzelast vun der IT op den zwou Racken beim Training: ongeféier 18 kW. D'Ruder hat déi néideg Watt. Et hat weder d'Ofkillung nach de Stoff
Nom Hëtzetauscher un der Heck op deenen zwee Racks, engem dedizéierten Fabric tëscht de véier Knuet, engem klenge NVMe-Pool fir Checkpoints, 30-Minutte-Checkpointing an engem Restart-Runbook:
-
8 vun 8 beim éischte Versuch fäerdeg. Duerchschnëttlech Wandzäit: 9 Stonnen
-
Thermesch Drossel: 0 vun 8
-
Checkpoint Schreifzäit: Median 90 Sekonnen. Schlechtst Zäit am Set: 3 Minutten
-
Déi zwee bewosst Rang-Kills goufen allebéid vum leschte 30-Minutte-Checkpoint weidergefouert. Extra Wandauer op deenen zwee Läff: ongeféier 40 Minutten all, Diagnos abegraff, sou datt déi zwee bei 9 Stonnen 40 Minutten souzen. Duerchschnëtt iwwer aacht Stillronnen op 9 Stonnen
-
Spëtzelast vun der IT nach ëmmer ongeféier 18 kW. Déiselwecht Chips. Anert Gebaiverhalen
An dëser Stichprobe ass déi duerchschnëttlech Zäit bis zu engem fäerdege Rezept vun 18 Stonnen op 9 Stonnen gefall, oder 9 Stonnen all Kéier, 72 Stonnen iwwer aacht Lafprozesser. "First-Found" ass vu 5 vun 8 op 8 vun 8 gaangen. Den Drossel ass vu 7 vun 8 op 0 vun 8 gaangen. Déi lescht Zuel ass déi, déi seet, ob si Beschleuniger oder Pabeiergewiichter kaaft hunn. Si wäerten d'Zäitännerung net als eng Erspuernis vu 50% an der Produktioun bezeechnen. Aacht Lafprozesser sinn eng kleng, einfach Zuel.
Dës Zuelen sinn eng Beispillschätzung baséiert op dem genannten Test, enger klenger Prouf, engem Modell an enger gemëschter Hal. Si sinn net eng PUE, net e Campus-Megawatt, a kee Beweis datt Kestrel eng Trainingsplaz op engem Feld sollt bauen. D'Iwwerpréiwung vun de Logbicher souz bannent den 9 Stonnen; si hunn et net verstoppt. Déi 18 kW Zuel ass eng ofgerënnt PDU-Miessung, keng Rechnung vun engem Versuergungsbetrib. Si hunn déi 72 Stonnen net an e Käschtepunkt ëmgerechent, well de gemëschte Stroumtarif vun der Fabréck e falschen Business Case geschaf hätt.
De Servicecheck war separat a méi kleng: 200 Linnbiller op déi agezaunt Box, all op der Plaz. Dat ass Inferenz, kee Training. Déi zwee ze vermëschen wier de Feeler vun der Hybridhal a Miniatur gewiescht.
Wat kann falsch goen
-
D'Beschaffung nennt véier Server ëmmer erëm "den KI-Datenzentrum". D'Etikett verstoppt d'Sanitärinstallatiounen, an den nächste Kaf sinn méi GPUs fir deeselwechte Krankegang
-
Hannert Dier-Tauschtauscher ginn eran an et gëtt keen op der Waassersäit a Betrib geholl. D'Ventilatoren jäizen nach ëmmer. D'Aueren falen nach ëmmer
-
De Stoff ass een eenzege Switch ouni Ersatzwee. Ee futtise Link an de "Cluster" besteet erëm aus véier Aarbechtsstatiounen
-
Kontrollpunkte bleiwen um SAN, well den NVMe-Pool "Phase zwee" war. Déi zweet Phase kënnt eréischt virum nächsten doudegen Node un
-
Si zitéieren eng PUE fir zwee Regaler an enger gemëschter Hal. Klima, Grenzen an de Rescht vun der ERP-Rei maachen dëst Verhältnis zu engem Kostüm
-
Training a Service deelen de Stoff. Eng Iwwerschwemmung vun engem Checkpoint léisst d'Fabréckslinn waarden. D'Latenz vun der Schwanz ass do d'Produkt, net d'Dicht
-
E Knuet stierft of an een behandelt en als Uptime-Ticket amplaz vun engem Checkpoint-Neistart. Enterprise-Operatiounen an AI-Operatiounen schwätzen e ganzen Nomëtteg laanschteneen
-
Si hätten e Käfeg kënne lounen, ausser datt d'Biller net fortgoe kënnen. Wann se dës Aschränkung vergiessen, schéckt dat se an eng Wollekenkonversatioun, an där se sech entspane mussen
Praktescht Takeaway
Wat en AI-Datenzentrum an dëser Form ass, ass kee Lager a keng GPU-Rechnung. Et ass d'Zell, déi et den Acceleratoren erlaabt, de Laf ofzeschléissen: Stroum, deen se späichere kënnen, Hëtzt, déi fortgeet, e Stoff, e Kontrollpunkt, an een, deen zoustänneg ass, wann e Rang stierft. De Kestrel brauch kee Campus. Si brauche zwee Racks, fir opzehalen, sech ze verhalen. Déi meescht Équippe sollten dëst Verhalen notzen. E puer, mat engem geheime Datesaz an enger Hal, déi d'Hëtzt aushaale kann, sollten eng Zell bauen an d'Slide refuséieren.
FAQ
Wat ass en AI-Datenzentrum?
Eng héichdichteg Rechenanlag, wou Energieversuergung, Killung, Netzwierk a Späicherplatz ëm parallel Training a Modellservéierung geriicht sinn, net ëm ordentlech Reie vun allgemenge Serveren. Si ass sou konzipéiert, datt eng grouss Zuel vun Acceleratoren Modeller trainéiere a servéiere kënnen, ouni ze schmëlzen, am Netzwierk ze stoen oder op der Festplack ze waarden. Eng normal Entreprisehal ass e gemëschte Quartier. Eng KI-Hal ass eng Monokultur, där hir Wäertunitéit den Accelerator ass, wéi z. B. GPUs oder TPU-Chips. Si gesäit aus wéi e Lager a verhält sech wéi e Kraaftwierk, dat Mathematik mécht.
Wéi ënnerscheet sech en KI-Datenzentrum vun engem normalen Datenzentrum?
Traditionell Halen optimiséieren fir gemëschte Workloads an Uptime iwwer vill kleng Servicer. KI-Siten änneren d'Verhältnisser: D'Dicht geet erop, d'Netzwierk gëtt zu engem Stoff, ouni deen den Trainingsjob net ka schaffe, an de Späicher muss Checkpoints a Bewegung halen oder Beschleuniger bleiwen inaktiv. Enterprise Ops denkt un Ticketen a Change-Fënsteren. KI Ops denkt un Job-Warteschlangen an dat schlecht Gefill, wann en Node spéit an enger laanger Lafzäit ofstéiert. Dir kënnt ëmmer nach béid Datenzentren nennen. D'Bezeechnung verstoppt just d'Sanitärinstallatiounen.
Firwat verbrauchen KI-Datenzentren sou vill Stroum?
Déi erausstéchend Hardware ass keng clever CPU. Et ass den Accelerator-Tray: GPUs oder aner KI-Chips, a Serveren gepackt, dann a Racks, dann a Reien, déi sech e Strukturfach mat héijer Bandbreet deelen. D'Dicht pro Rack ass den Twist am Handlungsspill: manner Racks, all eenzel en klengen Uewen. Megawatt IT-Laascht weist sech, wann eng Hal voll ass, obwuel et sech net lount, eng typesch Zuel ze erfannen. De limitéierende Faktor ass dacks d'Ënnerstatioun, net d'Wonschlëscht vu GPUs.
Wéi ginn AI-Datenzentren ofgekillt?
Héichdicht Racks leeden Hëtzt op eng Manéier of, wéi d'Loft ni wierklech gefrot gouf ze handhaben. Mat Hëtzetauscher hannert der Dier, méi waarme Gäng an enger cleverer Eindämmung kann een d'Loft méi haart drécken. Dann kënnt Flëssegkeet op: Direkt-op-Chip-Ofkillung, Killmëttelschleifen an Immersioun a verschiddenen Designen. En Accelerator, deen d'Hëtzt ofbremst, ass ee fir deen een scho bezuelt huet a net vollstänneg notze kann. PUE ass ëmmer nach wichteg, well all Watt, deen een fir Ventilatoren a Pompelen ausgëtt, e Watt ass, deen net un eng GPU gaangen ass. Waasser spillt och eng Roll: e puer Anlagen schlucken, anerer schlucken.
Firwat ass d'Netzwierkung sou wichteg wéi d'GPUs?
Training ass eng Konversatioun: Dausende vun Acceleratoren, déi Gradienten, Parameteren a Shards vun engem Modell enk synchron austauschen. Wann de Stoff ziddert, waart de ganze Job op den luessten Hop. Dofir sinn KI-Halen obsesséiert mat Netzwierker mat héijer Bandbreet, gerénger Latenz, InfiniBand-ähnleche Stoffer oder Ethernet an der selwechter Roll, an Topologien, déi sech net an der Halschent klappen, wann e Link ausfällt. D'Inferenz këmmert sech ëm d'Latenz vun den Tail, vill méi kleng Ufroen an Isolatioun. An dësem Gebai ass d'Sanitärinstallatioun de Restaurant.
Fir wat gëtt en KI-Datacenter benotzt: Training oder Inferenz?
Training ass eng Kampagne: e Cluster zesummestellen, en Daten fidderen, reliéis Kontrollpunkten opsetzen a stonnelaang oder Woche laang lafen. Inferenz ass eng Geschäftsfront: scho trainéiert Modeller äntweren elo, mat enger Latenz déi wichteg ass. Trainingscampussen jagen no Kraaft, Land an Dicht. Inferenzsite jagen no Latenz a Präsenz. Hybrid Halen existéieren well Kapital net onendlech ass, heiansdo eng Hal mat zwou Killschleifen. En e bësse méi ale Beschleuniger beim Client kann e glamouréise vun engem Kontinent ewech schloen.
Firwat ass Späicherplatz an engem KI-Datenzentrum wichteg?
Trainingsdaten mussen séier genuch ukommen, datt GPUs net mat de Féiss klappen. Kontrollpunkte mussen landen, fir datt en Ofstuerz net eng Woch verluer geet. Modellgewichte musse gelueden ginn, ier eng servéierend Replika live ass. De Späicherdurchsatz, net nëmmen d'Kapazitéit, ass de rouegen Engpass. Dir kënnt e Verméige fir Beschleuniger ausginn an se mat engem polite Array, deen fir virtuell Maschinnen entwéckelt gouf, aushongeren.
Wat geschitt wann e Knuet während der Lafzäit ofstierft?
Een doudegen Accelerator an engem enk gekoppelten Trainingsjob kann de ganze Chorus blockéieren. Training wëll Checkpoints, net Optimismus. Inferenz drainéiert de kranke Knuet, hält eng Replik amgaang ze äntwerten a bleift live. Ännerungsfënstere kollidéieren ëmmer nach mat Trainingsläufe, déi sech net ëm Äre Kalenner këmmeren. Redundanz ass ëmmer nach wichteg fir Stroumversuergung, Killung, Weeër a Späicherung, awer de Feelermodus ass manner uerdentlech wéi déi al Nines-of-Uptime-Rutsch.
Wat ass den Impakt vun engem KI-Datazentrum op d'Stroumnetz, d'Waasser an d'Noperen?
D'Uschloss un d'Netz ass dacks de richtege Prozess fir d'Auswiel vun engem Standuert. Land ass einfach am Verglach mat enger Ënnerstatioun an engem Versuergungsunternehmen, deen aner Clienten huet. Waasser fir d'Ofkillung, wann Dir et benotzt, gëtt zu engem Noperproblem, soubal de Reen staark ass, zesumme mat Kaméidi, visuellem Volumen an Hëtzt un engem Grenzzaun. Training kann sech a méi bëllegen Energiemäert a méi killen Klima verstoppen. D'Inferenz léiwer bei de Benotzer ze sinn. Et gëtt keen eenzege perfekte Standuert. Mat enger Pressematdeelung gëtt et e Kompromiss.
Muss ech en AI-Datacenter besëtzen, oder soll ech en lounen?
Déi meescht Leit brauche keng vun dësen Halen ze besëtzen. Hyperscaler bauen, well d'Produkt d'Flott ass. Laboe bauen, wann d'Warteschlaang den Engpass ass oder d'Donnéeë net fortgoe kënnen. Eng Bank, e Spidol, eng Regierung oder e Produzent mat engem geheime Datesaz kann On-Prem oder e private Colocation rational maachen. All déi aner sollten lounen: KI-bereet Colocation, eng Cloud-Reservatioun oder e verwaltete Cluster. Dir kritt d'Beschleuniger, ouni e Kraaftwierksbetreiber ze ginn.
Referenzen
-
IEA - www.iea.org
-
LBNL - datacenters.lbl.gov
-
De Grénge Grid - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
Uptime Institut - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com