Čo je to dátové centrum s umelou inteligenciou?

Čo je to dátové centrum s umelou inteligenciou? [Video a kvíz]

Stručná odpoveď: Dátové centrum s umelou inteligenciou je s vysokou hustotou , kde sa napájanie, chladenie, infraštruktúra a úložisko zameriavajú na tréningové a obsluhujúce modely, nie na serverovňu s extra grafickými procesormi. Čipy získavajú slávu; budova rozhoduje o tom, či budú fungovať. Ak sa obrazy nemôžu odoslať, je potrebné dovybaviť malú bunku; väčšina tímov by si mala prenajať.

Kľúčové poznatky:

Čipy verzus budovanie: O tom, či urýchľovače fungujú, rozhodujú výkon, chladenie, tkanina a úložisko.

Miesta, nie paláce: Dodatočne vybavte dva stojany, keď sa dáta nemôžu odoslať; nekupujte kampus.

Priemer verzus medián: Pri ôsmich cykloch sa medián reštartuje; použite 18-hodinový priemer.

Odolnosť proti zneužitiu: Neuvádzajte PUE pre dva regály v zmiešanej hale.

Ilustratívne výsledky: Osem behov je malá mapa, nie 50 % úspora produkcie.

Články, ktoré by ste si mohli prečítať po tomto:

🔗 Je umelá inteligencia spoľahlivá? Video a kvíz
Preskúmajte spoľahlivosť umelej inteligencie prostredníctvom pútavého videa a interaktívneho kvízu.

🔗 Ako používať umelú inteligenciu v každodennom živote
Objavte praktické spôsoby, ako môže umelá inteligencia zjednodušiť každodenné úlohy a rutiny.

🔗 Ako používať umelú inteligenciu v práci
Naučte sa praktické spôsoby, ako používať umelú inteligenciu pre inteligentnejšiu produktivitu na pracovisku.

🔗 Dokáže umelá inteligencia myslieť sama za seba?
Pochopte, či umelá inteligencia dokáže skutočne myslieť samostatne alebo uvažovať.

Ako sa líši od „bežného“ dátového centra

Tradičné haly sú optimalizované pre zmiešané pracovné zaťaženie a prevádzkyschopnosť naprieč mnohými malými službami. Určite vám záleží na redundancii a na PUE ako koncepte – dodatočnej energii, ktorú budova spotrebuje na dodanie wattu výpočtového výkonu. Zvyčajne nenavrhujete každú chodbu okolo racku, ktorý sa správa ako prenosná ohrievacia farma.

Stránky s umelou inteligenciou menia pomery. Hustota sa zvyšuje. Sieť sa stáva štruktúrou, bez ktorej sa tréningová úloha nemôže zaobísť. Úložisko musí udržiavať kontrolné body v pohybe alebo akcelerátory stáť nečinne ako dostihové kone v dopravnej zápche.

Existuje aj kultúrny rozdiel. Podnikové operácie myslia v tiketoch a časových rámcoch zmien. Operácie umelej inteligencie myslia v frontoch úloh a v nepríjemnom pocite, keď uzol dlhodobo neskoro zomrie. Myslím, že by ste obe mohli stále nazývať „dátovými centrami“, pretože nimi aj sú. Označenie len zakrýva potrubie.

Typ Na čo je postavený Vynikajúci hardvér Charakter výkonu / chladenia Komu to vyhovuje Prečo existuje
Tradičné podnikové dátové centrum Zmiešané IT: databázy, virtuálne počítače, e-mail, súbory CPU, bežné servery, známe úložisko Vzduchom vedený; mierna hustota; PUE ako téma diskusie Spoločnosti prevádzkujúce každodenné systémy Udržujte firemné aplikácie aktuálne
Klaster pre školenia umelej inteligencie Dlhé, úzko prepojené tréningové úlohy Husté akceleračné racky; Prepojenia GPU Vysoká hustota; kvapalinové chladenie alebo [výmenníky tepla v zadných dverách] (https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laboratóriá a stavitelia modelov žijúci v pracovných radoch Dokončite beh bez toho, aby ste vyhladovali čipy
Zariadenie na inferenciu s umelou inteligenciou Poskytovanie modelu; odpovede v reálnom čase a dávkové odpovede Akcelerátory; vyrovnávače záťaže, na ktorých záleží Stále horúce, len... menej teatrálne; latencia viac ako hrubá hustota Produkty, ktoré musia odpovedať teraz Umiestnite model blízko používateľa
Hybridná hala s umelou inteligenciou Tréning a služba pod jednou strechou; no - tak nejako Zmiešané stojany; oplotené bazény; zdieľaná látka Dve skvelé osobnosti v jednej rastlinnej miestnosti;; je to trápne Tímy, ktoré si nemôžu dovoliť dva kampusy Kapitál je konečný; život je neuprataný

Nie je to morálne hodnotenie. Rôzne stroje, rovnaké priezvisko.

GPU, akcelerátory a rack, ktorý spotrebúva energiu

Prejdite sa po tradičnej vyvýšenej podlahe a regály vyzerajú takmer slušne. Prejdite sa po rade s umelou inteligenciou a vyzerajú, akoby chceli budovu prehltnúť.

Vynikajúci hardvér nie je šikovný procesor. Je to akceleračný zásobník: GPU alebo iné čipy umelej inteligencie, zabudované do serverov, potom do rackov a potom do riadkov, ktoré zdieľajú vysokorýchlostnú infraštruktúru. GPU prepájajú čipy do niečoho, čo sa môže tváriť ako jeden obrovský akcelerátor; klastrová infraštruktúra robí rovnaký trik v riadkovom meradle. Paralelné trénovanie funguje iba vtedy, ak tieto prepojenia zostanú silné a predvídateľné. Ak o to prídete, váš „klaster“ bude kopou drahých pracovných staníc zdieľajúcich PSČ.

Energia nasleduje čipy. Nie mohutný kancelársky PDU. Megawatty IT záťaže, keď sa hala zaplní - nebudem si vymýšľať žiadne číslo. Hustota na rack je dejový zvrat. Menej rackov. Každý z nich je malá pec. Limitujúcim faktorom je často rozvodňa, nie zoznam želaní GPU. Viete, ako to chodí: obstarávanie chce viac akcelerátorov; energetický dodávateľ chce dlhý rozhovor a veľmi veľký šek.

Jedna trochu hlúpa metafora, ktorej sa neviem zbaviť: stojan je hladné zviera. Môžete vychovať rýchlejšie. Stále ho musíte kŕmiť a stále musíte zbaviť horúčavy. Ak vynecháte ktorýkoľvek z nich, stane sa z neho veľmi drahé ťažítko na papier.

Problém s energiou, teplom a chladením

Elektrina dnu. Kúrenie von. To je celé náboženstvo.

Stojany s vysokou hustotou odvádzajú teplo spôsobom, akým by ho vzduch nikdy nemal zvládať. Môžete tlačiť vzduch silnejšie – výmenníky tepla v zadných dverách, teplejšie uličky, inteligentné uzavretie – a to funguje do určitého bodu. Potom sa objaví kvapalina:

  • Priame chladenie čipu

  • Chladiace slučky, vďaka ktorým vyzerá strojovňa ako chemická dielňa

  • Ponorenie sa do niekoľkých návrhov, ktoré stále prekvapujú ľudí, ktorí si myslia, že voda a servery by nemali zdieľať vetu

Nič z toho nie je okázalé. Všetko je to produkt, pretože plynový pedál, ktorý škrtí, je taký, za ktorý ste už zaplatili a nemôžete ho naplno využiť.

PUE stále záleží. Je to pomer, nie osobnosť. Prevádzkovatelia sa za ním ženú, pretože každý watt vynaložený na ventilátory a čerpadlá je watt, ktorý nešiel do GPU. Nebudem uvádzať „typický“ údaj; klíma a spôsob, akým nakreslíte hranice, ho ovplyvňujú a falošná presnosť je horšia ako žiadna. V príbehu je aj voda. Niektoré rastliny usrkávajú. Niektoré hltajú. Odparovacie chladenie je účinné, kým ho rieka alebo sucho neurobia politickým problémom.

Networking: prečo je látka rovnako dôležitá ako čipy

Ľudia fotografujú grafické karty. Mali by fotografovať prepínače.

Tréning je konverzácia. Tisíce akcelerátorov si vymieňajú gradienty, parametre, úlomky modelu v tesnej synchronizácii. Ak sa štruktúra chveje, celá úloha čaká na najpomalší skok. Preto sú haly umelej inteligencie posadnuté sieťami s vysokou šírkou pásma, nízkou latenciou a topológiami, ktoré sa pri výpadku spojenia neprehnú na polovicu. Tkaniny podobné InfiniBandu, Ethernet v rovnakej úlohe, prepojenia GPU vo vnútri krabice, káble, ktoré musia byť správne na prvýkrát.

Inferencia je iná téma. Obsluha modelu sa stará o latenciu chvosta – pomalú odpoveď, nie priemernú. Dávkové verzus reálny čas rozdeľuje osobnosť. Tréningový klaster chce rozsiahly, kolektívny pohyb typu „všetci ku všetkým“. Obsluhujúca flotila chce oveľa menších požiadaviek a izoláciu bez dopravnej zápchy v systéme na vyrovnávanie záťaže.

Keď už som tu, ľudia sa k sieti správajú ako k vodovodnému potrubiu a k elektrárni ako k reštaurácii. V tejto budove je vodovodné potrubie reštauráciou. Ak to prehliadnete, kúpite si kuchyňu, ktorá nedokáže rozvoz jedla.

Tréning verzus inferencia: dve budovy, niekedy doslova

Tréning je kampaň. Zostavíte klaster, napájate ho dátami, pravidelne ho kontrolujete, spúšťate ho hodiny alebo týždne a modlíte sa, aby infraštruktúra zostala bez problémov. Dávkovo náročná, náročná na šírku pásma, ticho trpezlivá - až kým zlyhaný uzol neurobí chybu. Jeden nefunkčný akcelerátor v úzko prepojenej úlohe môže zastaviť celý zbor.

Inferencia je len výkladná skriňa. Modely už sú natrénované, teraz odpovedajú na otázky, klasifikujú obrázky, generujú text. Latencia je dôležitá. O niečo starší akcelerátor blízko zákazníka môže prekonať pôsobivý akcelerátor na inom kontinente.

Takže dochádza k rozdeleniu. Tréningové areály sa ženú za mocou, pozemkami a hustotou. Inferenčné miesta sa ženú za latenciou a prítomnosťou. Existujú aj hybridné haly, pretože kapitál nie je nekonečný. No – nie vždy dve budovy. Niekedy jedna hala so zamatovým lanom a dvoma chladiacimi slučkami.

Aj tu dochádza k rozvetveniu kolokácie, hyperškálovania kampusov a lokálnych sídiel. Hyperškálovatelia budujú priestor v takých mierkach, že my ostatní vyzeráme, akoby sme si len aranžovali nábytok. Kolokaly predávajú hustotu po regáloch. On-premise systémy stále existujú, aj keď sa dáta nemôžu presunúť.

Priepustnosť úložiska, kontrolné body a náročné čipy

Nikto neuvádza paralelný súborový systém na obálke brožúry.

Tréningové dáta musia prichádzať dostatočne rýchlo, aby GPU neklopkali nohami. Kontrolné body musia pristáť, aby havária nezahodila týždeň. Váhy modelov sa musia načítať predtým, ako je spustená replika. Priepustnosť úložiska – nielen kapacita – je tichým úzkym hrdlom. Môžete minúť majland na akcelerátory a vyhladovať ich pomocou zdvorilého poľa určeného pre virtuálne stroje.

Vzor je známy: lesklý klaster, front úloh a čakanie na I/O, ktoré hľadia späť ako neslušná faktúra. Klastrovanie výpočtov bez klastrovania dátovej cesty je spôsob, ako dosiahnuť veľmi drahý nečinný stav. Udržujte čipy napájané alebo priznajte, že ste si kúpili sochu.

Softvér, orchestrácia a nenápadná operačná vrstva

Hardvér je celebrita. Plánovači robia prácu.

Dátové centrum s umelou inteligenciou je zbytočné, ak úlohy nedokážu nájsť grafické procesory, ak dva tímy nedokážu zdieľať klaster bez súboja, ak sa nedá nahradiť zlyhaná hodnosť, ak sa firmvér mení, až kým sa fabric nezlyhá v spomalenom zábere. Orchestrácia, pozorovateľnosť, obmedzovanie výkonu – nenápadná operačná vrstva, vďaka ktorej viete, že na nej záleží.

Mám pre túto vrstvu slabosť. Tiež tam, kde nesprávne nakonfigurovaná sieťová karta celé popoludnie zosobňuje problém s chladením... to zistíte tvrdo.

Keď uzol zomrie uprostred behu

Uzol zomrie. Okná zmien stále kolidujú s tréningovými behmi, ktorým nezáleží na vašom kalendári. Skupinovo plánujete veľké úlohy, ohradzujete inferenčné fondy, píšete runbooky pre zlyhania, ktoré vyzerajú ako „úloha je pomalá“, až kým nevyzerajú ako „úloha je mŕtva“. Redundancia stále dôležitá – napájanie, chladenie, cesty, úložisko – ale režim zlyhania je menej prehľadný ako stará snímka s deviatkami prevádzkyschopnosti. Inferencia: replika, vyprázdni chorý uzol, neustále odpovedaj. Trénovanie chce kontrolné body, nie optimizmus.

Poloha, voda, sieť a susedia

Tieto nenecháte vedľa chaty kvôli výhľadu.

Pripojenie k sieti je často skutočným procesom výberu lokality. Pozemok je jednoduchý v porovnaní s rozvodňou a energetickou spoločnosťou, ktorá má aj iných zákazníkov. Voda na chladenie, ak ju používate, sa stáva problémom susedov, hneď ako sú zrážky nepríjemné. Hluk. Vizuálna mohutnosť. Teplo na hranici plota. Plánovacie komisie zisťujú názory na „oblak“ v momente, keď potrebuje pole a rieku.

Latencia ťahá opačným smerom. Inferencia rada pracuje v blízkosti používateľov a prepojení. Tréning sa môže skrývať na lacnejších trhoch s energiou a v chladnejšom podnebí. Priemysel hovorí, akoby existovalo jedno dokonalé miesto. Nie je. Existuje kompromis s tlačovou správou.

Zvyšné teplo a nezvaná pec

Brožúry túto časť milujú. Odveďte odpadové teplo do domov, bazénov, skleníkov; je to krásna veta. Niekedy je okruh okresu skutočný. Niekedy je kampus na nesprávnom mieste a teplo stále ide do ovzdušia. Som skeptický k verzii brožúry; nie som skeptický k fyzike.

Kto ho potrebuje (a kto by si ho mal radšej prenajať)

Väčšina ľudí nemusí vlastniť jednu z týchto hál.

Stručný zoznam:

  • Hyperškálovačov, pretože produktom je flotila

  • Laboratóriá, keď je úzkym hrdlom čas čakania v rade alebo keď dáta nemôžu odísť

  • Banka, nemocničná skupina, vláda alebo výrobca s tajným súborom údajov – lokálne alebo v súkromnej kolo klietke – môže byť racionálny, aj keď je to len problém

Všetci ostatní by si mali prenajať priestor. Kolokácia s hustotou pripravenou na umelú inteligenciu. Rezervácia v cloude. Riadený klaster. Získate urýchľovače bez toho, aby ste sa stali aj prevádzkovateľom elektrárne. Romantika sa vytratí, keď sa niekto prvýkrát opýta, kto má o 3:00 ráno službu pre chladiaci okruh.

Priznávam, že je v tom niečo ako hrdosť. Vlastniť klaster sa cíti ako vlastniť prostriedky na predpovedanie. Potom príde faktúra za elektrinu a hrdosť pominie.

Na čo slúži budova

Čo je teda dátové centrum s umelou inteligenciou? Špecializovaný kampus s vysokou hustotou, kde sú akcelerátory, napájanie, chladenie, infraštruktúra a úložisko organizované okolo tréningových a servisných modelov – nie univerzálna IT s grafickým procesorom v rohu. Vyzerá ako sklad. Správa sa ako elektráreň, ktorá robí výpočty.

Ak si nepamätáte nič iné: čipy získavajú slávu; rozvodňa, chladivo a sieť rozhodujú o tom, či boli tieto čipy dobrý nápad. Školenie a inferencia môžu mať spoločnú strechu; stále chcú rôzne spôsoby. Väčšina organizácií by si mala prenajímať. Niektoré by mali stavať. Susedia si to všimnú aj tak.

Oblak mal vždy budovu. V dnešnej dobe má budova názory.

Príklad z reálneho sveta: Dvojracková tréningová bunka, keď obrazy nemôžu odísť

Scenár

Tomos je vedúcim infraštruktúry v spoločnosti Kestrel Precision, 400-zamestnanej továrni v regióne West Midlands. Už majú malú vlastnú halu: ERP, zdieľanie súborov, virtuálne počítače, zmiešaná štvrť, s ktorou som začal tento článok. Chladenie vzduchom. Bežný Ethernet. SAN, ktorá je dokonale vhodná pre kancelárske disky.

Tím pre strojové videnie potrebuje natrénovať inšpekčný model na záberoch z továrne. Zábery nemôžu opustiť pracovisko. Zobrazujú proces, ktorý spoločnosť neuloží na cloudový disk, ani na súkromný. Riešením oddelenia obstarávania sú štyri servery s dvojitým akcelerátorom a prezentácia s názvom „naše dátové centrum s umelou inteligenciou“. Servery sa umiestnia do dvoch existujúcich rackov, pretože je tam miesto a priestor sa javil ako obmedzenie.

Nie je. Do dvoch týždňov sa GPU zdajú byť zaneprázdnené a potom sa potichu spomalia. Úlohy sa zastavia, keď kontrolný bod narazí na sieť siete SAN. Uzol zomrie o jedenástej hodine a prevádzka je jednoducho... preč. Tomos určite kúpil čipy. Kúpil kopu drahých pracovných staníc so zdieľaným PSČ. Budova bola stále podnikovou halou.

Nepotrebujú kampus, novú rozvodňu ani rieku. Potrebujú malú bunku, ktorá sa správa ako miniatúrne dátové centrum s umelou inteligenciou: energiu, ktorú stojany skutočne dokážu udržať, teplo, ktoré odchádza bez toho, aby sa čipy zohrievali, štruktúru, cez ktorú môže tréningová úloha komunikovať, úložisko, ktoré dokáže prevziať kontrolný bod, a runbook pre prípad, že uzol zlyhá. Keďže obrazy nemôžu odísť, prenájom kolo klietky vzdialenej štyridsať minút nie je riešením. Dodatočná montáž dvoch stojanov áno.

Čo bunka potrebuje

  • Odmeraný rozpočet napájania v danom riadku, z PDU, nie zo zoznamu želaní GPU. Ak voľná kapacita nedokáže napájať štyri servery pri tréningovom zaťažení, konverzácia sa tam končí a hľadajú hustejšiu farbu, nie zázrak

  • Chladenie vzduchu sa pri tejto hustote nikdy nepožadovalo: výmenníky tepla v zadných dverách, ak ich hala zvládne, alebo malá kvapalinová slučka, ak to zvládne. Ak ani jedno, servery sa tam nemontujú

  • Vyhradená vysokorýchlostná sieťová infraštruktúra medzi štyrmi uzlami, nie kancelársky Ethernet. Ak má dodávateľ v katalógu iba 10 Gb prepínač, nejde o klaster

  • Lokálne rýchle úložisko pre kontrolné body a tréningové shardy, nie VM SAN

  • Plánovač, interval kontrolných bodov a písomná cesta reštartu. Hardvér je celebritou. Táto vrstva je úlohou

  • Oplotený inferenčný box pre výrobnú linku, oddelený od tréningového chatu, pretože obsluha vyžaduje latenciu chvosta a izoláciu, nie kolektívnu

  • Povolenie na zaznamenávanie napájania, hodín GPU, udalostí škrtenia a nástenných hodín úlohy. Ak ich nemôžu skontrolovať, odfotografujú GPU a prehliadnu prepínače

Príklad inštrukcie

Tomos to v popise zariadenia uvádza bežnými slovami:

Nenazývajte toto kampusom umelej inteligencie. V existujúcej hale postavte dvojrackovú tréningovú bunku pre štyri servery s dvojitým akcelerátorom. Obrazy z výroby zostanú na mieste. Úspech je: štyri uzly dokončia 12-epochový recept na inšpekciu a tréning bez tepelného škrtenia, napíšu kontrolný bod za minúty, nie desiatky minút, a pokračujú od tohto kontrolného bodu, keď zámerne zničíme rank. Chladenie musí udržiavať GPU na ich tréningových hodinách. Sieť musí byť štruktúrou, ktorú tieto štyri boxy zdieľajú, nie cestou cez kancelársky stack. Úložisko musí napájať čipy. Ak sa výmenníky tepla na zadných dverách nezmestia, povedzte to a prestaňte. Neuvádzajte PUE pre dva racky v zmiešanej hale. To číslo by bolo divadlo.

Potom toto vloží do samotnej tréningovej úlohy:

Kontrolný bod každých 30 minút smerom k miestnemu rýchlemu poolu. Ak hráč na danej hodnosti zomrie, reštartujte od posledného kompletného kontrolného bodu. Nečakajte na SAN. Nepokračujte v tréningu, kým hodiny neklesli z rozcvičky. Zaznamenajte si to a zastavte, aby sme videli státie.

Dobrá hodina vyzerá takto: všetkých osem GPU na tréningových frekvenciách, súbor kontrolného bodu sa pripojil, úloha stále funguje správne. Zlá hodina vyzerá takto: ventilátory pracujú na plný výkon, frekvencie klesajú, po desiatich minútach je zaznamenaná hodnota kontrolného bodu 2 % a niekto v kancelárii hovorí, že „klaster je v prevádzke“. V prevádzke nie je tréning.

Ako to otestovať

Test napíšu pred dodatočnou montážou, čo je celý zmysel nedôvery k demu.

  • Ten istý recept z 12 epoch, rovnakých 120 000 inšpekčných fotografií, osem cyklov

  • Časovanie je merané nástennými hodinami až do dokončenia receptu vrátane akéhokoľvek reštartu, merané od odoslania úlohy po posledný kontrolný bod epochy 12

  • Preskočenie tepla: Takty GPU zostávajú počas behu na tréningovom cieli. Udalosť throttle je zlyhanie, aj keď sa úloha nakoniec dokončí

  • Prepustenie na úložisko: čas zápisu kontrolného bodu, medián a najhorší, z protokolu úlohy

  • Preskočenie textílie: práca nestojí v kolektívnom čakaní, kým je hodnosť zdravá. Ak toto čakanie nevidia, inštrumentácia nie je hotová

  • Dva z ôsmich behov zámerne zaniknú v pevne stanovenom kroku, aby sa otestovala cesta k reštartu

  • Inferencia je samostatný 200-obrazový test od výrobnej linky až po oplotený servírovací box. Úspech v tréningu sa nepočíta ako úspešný servis

  • Zaznamenávajú výkon racku z PDU v 15-minútových vzorkách, takže nikto nemusí vymýšľať megawatt

Súhlas s označením bunky ako „pripravenej na AI“: 8 z 8 receptov je dokončených; 0 z 8 zobrazuje tepelné obmedzenie; obe ukončené behy sa obnovia; kontrolné body zostávajú v minútach. Ak to zmeškajú, stále majú serverovňu s luxusnými grafickými kartami.

Výsledok

Ilustratívny výsledok z vymysleného osemnásobného testu, nie publikovaný obrázok Kestrel.

Predpoklady: štyri servery s dvojitým akcelerátorom v dvoch rackoch; jeden inšpekčný model; 120 000 statických snímok; osem behov fixného 12-epochového receptu; nástenné hodiny zahŕňajú reštarty až do dokončenia receptu; škrtiaca klapka znamená zaznamenaný pokles tréningových hodín; kontrolný čas je zápis, nie želanie; výkon racku sú vzorky PDU, nie kampusová PUE.

Pred modernizáciou, grafické karty v bežných vzduchom chladených rackoch na kancelárskom ethernete a VM SAN:

  • 5 z 8 behov skončilo na prvý pokus. Medián nástenných hodín medzi týmito piatimi: 14 hodín

  • 3 z 8 museli začať odznova po zastavení približne v 11. hodine (dva po tom, čo uzol zomrel so zastaraným kontrolným bodom, jeden po tom, čo kontrolný bod zaplnil SAN). Okamžitý opakovaný pokus, žiadne čakanie cez noc v hodinách: 11 premárnených hodín plus 14-hodinový druhý pokus alebo 25 hodín do dokončenia receptu na týchto troch

  • Priemerný čas do dokončenia receptu vo všetkých ôsmich prípadoch vrátane reštartov: 18 hodín. (Päť pri 14 hodinách, tri pri 25 hodinách. Medián všetkých ôsmich je stále 14, čo by skrylo reštarty. Preto je tu priemer východiskovou hodnotou.)

  • Tepelná škrtiaca klapka bola zaznamenaná v 7 z 8 behov. Medián času pri znížených hodinách: 3 hodiny pri 14-hodinovom pokuse

  • Zápis kontrolného bodu: medián 22 minút

  • Zničenie hodnosti nebol test, ktorým by mohli prejsť. Nemali runbook. Dve náhodné úmrtia boli zistením

  • Špičkové IT zaťaženie dvoch stojanov počas tréningu: približne 18 kW. Rad mal dostatok wattov. Nemal chladenie ani tkaninu

Po výmenníkoch tepla v zadných dvierkach na týchto dvoch rackoch, vyhradenej infraštruktúre medzi štyrmi uzlami, malom fonde NVMe pre kontrolné body, 30-minútovom kontrolnom bodovaní a runbooke pre reštart:

  • 8 z 8 dokončilo na prvý pokus. Medián nástenných hodín: 9 hodín

  • Tepelná škrtiaca klapka: 0 z 8

  • Kontrolný bod zápisu: medián 90 sekúnd. Najhorší v sérii: 3 minúty

  • Dva úmyselné útoky na základe hodnosti pokračovali od posledného 30-minútového kontrolného bodu. Dodatočné hodiny na týchto dvoch pokusoch: približne 40 minút každý, vrátane diagnózy, takže tieto dva pokusy strávili takmer 9 hodín a 40 minút. Priemer z ôsmich kôl bez prerušenia je 9 hodín

  • Špičkové IT zaťaženie je stále okolo 18 kW. Rovnaké čipy. Odlišné správanie budovy

V tejto vzorke sa priemerný čas do dokončenia receptu znížil z 18 hodín na 9 hodín, alebo o 9 hodín v každom pokuse, 72 hodín počas ôsmich cyklov. Čas dokončený na prvýkrát sa znížil z 5 z 8 na 8 z 8. Čas plynu Throttle sa znížil zo 7 z 8 na 0 z 8. Toto posledné číslo hovorí, či si kúpili urýchľovače alebo ťažítka. Zmenu času nenazvú 50 % úsporou produkcie. Osem cyklov je malá a jednoduchá sada.

Tieto čísla sú len príkladom odhadu založeného na uvedenom teste, malej vzorke, jednom modeli a jednej zmiešanej hale. Nie sú to údaje o energetickej účinnosti (PUE), nie sú to megawatty kampusu a nie sú dôkazom toho, že by Kestrel mal postaviť školiace stredisko na poli. Preskúmanie záznamov sa uskutočnilo v rámci 9 hodín; neskrývali to. Údaj 18 kW je zaokrúhlený údaj z PDU, nie faktúra za energie. Nepreviedli 72 hodín na náklady, pretože zmiešaná sadzba elektriny továrne by vytvorila falošný obchodný prípad.

Kontrola servírovania bola samostatná a menšia: 200 riadkových obrázkov do ohradeného boxu, všetko na mieste. To je inferencia, nie tréning. Zmiešanie týchto dvoch by bolo chybou hybridnej haly v miniatúre.

Čo sa môže pokaziť

  • Obstarávanie neustále nazýva štyri servery „dátovým centrom umelej inteligencie“. Označenie zakrýva vodovodné potrubie a ďalší nákup predstavuje viac grafických kariet pre tú istú chorú uličku

  • Zadné výmenníky sa zapoja a nikto neuvedie do prevádzky vodnú stranu. Ventilátory stále kričia. Hodiny stále idú

  • Fabric je jeden prepínač bez náhradnej cesty. Jeden neúspešný odkaz a „klaster“ opäť pozostáva zo štyroch pracovných staníc

  • Kontrolné body zostávajú v sieti SAN, pretože fond NVMe bol vo fáze „dva“. Fáza dva nedorazí pred ďalším nefunkčným uzlom

  • Uvádzajú PUE pre dva regály v zmiešanej hale. Podnebie, hranice a zvyšok riadku ERP robia z tohto pomeru kostým

  • Tréning a obsluha zdieľajú štruktúru. Záplava kontrolných bodov núti výrobnú linku čakať. Latencia chvosta je tam produkt, nie hustota

  • Uzol zlyhá a niekto to považuje za tiket dostupnosti namiesto reštartu kontrolného bodu. Podnikoví operátori a operátori umelej inteligencie sa celé popoludnie rozprávajú cez seba

  • Mohli si prenajať klietku, ale obrazy nemôžu odísť. Zabudnutie na toto obmedzenie ich posiela do konverzácie v oblakoch, ktorú si budú musieť oddýchnuť

Praktické ponaučenie

Dátové centrum umelej inteligencie v tejto podobe nie je sklad ani faktúra za GPU. Je to bunka, ktorá umožňuje akcelerátorom dokončiť beh: energiu, ktorú dokážu udržať, teplo, ktoré odchádza, fabricu, kontrolný bod a niekoho, kto bude zodpovedný, keď zomrie člen danej hodnosti. Kestrel nepotreboval kampus. Potrebovali dva racky, aby prestali predstierať. Väčšina tímov by si mala toto správanie prenajať. Niekoľko tímov s tajnou dátovou sadou a halou, ktorá znesie teplo, by si malo postaviť bunku a odmietnuť skĺznutie.

Často kladené otázky

Čo je to dátové centrum s umelou inteligenciou?

Vysokohustotné výpočtové pracovisko, kde sa napájanie, chladenie, sieťovanie a úložisko zameriavajú na paralelné trénovanie a obsluhu modelov, nie na úhľadné rady univerzálnych serverov. Je navrhnuté tak, aby obrovské množstvo akcelerátorov mohlo trénovať a obsluhovať modely bez toho, aby sa zastavovali v sieti alebo čakali na disku. Bežná podniková hala je zmiešaná štvrť. Hala s umelou inteligenciou je monokultúra, ktorej jednotkou hodnoty je akcelerátor, ako napríklad GPU alebo čipy v štýle TPU. Vyzerá ako sklad a správa sa ako elektráreň, ktorá robí výpočty.

V čom sa líši dátové centrum s umelou inteligenciou od bežného dátového centra?

Tradičné dátové centrá optimalizujú zmiešané pracovné zaťaženie a dostupnosť naprieč množstvom malých služieb. Lokality s umelou inteligenciou menia pomery: hustota sa zvyšuje, sieť sa stáva štruktúrou, bez ktorej sa tréningová úloha nezaobíde, a úložisko musí udržiavať kontrolné body v pohybe alebo akcelerátory nečinné. Podnikové operácie myslia v tiketoch a časových intervaloch zmien. Operácie s umelou inteligenciou myslia v frontoch úloh a v nepríjemnom pocite, keď uzol dlhodobo zomrie neskoro. Stále by ste mohli zavolať do oboch dátových centier. Označenie len zakrýva potrubie.

Prečo dátové centrá s umelou inteligenciou spotrebúvajú toľko energie?

Vynikajúcim hardvérom nie je šikovný procesor. Je to akceleračný zásobník: grafické karty alebo iné čipy umelej inteligencie, zabalené v serveroch, potom v rackoch a potom v radoch, ktoré zdieľajú sieťovú infraštruktúru s vysokou šírkou pásma. Hustota na rack je hlavným zvratom v deji: menej rackov, každý z nich je malá pec. Megawatty IT záťaže sa objavia, keď sa hala zaplní, hoci vymýšľať typické číslo sa neoplatí. Limitujúcim faktorom je často rozvodňa, nie zoznam želaní grafických kariet.

Ako sa chladia dátové centrá s umelou inteligenciou?

Racky s vysokou hustotou odvádzajú teplo spôsobom, akým by sa od vzduchu nikdy nepožadovalo, aby ho zvládal. Vďaka výmenníkom tepla so zadnými dvierkami, teplejším uličkám a inteligentnému zadržiavaniu vzduchu môžete odvádzať viac vzduchu. Potom sa objaví kvapalina: priame chladenie čipu, chladiace slučky a v niektorých prevedeniach aj ponorenie. Za akcelerátor, ktorý škrtí, ste už zaplatili a nemôžete ho plne využiť. Energetická účinnosť (PUE) je stále dôležitá, pretože každý watt vynaložený na ventilátory a čerpadlá je watt, ktorý nešiel do GPU. V príbehu je aj voda: niektoré zariadenia usrkávajú, iné hltajú.

Prečo je sieťovanie rovnako dôležité ako grafické karty?

Tréning je konverzácia: tisíce akcelerátorov si vymieňajú gradienty, parametre a úlomky modelu v tesnej synchronizácii. Ak sa štruktúra fabric chveje, celá úloha čaká na najpomalší skok. Preto sú haly umelej inteligencie posadnuté sieťami s vysokou šírkou pásma, nízkou latenciou, štruktúrami fabric podobnými InfiniBand alebo Ethernetom v rovnakej úlohe a topológiami, ktoré sa pri výpadku spojenia nepreložia na polovicu. Inferencia sa stará o latenciu chvosta, mnoho menších požiadaviek a izoláciu. V tejto budove je vodovodné potrubie reštauráciou.

Na čo sa používa dátové centrum umelej inteligencie: na tréning alebo inferenciu?

Školenie je kampaň: zostavte klaster, naplňte ho dátami, pravidelne ho kontrolujte a nechajte ho bežať hodiny alebo týždne. Inferencia je len výkladná skriňa: modely už natrénované, teraz odpovedajú, s latenciou, na ktorej záleží. Školiace areály sa naháňajú za výkonom, pozemkami a hustotou. Inferencijné miesta sa naháňajú za latenciou a prítomnosťou. Hybridné haly existujú, pretože kapitál nie je nekonečný, niekedy jedna hala s dvoma chladiacimi slučkami. O niečo starší akcelerátor v blízkosti zákazníka môže prekonať okázalý akcelerátor na vzdialenom kontinente.

Prečo je úložisko dôležité v dátovom centre s umelou inteligenciou?

Tréningové dáta musia prichádzať dostatočne rýchlo, aby GPU neklopkali nohami. Kontrolné body musia pristáť, aby havária nezahodila týždeň. Váhy modelov sa musia načítať predtým, ako je spustená replika. Priepustnosť úložiska, nielen kapacita, je tichým úzkym hrdlom. Môžete minúť majland na akcelerátory a vyhladovať ich pomocou zdvorilého poľa určeného pre virtuálne stroje.

Čo sa stane, keď uzol zomrie uprostred behu?

Jeden nefunkčný akcelerátor v úzko prepojenej tréningovej úlohe môže zastaviť celý zbor. Trénovanie potrebuje kontrolné body, nie optimizmus. Inferencia vyčerpáva chorý uzol, udržiava repliku v stave odpovede a zostáva aktívna. Okná zmien stále kolidujú s tréningovými behmi, ktorým nezáleží na vašom kalendári. Redundancia je stále dôležitá pre napájanie, chladenie, cesty a úložisko, ale režim zlyhania je menej prehľadný ako starý snímok s deviatkami prevádzkyschopnosti.

Aký je vplyv dátového centra s umelou inteligenciou na sieť, vodu a susedov?

Pripojenie k sieti je často skutočným procesom výberu lokality. Pozemok je jednoduchý v porovnaní s rozvodňou a energetickou spoločnosťou, ktorá má aj iných zákazníkov. Voda na chladenie, ak ju používate, sa stáva problémom susedov, hneď ako sú zrážky silné, spolu s hlukom, vizuálnym objemom a teplom na hranici plota. Školenie sa môže skrývať na lacnejších trhoch s energiou a v chladnejšom podnebí. Inferencia má rada blízko používateľov. Neexistuje jedno dokonalé miesto. Existuje kompromis s tlačovou správou.

Musím vlastniť dátové centrum s umelou inteligenciou alebo si ho mám prenajať?

Väčšina ľudí nepotrebuje vlastniť jednu z týchto hál. Hyperscaleri budujú, pretože produktom je flotila. Laboratóriá budujú, keď je čakanie v rade úzkym hrdlom alebo keď dáta nemôžu odísť. Banka, nemocnica, vláda alebo výrobca s tajnou množinou údajov môžu racionálne využiť lokálne alebo súkromné ​​kolokačné úložisko. Všetci ostatní by si mali prenajať: kolokačné úložisko pripravené na umelú inteligenciu, cloudovú rezerváciu alebo spravovaný klaster. Akcelerátory získate bez toho, aby ste sa stali prevádzkovateľom elektrárne.

Referencie

  1. IEAwww.iea.org

  2. LBNLdatacenters.lbl.gov

  3. Zelená sieť - www.thegreengrid.org

  4. LBNLdatacenters.lbl.gov

  5. LBNLdatacenters.lbl.gov

  6. Inštitút prevádzkyschopnosti - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIAdocs.nvidia.com

  9. NVIDIAdocs.nvidia.com

  10. NVIDIAdocs.nvidia.com

  11. Google Clouddocs.cloud.google.com

Nájdite najnovšiu umelú inteligenciu v oficiálnom obchode s asistentmi umelej inteligencie

O nás

Kvíz
1. Čo je podľa článku dátové centrum s umelou inteligenciou?

2. Čo by mal tím ako Kestrel robiť vo verzii „miesta, nie paláce“, keď obrazy z továrne nemôžu opustiť stránku?

3. Prečo článok používa ako východiskovú hodnotu pred modernizáciou 18-hodinový priemer, nie 14-hodinový medián?

4. Čo sa zmenilo po dvojregálovej modernizácii v ilustračnom osemcyklovom teste?

5. Čo hovorí článok o uvádzaní PUE pre túto dvojregálovú bunku?


Späť na blog