Rakenna Wiki

Rakenna Wiki

Referenssisarja tekoälylaskennan rakentamisesta, verkottamisesta, virransyötöstä ja käytöstä – ostajille ja integraattoreille, jotka mitoittavat seuraavaa 4-GPU-yksikköään, 8-GPU-palvelintaan tai robotiikkalaboratoriotaan.

Jokainen artikkeli on kirjoitettu aitojen Kentino-versioiden pohjalta. Ei täytettä. Mielipidepohjainen siellä missä insinöörityö sitä vaatii. Rehellinen rajoista.

49artikkelit livenä 9aihekappaleet 2uutta viikossa · ti + to

Perustavanlaatuinen tekoälypalvelin W-sarja

Jos suunnittelet usean näytönohjaimen sisältävän kokoonpanon suunnittelua, lue nämä ensin. Muisti, PCIe, virta, lämmönsiirto, tallennustila ja näytönohjaimen valintalista.

W01RAM ja VRAM: Miten ne liittyvät toisiinsa tekoälypalvelimessa4-GPU-näytönohjain, jossa on 192 Gt:n VRAM-muistia ja 32 Gt:n RAM-muistia, on rikki. Oikea suhde riippuu siitä, mitä laitteita todellisuudessa käytät.
W02PCIe-väylät ja topologia usean näytönohjaimen tekoälypalvelimessa"PCIe x8 vs. x16 ei ole päättelyn kannalta merkityksellinen" pitää enimmäkseen paikkansa – ja sitä toistavat ihmiset eivät yleensä tiedä miksi.
W03GPU-nousuohjaimet: Milloin niitä tarvitaan ja mikä hajoaaKun signaalin eheys hiljaa kuolee, linkit oppivat äänettömästi uudelleen sukupolveen 3 ja läpäisevät testit alkavat pudottaa yhden näytönohjaimen päivässä.
W04Virtalähteen mitoitus ja kahden virtalähteen kokoonpanotMatematiikka, kokoonpanon todellisuus ja rehellinen kehystys 4-GPU:n ja 8-GPU:n virransyötölle.
W05Lämpötilat ja ilmavirtaus moni-GPU-tekoälypalvelimien kokoonpanoissaNeljä 450 W:n näytönohjainta tuottaa 1.8 kW lämpöä laatikossa. Edestä taakse suuntautuva ilmavirtaus, staattinen paine ja se, miksi "siinä on tuulettimet", ei ole jäähdytyssuunnitelma.
W06Tallennuskerrokset tekoälypalvelimellaMalli, tietojoukko, alustava tiedosto, tarkistuspiste – neljä työkuormaa ja neljä käyttötapaa. Yksi NVMe-taso ei palvele yhtäkään niistä hyvin.
W07Näytönohjaimen valinta: 5090, 4090, RTX Pro 6000, L40, L4Rehellinen ja suora keskustelu, jossa vertaillaan todellisia suorituskykylukuja, kompromisseja ja päätöksentekoprosessia, jota käytämme asiakaspuheluissa.

Token Economics T -sarja

Rahalaskelmat. Tokeneiden määrä euroa kohden, paikallisen ja pilviympäristön kustannukset miljoonaa tokenia kohden ja milloin kumpikin malli todellisuudessa voittaa.

T01Tokeneita sekunnissa euroa kohdenAinoa GPU-arvomittari, jolla on merkitystä päättelyn kannalta. Reaaliaikaisia ​​tokeneita sekunnissa euroa kohden 5090-, 4090-, RTX Pro 6000-, L40- ja L4-näytönohjaimissa.
T02Miljoonan tokenien hinta: Paikallinen vs. pilviPaikallinen vs. pilvi, euroissa mitattuna. Missä on ristiintulo ja miksi pilvilasku voittaa, kunnes se yhtäkkiä katoaa.
T03Jatkuva vs. purskepäättelytaloustiedeTasaisella 24/7-päättelyllä ja piikikkäillä erätöillä on vastakkaiset taloudelliset vaikutukset. Milloin paikallinen ratkaisu voittaa ja milloin pilvipalvelu pelastaa sinut pulasta.

Linux / Käyttöjärjestelmä / Ohjelmistot L-sarja

Näytönohjainten alla oleva ohjelmistopino. Ajurien kiinnittäminen, CUDA-asetukset, ytimen viritys, tiedostojärjestelmät ja valvonta.

L01Ubuntun kiinnittäminen ja NVIDIA-ajurien hallintaKiinnitä ydin, kiinnitä ajuri tai katso, kuinka apt-päivitys ottaa näytönohjaimesi offline-tilaan. Ajurien hallinta, joka kestää uudelleenkäynnistyksen.
L02CUDA, cuDNN ja NVIDIA Container ToolkitJärkevä asennuspolku. CUDA vs. ajuri vs. työkalupakin versiointi ja riippuvuushelvetin pysäyttävä konttireitti.
L03Linux-ytimen viritys tekoälypalvelimilleMikä oikeasti liikuttaa tekoälytyökuormien kehitystä – valtavat sivut, NUMA, IRQ-affiniteetti – ja mikä on cargo-kultti.
L04Tiedostojärjestelmän valinta tekoälypalvelimilleXFS, ZFS, ext4 – ja miksi Btrfs ei ole tekoälypalvelimien listalla. Yhdistä tiedostojärjestelmä käyttömalliin.
L05Valvontapino: Prometheus, Grafana, DCGM, LokiNäe näytönohjaimen lämpötilat, VRAM-muistin, ECC-virheet ja työvirheet ennen kuin ne maksavat sinulle harjoitusajon.

Networking N-sarja

NVLink-todellisuus, klusteritopologiat (lehti-selkäranka, fat-tree, sudenkorento, kytkimetön), latenssin analysointi, reititys ja RDMA:n käyttöönotto käytännössä.

N03NVLink ja NVSwitch: Kun sillä on väliäDGX:n markkinoinnissa kehuskellaan NVLinkin kaistanleveyttä teratavuina sekunnissa. Useimmille Kentinon työkuormille sitä ei tarvita lainkaan.
N04Vaihdetut topologiat: Fat-Tree, Leaf-Spine, Dragonfly, TesseractJokainen klusterikaavio alkaa samalla tavalla. Todellinen valinta on mikä topologia on, kuinka paljon ylikuormitusta on ja mikä on porttikohtainen nopeus.
N05Kytkimettömät topologiat: Mesh, Ring, Direct Connect32-porttisen 400 GbE-kytkimen hinta laskee 40 000–80 000 euron välillä vuoden 2026 puolivälissä. 2–4 solmun kytkimelle sellaista ei tarvita.
N06Latenssianalyysi: Minne jokainen mikrosekunti meneeIhmiset mittaavat verkkoja kaistanleveyskaavioilla. Sitten heidän allreduce-vertailuarvonsa tulostaa luvun, joka ei ole lähelläkään linjanopeutta.
N07Reititys: ECMP, adaptiivinen reititys, DCQCNMitä tapahtuu kaapeleiden, verkkokorttien ja kytkimien yläpuolella: miten paketit löytävät polun ja mikä estää verkon romahtamisen all-reduce-tilassa?
N08RDMA-asennus käytännössä + klusterin ylöslinkin suunnitteluKäytännönläheinen vaihe: asenna ajurit, testaa polku, ota GPUDirect käyttöön, validoi NCCL ja suunnittele sitten koko klusterin ylälinkki.

Clustering K-sarja

Kun yksi solmu ei riitä. Yhden vs. useamman solmun päätöksenteko, hajautettu koulutus, päättelyklusterit, jaettu tallennus, aikataulutus ja virheiden käsittely.

K01Yksisolmuinen moni-GPU vs. monisolmuinen: Milloin skaalata ulosKallein virhe on GPU-budjetin jakaminen kahdelle solmulle, kun yksi suurempi solmu olisi hoitanut työn.
K02Hajautettu koulutus vuonna 2026: DDP, FSDP2, DeepSpeed, MegatronNeljä avoimen lähdekoodin pinoa, viisi rinnakkaisuuden akselia ja mikä niistä valitaan mihinkin työhön.
K03Päättelyklusterit: vLLM-tensoririnnakkaisfunktio, liukuhihnarinnakkaisfunktio70B-malli ei mahdu yhdelle näytönohjaimelle hyödyllisellä KV-välimuistilla. 405B ei mahdu yhdelle solmulle. Mallin rajaaminen ratkaisee sen kustannukset.
K04Klusteritallennus: NFS, BeeGFS, Lustre, objektitallennustilatJaettu tallennustila on se osa hajautettua klusteria, jota kukaan ei ajattele, ennen kuin näytönohjaimet ovat 40 %:n käyttöasteella.
K05Työaikataulutus: SLURM, Kubernetes, RaySLURM, Kubernetes, Ray – ja sen tietäminen, milloin et tarvitse kumpaakaan niistä. Sovita aikatauluttaja tiimin kokoon.
K06Viankäsittely tekoälyklustereissaMikä GPU-klusterissa oikeastaan ​​hajoaa ja miten siitä toivutaan — tarkistuspisteytys, kuntotarkastukset ja viallisten solmujen tyhjennys.

Integraatio I-sarja

Kaiken yhteenveto — päättelypalvelimen asennus, laboratorioverkko ja virrankulutusbudjetit, referenssikokoonpano ja laitekannan käyttöönotto.

I01Edge AI -arkkitehtuuri: Robotti ↔ Paikallinen päättelypalvelinKultastandardiartikkeli. Ostamasi humanoidi on vain puolet järjestelmästä; tämä on toinen puolisko ja se, miten nämä kaksi puoliskoa kytketään yhteen.
I02Päättelypalvelimen asentaminen: vLLM, llama.cpp, SGLangAsenna, käytä ja vertaile. Mikä moottori sopii millekin mallille ja viiveen tavoitearvolle.
I03Verkkotopologia robotiikan ja tekoälyn laskentalaboratoriolleRobotiikan ja tekoälyn laboratorion kytkeminen — robottiyhteydet, päättelypalvelimen ja palvelimen väliset linkit ja missä viive piilee.
I04Robotiikka- ja tekoälylaboratorion virta- ja jäähdytysbudjettiRobotiikka- ja tekoälylaboratorion tehon ja jäähdytyksen mitoitus ennen vuokrasopimuksen allekirjoittamista.
I05Referenssirakennus: Robotiikka- ja tekoälylaboratorio yhdessä räkissäTäydellinen robotiikka- ja tekoälylaboratorio yhdessä telineessä – osaluettelo, asettelu ja kompromissit, jotka tosiasiassa toimittaisimme.
I06Kaluston käyttöönotto: Useita robotteja, jaettu laskentaUseita robotteja, jaettu laskenta. Kuinka mitoittaa ja ajoittaa päättely laivueelle, ei demolle.

Tehonsäästö P-sarjan

Puhtaan virran toimittaminen räkkiin. Vaiheet, virransyöttöyksiköt, tasapainotus, katkaisijat, UPS-laitteet ja generaattorit tekoälylaskentaa varten.

P01Yksivaiheinen vs. kolmivaiheinen tehoKun neljän näytönohjaimen boksi ylittää yhden 16 ampeerin virtapiirin, ja mikä kolmivaiheinen kortti todella maksaa tekoälyräkin?
P02PDU-tyypit: Perus, Mittaroitu, Kytkimellinen, ATSMitä kukin tekee ja mitä GPU-räkkiä varten oikeastaan ​​tarvitset.
P03Vaiheiden tasapainottaminen tekoälyräkkien välilläKuormita kolme vaihetta tasaisesti tai laukaise katkaisija huonoimpaan aikaan. Miten tasapainotus toimii tekoälyräkkien välillä.
P04Katkaisijan mitoitus ja käynnistysvirtaJatkuva kuormitus, käynnistysvirtapiikki ja 80 %:n sääntö. GPU-palvelimien kokorajoittimet, jotka eivät aiheuta vikalaukaisua.
P05UPS-mitoitus tekoälylaskentaa vartenTopologia, akkukemia, käyntiaika ja kVA vs. kW -ansa, joka alittaa puolet tekoälylaboratorion UPS-hankinnoista.
P06Generaattori ja siirtokytkinKun akun käyttöaika ei riitä. Generaattorin mitoitus ja siirtokytkimen perusteet tekoälylaboratorioille.

Ohjelmistorobotiikka R-sarja · blogi

Nykyaikainen humanoidi on kuusi tai seitsemän tekniikan alaa yhdistettynä. Anatomia, sensorit, laskennan sijoittelu, SDK:t, verkostoituminen, ostaminen ja huippuluokan VLM-maailmanmallipino.

R01Nykyaikaisen humanoidin anatomiaKuusi tai seitsemän insinööritieteen alaa yhdistettynä. Mitä nykyaikaisen humanoidin sisällä oikeastaan ​​on.
R02Nelijalkaisen robotin anatomiaNelijalkaiset vaihtavat vakauden ja akunkeston välillä. Työjuhtamallin mekaaninen ja laskennallinen anatomia.
R03Robotin anturipinoKamerat, syvyys, LiDAR, IMU, voima-vääntömomentti – mitä kukin anturi ostaa ja mitä se maksaa laskennassa.
R04Laitteessa tapahtuva vs. laitteen ulkopuolinen laskenta roboteilleMikä toimii robotilla vs. palvelimella. Latenssin ja suorituskyvyn välinen suhde, joka jokaisen käyttöönoton on tehtävä.
R05Robot SDK:t, ROS 2 ja simulointiROS 2, toimittajan SDK:t ja simulointiympäristöt – ohjelmistot, joita vasten kehität ennen laitteiston saapumista.
R06Robottien verkottuminen: Wi-Fi, Tethers, 5GWi-Fi, tether-yhteydet, 5G – ja miksi latenssi, ei kaistanleveys, ratkaisee, mitä voit siirtää robotin ulkopuolelle.
R07Robotin ostaminen: Toimitusajat, tulli, tukiRobotiikkalaitteiston ostaminen EU:hun ei ole sama asia kuin työaseman ostaminen. Miltä toimitusajat, tulli ja myynnin jälkeinen tuki todellisuudessa näyttävät?
R08Miksi robotit tarvitsevat erillistä reunalaskentaaViiveargumentti. Miksi mallin sijoittaminen pilvi-API:n taakse rikkoo käyttötapauksen, jota asiakas todellisuudessa haluaa.
R09Automaattinen merkintä VLM-pohjaisilla maailmanmalleillaHuippuluokan havaintokykypino – Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos – sovellettuna robotiikan maatiedon analysointiin.

Asiakastapaukset C-sarja · blogi

Aito Kentino rakentaa oikeilla mitatuilla numeroilla. Valokuvilla, osaluetteloilla, vertailuarvoilla ja rehellisillä jälkianalyysillä.

C01Case-tutkimus: 4× RTX 4090 AI -työasemaEPYC 7542, 512 Gt:n DDR4 ECC, 4× RTX 4090. Mitattu 651.6 TFLOPSia. 179.3 tok/s jatkuva vLLM:llä. Huippulämpötila 73 °C. Reaaliluvut toimitusversiosta.

Uusia artikkeleita joka tiistai ja torstai

Tämä wiki on kasvava kirjasto — uusia buildejä, verkostoitumista, klusterointia, tehoa ja robotiikkaa käsitteleviä artikkeleita julkaistaan ​​vuoteen 2026 asti, ja jokainen niistä on peräisin aidosta Kentino-buildista. Jos haluat tietyn aiheen priorisoitavan, kirjoita osoitteeseen info@kentino.com.