Volgens deskundigen zal inferencing het grootste deel van AI-berekeningen uitmaken. Qualcomm ziet hierin een kans om een alternatief te bieden voor de huidige spelers in het datacenter. Een uitgebreide softwarestack moet klanten overtuigen om over te stappen. De rackscale systemen beloven hoge prestaties en efficiëntie, met voordelen op het gebied van geheugen om de grootste AI-modellen te ondersteunen. Er komen twee modellen, de AI200 en de AI250, waarvan de eerste in 2026 en de tweede in 2027 beschikbaar zal zijn. Qualcomm betreedt met deze oplossingen de datacentermarkt voor AI-inferencing, oftewel het dagelijks uitvoeren van AI-modellen. De AI200 richt zich op een lage total cost of ownership (TCO) en optimaliseert prestaties voor grote taalmodellen (LLM's) en multimodale modellen (LMM's). Elke kaart bevat 768 GB LPDDR-geheugen, wat meer capaciteit voor minder kosten biedt. De AI250 gaat verder met een innovatieve geheugenarchitectuur gebaseerd op near-memory computing, waarbij rekenkracht dicht bij de geheugenchips wordt geplaatst. Dit resulteert in meer dan 10x hogere effectieve geheugenbandbreedte en een lager energieverbruik. Hierdoor wordt gedisaggregeerde AI-inferencing mogelijk, wat de hardware-efficiëntie vergroot door het splitsen van AI-tokenberekeningen en de verwerking van de initiële prompt. Beide racks van Qualcomm volgen een inmiddels traditionele aanpak voor AI: ze maken gebruik van directe vloeistofkoeling. PCIe zorgt voor schaalvergroting, Ethernet voor schaalverdeling. Confidential computing beschermt ook hier de gevoelige AI-workloads, net als bij vele concurrenten. Het stroomverbruik per rack bedraagt 160 kW, wat aanzienlijk minder is dan sommige racks van spelers zoals Nvidia.
Qualcomm bouwt rond de hardware een uitgebreide softwarelaag. Deze ondersteunt gangbare machine learning-frameworks, inference engines en generatieve AI-frameworks. Ontwikkelaars kunnen met één klik modellen vanuit Hugging Face implementeren via de Efficient Transformers Library en de Qualcomm AI Inference Suite. "Met Qualcomm AI200 en AI250 herdefiniëren we wat mogelijk is voor rackscale AI-inferencing", aldus Durga Malladi, SVP & GM van Technology Planning, Edge Solutions & Data Center bij Qualcomm Technologies. De oplossingen zijn ontwikkeld voor eenvoudige adoptie en snelle innovatie. ARM maakt een kans omdat het hier niet gaat om traditioneel datacentergebruik. Serverworkloads zijn meestal ingesteld op x86, waardoor de CPU-keuze beperkt is tot Intel en AMD. Voor AI-workloads is de onderliggende ISA (Instruction Set Architecture) minder belangrijk; de focus ligt op de GPU's en de efficiëntie van het netwerk. Beide onderdelen verschillen nauwelijks tussen x86 en ARM. Toch is het de vraag of Qualcomm een grote kans maakt om marktaandeel te veroveren. Nvidia's "AI-kasten" zijn gevuld met gecombineerde CPU's en GPU's op ARM-basis en zijn momenteel de meest gewilde machines voor AI-workloads, zowel voor training als inferencing. Laatstgenoemde is meer afhankelijk van efficiëntie om aantrekkelijk te zijn voor eindgebruikers, maar de vraag naar AI-compute is zo groot dat alle hardware wel een toepassing vindt. Deze realiteit, meer dan de competitieve positie van Qualcomm, biedt deze nieuwe apparaten een kans op de markt.
Reacties
Geef een reactie
Vereiste velden zijn gemarkeerd met *