Wyzwanie
Startup AI budujący produkt zasilany LLM potrzebował infrastruktury wnioskowania na poziomie produkcyjnym szybko. Zespół stanął w obliczu długich czasów realizacji procesora graficznego, ograniczonego budżetu i braku doświadczenia w wewnętrznym centrum danych.Potrzebowali dostawcy, który mógłby skonfigurować, przetestować i dostarczyć gotowy do uruchomienia klaster.
Rozwiązanie
Pracując z naszymi inżynierami, klient wybrał serwery Dell GPU skonfigurowane dla ich obciążenia wykładniczego:
- Intel Xeon skalowalne procesory z opcjami wysokiej liczby rdzeni
- Wielokrotne procesory graficzne klasy NVIDIA na węzeł, dostosowane do budżetu
- pamięć DDR5 o wysokiej częstotliwości i pamięć NVMe
- Zinstalowany system operacyjny i zatwierdzone sterowniki z naszego laboratorium
Każdy węzeł został wypalony i przetestowany przed wysyłką, a my dostarczyliśmy etapistyczny plan dostawy, aby zespół mógł rozpocząć testy z pierwszymi węzłami, podczas gdy reszta przybyła.
Wyniki
- Klastry wdrożone w ciągu 7 tygodni, w porównaniu z 2-miesięcznym czasem realizacji podanym w innym miejscu
- opóźnienie wnioskowania zmniejszone o 10% w porównaniu z poprzednią konfiguracją pojedynczego GPU
- 10% oszczędności kosztów w porównaniu z leasingiem równoważnych instancji GPU w chmurze w ciągu 24 miesięcy
Kluczowe informacje
Prawidłowa wielkość pierwszego klastra jest ważniejsza niż zakup największego./Hardware bezpośrednie z fabryki /i skalowanie w miarę wzrostu popytu /pozwólcie, że ten startup /będzie działał bez nadmiernej zaangażowania kapitału.
Skontaktuj się z nami, aby zaplanować swoją infrastrukturę inferencji czy szkolenia.