Bare-metal GPU dla firm · 96 GB VRAM · Katowice

TESTY I PORADNIKI

AI i serwery GPU — pojęcia po ludzku

Proste definicje pojęć potrzebnych przy wyborze serwera AI. GPU, LLM, tokeny, kontekst, pamięć, API, eksperci MoE i offload — z przykładami.

Nie musisz znać całego technicznego słownictwa, żeby opisać swój pomysł. Ten krótki słownik pomaga zrozumieć, czego potrzebuje aplikacja AI i co oznaczają liczby w naszych testach.

GPU i CPU

GPU, czyli procesor graficzny, potrafi wykonywać wiele podobnych obliczeń równolegle. Dlatego używa się go nie tylko do grafiki, lecz także do modeli AI. CPU to główny procesor serwera: obsługuje system, aplikacje i część przygotowania danych. Zobacz ich podział pracy.

LLM i oznaczenia 8B, 32B, 72B

LLM to duży model językowy: program wytrenowany do pracy z tekstem. Litera B w nazwie oznacza miliardy parametrów modelu, nie gigabajty pamięci. Większa liczba parametrów nie jest automatyczną gwarancją lepszej odpowiedzi w każdym zadaniu.

MoE, czyli model z ekspertami

Model MoE dzieli część obliczeń między wiele modułów nazywanych ekspertami. Przy tworzeniu kolejnego fragmentu tekstu wybiera tylko część z nich — podobnie jak zespół, który przydziela konkretne zadanie wybranym osobom. To porównanie sposobu podziału pracy, nie dowód, że model rozumuje jak człowiek. Mniejsza liczba aktywnych parametrów może ograniczać ilość obliczeń, ale pozostałe dane modelu nadal muszą być dostępne. Dlatego liczba aktywnych parametrów nie określa rozmiaru całego modelu w pamięci.

Token

Token to fragment tekstu używany przez model — czasem słowo, część słowa albo znak. Dlatego 1000 tokenów nie musi oznaczać 1000 słów. Ich liczba zależy między innymi od języka, treści i sposobu dzielenia tekstu przez model.

Kontekst

Kontekst to tekst, z którego model korzysta podczas przygotowywania odpowiedzi: instrukcje, pytanie, dokumenty i historia rozmowy. Limit kontekstu obejmuje również miejsce na generowaną odpowiedź. Dłuższy kontekst może wymagać więcej pamięci i czasu. Sprawdź pomiary dla różnych długości wejścia.

RAM i VRAM

RAM to pamięć systemowa serwera, a VRAM to pamięć karty GPU. Nie są jedną wspólną pulą. W VRAM trzeba pomieścić nie tylko dane modelu, lecz także pamięć potrzebną do jego pracy. Porównaj zmierzone konfiguracje i poznaj rolę RAM.

API

API to sposób komunikacji między programami. Twoja aplikacja wysyła do modelu zadanie i odbiera wynik, zamiast wymagać ręcznej pracy w oknie czatu. Poradnik własnego API pokazuje przykładowe uruchomienie.

TTFT, czyli czas do pierwszego tokena

TTFT mówi, jak długo trzeba czekać na pierwszy wygenerowany fragment tekstu. To co innego niż czas ukończenia całej odpowiedzi. Niektóre modele najpierw generują treść rozumowania, której aplikacja nie pokazuje jako odpowiedzi. Dlatego przy takich modelach rozróżniamy rozpoczęcie generowania od pierwszego widocznego fragmentu odpowiedzi dla użytkownika.

Tokeny na sekundę, prefill i decode

Tokeny na sekundę opisują szybkość przetwarzania tekstu. Prefill to przetwarzanie wejścia, a decode to generowanie kolejnych fragmentów odpowiedzi. Wynik jednego zapytania różni się od łącznej przepustowości kilku zapytań — nie należy ich zamieniać miejscami.

Równoległość

Równoległość to liczba zadań wykonywanych jednocześnie. Cztery równoległe zapytania nie oznaczają limitu czterech kont użytkowników. Więcej zadań naraz może zwiększyć łączną przepustowość, a jednocześnie wydłużyć odpowiedź dla pojedynczej osoby.

Kwantyzacja i Q4_K_M

Kwantyzacja zapisuje liczby opisujące model z mniejszą precyzją, dzięki czemu pliki i wymagania pamięciowe mogą być mniejsze. Q4_K_M to jeden z takich formatów. Zmiana formatu może wpływać na szybkość i jakość odpowiedzi, dlatego porównania powinny wskazywać dokładną wersję modelu.

KV cache

KV cache to pamięć robocza, w której model przechowuje informacje o już przetworzonym tekście. Pomaga nie obliczać wszystkiego od nowa przy kolejnym tokenie. Rośnie znaczenie jej pojemności przy długich dokumentach i kilku jednoczesnych zapytaniach.

Offload, czyli podział pracy

Offload oznacza przeniesienie części obliczeń lub danych między CPU i GPU. Model może na przykład korzystać jednocześnie z VRAM karty i RAM serwera. To nie zamienia RAM w równie szybką pamięć GPU — pojemność i szybkość takiej konfiguracji trzeba sprawdzić osobno.

Porównanie tego samego modelu przy różnych podziałach pokazuje wpływ na czas odpowiedzi. W teście większego modelu 235B sprawdzamy zastosowanie tego podejścia do modelu z ekspertami.

Od pojęć do własnego zastosowania

Metodyka testów LLM łączy te pojęcia w całość: wyjaśnia, co mierzymy, które wyniki można porównywać i jak sprawdzić przydatność odpowiedzi. Dokładne ustawienia poszczególnych pomiarów pozostają w szczegółach ich artykułów.

Zacznij od pytania: co aplikacja ma robić, jak długie dane przetwarzać i ile zadań obsługiwać naraz? Testy i poradniki pomagają przełożyć to na konfigurację. Możesz też sprawdzić ofertę serwera lub opisać nam swój pomysł.