Kołczan Książek
Załóż konto
1 / 1
Wydanie · Softcover

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę

CWChi Wang
—
rok wydania
341
stron
polski (Polska)
język
Softcover
typ okładki
Wydawca
Helion
Przekład
Robert Górczyński, Małgorzata Grygierowska-Augustynowicz, Halina Kraśkiewicz
Tytuł oryginału
Hands-On LLM Serving and Optimization: Hosting LLMs at Scale · angielski
ISBN-13
978-83-2894-204-2
EAN
9788328942042
Data wydania
—
Książka
LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę · 1 wydanie
Wydawca o tym wydaniu

Wdrażaj i optymalizuj modele LLM szybko, tanio i na dużą skalę Rewolucja sztucznej inteligencji sprawiła, że duże modele językowe (LLM) z ciekawostek badawczych stały się krytyczną infrastrukturą produkcyjną. Obecnie największym wyzwaniem dla firm IT nie jest już samo trenowanie modeli, ale ich wydajne, bezpieczne i opłacalne wdrażanie. W erze agentów AI i w obliczu rosnących kosztów korzystania z publicznych API organizacje coraz częściej decydują się na hosting własnych rozwiązań. Ta książka stanowi kompleksowy przewodnik po serwowaniu i optymalizacji LLM. Wypełnia lukę między teorią a praktyką, pokazując, jak przekuć potężne modele w niezawodne aplikacje działające w czasie rzeczywistym, a przy tym poradzić sobie z nową fizyką i ekonomią generatywnej sztucznej inteligencji. Ta publikacja krok po kroku przeprowadza czytelnika przez cykl życia modelu w środowisku produkcyjnym. Autorzy demistyfikują architekturę transformerów, szczegółowo omawiając fazy wstępnego wypełniania (prefill) i dekodowania, jak również zarządzanie pamięcią podręczną KV. Książka uczy projektowania systemów dla pojedynczych i wielu modeli, a także wdrażania zaawansowanych technik optymalizacji: ciągłego przetwarzania wsadowego, kwantyzacji, dekodowania spekulatywnego czy buforowania prefiksów. Czytelnik dowie się, jak skutecznie używać nowoczesnych frameworków (w tym vLLM, TensorRT-LLM, SGLang, llama. cpp) i jak skalować infrastrukturę na wiele procesorów graficznych (GPU) i węzłów przy zachowaniu idealnego balansu między przepustowością, opóźnieniami a kosztami operacyjnymi. Najważniejsze zagadnienia: Architektura LLM i mechanizmy generowania tokenów Zarządzanie pamięcią KV i ciągłe przetwarzanie wsadowe Projektowanie systemów serwowania Zaawansowana optymalizacja Skalowanie na wiele GPU Przegląd frameworków: vLLM, TensorRT-LLM, SGLang, llama. cpp Gdy duże modele językowe stają się podstawą nowoczesnych platform sztucznej inteligencji, ta książka oferuje praktyczny plan serwowania i optymalizacji modeli LLM na dużą skalę co umożliwia niezawodną i opłacalną obsługę ogromnych obciążeń. Bhavesh Doshi, wicedyrektor działu chmury AI w Salesforce