LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę
- Tytuł oryginału
- Hands-On LLM Serving and Optimization: Hosting LLMs at Scale
- —
- pierwsze wydanie
- angielski
- język oryginału
- 1
- wydanie po polsku
- 341
- stron
Wdrażaj i optymalizuj modele LLM szybko, tanio i na dużą skalę Rewolucja sztucznej inteligencji sprawiła, że duże modele językowe (LLM) z ciekawostek badawczych stały się krytyczną infrastrukturą produkcyjną. Obecnie największym wyzwaniem dla firm IT nie jest już samo trenowanie modeli, ale ich wydajne, bezpieczne i opłacalne wdrażanie. W erze agentów AI i w obliczu rosnących kosztów korzystania z publicznych API organizacje coraz częściej decydują się na hosting własnych rozwiązań. Ta książka stanowi kompleksowy przewodnik po serwowaniu i optymalizacji LLM. Wypełnia lukę między teorią a praktyką, pokazując, jak przekuć potężne modele w niezawodne aplikacje działające w czasie rzeczywistym, a przy tym poradzić sobie z nową fizyką i ekonomią generatywnej sztucznej inteligencji. Ta publikacja krok po kroku przeprowadza czytelnika przez cykl życia modelu w środowisku produkcyjnym. Autorzy demistyfikują architekturę transformerów, szczegółowo omawiając fazy wstępnego wypełniania (prefill) i dekodowania, jak również zarządzanie pamięcią podręczną KV. Książka uczy projektowania systemów dla pojedynczych i wielu modeli, a także wdrażania zaawansowanych technik optymalizacji: ciągłego przetwarzania wsadowego, kwantyzacji, dekodowania spekulatywnego czy buforowania prefiksów. Czytelnik dowie się, jak skutecznie używać nowoczesnych frameworków (w tym vLLM, TensorRT-LLM, SGLang, llama. cpp) i jak skalować infrastrukturę na wiele procesorów graficznych (GPU) i węzłów przy zachowaniu idealnego balansu między przepustowością, opóźnieniami a kosztami operacyjnymi. Najważniejsze zagadnienia: Architektura LLM i mechanizmy generowania tokenów Zarządzanie pamięcią KV i ciągłe przetwarzanie wsadowe Projektowanie systemów serwowania Zaawansowana optymalizacja Skalowanie na wiele GPU Przegląd frameworków: vLLM, TensorRT-LLM, SGLang, llama. cpp Gdy duże modele językowe stają się podstawą nowoczesnych platform sztucznej inteligencji, ta książka oferuje praktyczny plan serwowania i optymalizacji modeli LLM na dużą skalę co umożliwia niezawodną i opłacalną obsługę ogromnych obciążeń. Bhavesh Doshi, wicedyrektor działu chmury AI w Salesforce