Blog - Od tokenów do odpowiedzi

Attention, Q/K/V i warstwy Transformera — jak działa LLM na bazie papieru Google.

Autor
2code
Opublikowano
Tagi
  • LLM
  • Transformers
  • AI

Współczesne LLM-y (GPT, Gemini, Claude…) stoją na architekturze Transformer z papieru Google Attention Is All You Need (2017). Pomysł: zamiast przetwarzać sekwencję krok po kroku jak RNN, liczyć uwagę między wszystkimi tokenami naraz.

Od tekstu do tokenów

Tekst → tokenizer → lista tokenów t1,,tnt_1,\ldots,t_n → embeddingi xiRdx_i \in \mathbb{R}^{d}. Dokładamy pozycję (sinusoidalną albo learned), bo sama uwaga nie wie, co jest „przed” a co „po”.

Attention: Q, K, V

Dla każdego tokena budujemy trzy wektory:

Q=XWQ,K=XWK,V=XWVQ = X W_Q,\quad K = X W_K,\quad V = X W_V

Scaled dot-product attention:

Attention(Q,K,V)=softmax(QKdk)V\mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left(\frac{Q K^\top}{\sqrt{d_k}}\right) V

Intuicja: QQ pyta „czego szukam?”, KK mówi „co mam”, VV to treść do zmieszania. Softmax waży, które tokeny są ważne dla którego.

Multi-head = kilka takich uwagi równolegle (składnia, odniesienia, lokalny kontekst…) i konkatenacja wyników.

Blok Transformera

Decoder-only LLM (jak GPT) w każdej warstwie ma causal mask: token widzi tylko siebie i przeszłość, nie przyszłość — dlatego generuje autoregresyjnie.

Generowanie odpowiedzi

  1. Prompt → tokeny.
  2. Model przewiduje rozkład p(tn+1t1,,tn)p(t_{n+1} \mid t_1,\ldots,t_n).
  3. Sampling / greedy / nucleus → kolejny token.
  4. Powtarzaj, aż EOS albo limit.

Trening to zwykle minimalizacja cross-entropy na następnym tokenie (pretraining), potem instruction tuning / RLHF.

Dlaczego to „działa” na dokumenty?

Długi kontekst = attention po wielu tokenach dokumentu naraz (koszt pamięci ~ O(n2)O(n^2) w klasycznym attention). Stąd:

  • chunking / RAG przy dużych plikach,
  • warianty sparse / linear attention,
  • cache KV przy generowaniu.

Wniosek

LLM nie „rozumie” jak człowiek — to głęboki stos uwagi + MLP, wytrenowany przewidywać następny token. Papier Google o Transformerach nadal jest szkieletem: Q/K/V, multi-head, warstwy, causal decoding.

Wróć do bloga

Porozmawiajmy o Twoim projekcie