Czym jest RAG (retrieval-augmented generation)?

RAG polega na wyszukaniu pasujących fragmentów z Twoich dokumentów i podaniu ich modelowi razem z pytaniem, żeby odpowiedź powstała z Twoich materiałów, a nie z pamięci modelu. Nic nie jest dotrenowywane. Dokumenty zostają u Ciebie, a ich edycja od razu zmienia odpowiedzi.

Zweryfikowano:

W skrócie

Gdy dostawca mówi, że model jest „trenowany na Twoich danych", dopytaj które. W dziewięciu przypadkach na dziesięć chodzi o wyszukiwanie, które jest tańsze, aktualizuje się natychmiast i potrafi wskazać źródło. To lepsza odpowiedź, więc nie ma powodu jej ubierać w trenowanie.

RAG porównany z fine-tuningiem pod kątem aktualizacji, cytowania źródeł i kosztu.
RAG (wyszukiwanie)Fine-tuning
Co się zmieniaTo, co model widziWagi modelu
Aktualizacja faktuEdytujesz dokumentTrenujesz i wdrażasz od nowa
Potrafi wskazać źródłoTak, znaleziony fragmentNie
Dokument dodany dzisiajDziała od razuDopiero po kolejnym treningu
Dobre doFaktów, regulaminów, danych o produktachTonu, formatu, wąskiego zadania
Co napędza kosztTokeny na pytanieTreningi, potem hosting
Typowa porażkaZnalezienie złego fragmentuPewne powtórzenie nieaktualnych danych

Źródła: Lewis i in., Retrieval-Augmented Generation (arXiv:2005.11401) · Anthropic: contextual retrieval · zweryfikowano: 07.06.2026

Gdzie to widać w praktyce

Bot wsparcia po bazie wiedzy

Każda odpowiedź opiera się na artykule, który kontrolujesz, z linkiem do niego. Gdy we wtorek zmienia się polityka zwrotów, bot jest poprawny we wtorek. To przypadek, dla którego RAG powstał.

Asystent sprzedaży po cenniku

Wyszukiwanie trzyma liczby aktualnymi i możliwymi do zacytowania. I tak stawiamy przed tym twardą regułę: asystent może podać cenę tylko ze znalezionego wiersza, nigdy z pamięci, a gdy nic nie pasuje, mówi, że sprawdzi.

Wyszukiwanie po umowach

Ludzie pytają zwykłym językiem i dostają klauzulę plus dokument, z którego pochodzi. Cytat waży tu więcej niż płynność, bo i tak otworzą plik.

Gdzie fine-tuning nadal wygrywa

Chcesz sztywnego kształtu odpowiedzi albo firmowego tonu w zadaniu, w którym fakty prawie się nie ruszają. To problem trenowania, nie wyszukiwania. W praktyce łączymy jedno z drugim rzadko i dopiero po zmierzeniu samego RAG-a.

Jak tego używamy

Wyszukiwanie jest mało efektowne i wygrywa w większości przypadków. Powód jest nudny: firmy zmieniają swoje fakty szybciej, niż ktokolwiek chciałby dotrenowywać model. Cennik, polityka dostaw, lista tego, kto obsługuje który region. Wrzuć to do bazy dokumentów, wyciągaj właściwe fragmenty przy pytaniu, a system jest poprawny w chwili, gdy ktoś zmieni dokument.

Niedoceniane jest to, że jakość RAG-a to problem wyszukiwania, nie modelu. Jeśli wyszukiwanie poda trzy niewłaściwe akapity, najlepszy model świata napisze płynną złą odpowiedź. Dlatego większość czasu w takich projektach idzie u nas na podział na fragmenty, metadane i ewaluację: czy dla pięćdziesięciu pytań, które klienci naprawdę zadają, wraca właściwy fragment? Mierzymy to, zanim ktokolwiek zobaczy bota. Sama technika wywodzi się z pracy Lewisa i współautorów z 2020 roku i w kształcie prawie się nie zmieniła; zmieniło się to, że narzędzia wokół niej dojrzały. Naturalnie łączy się z agentami AI, dla których wyszukiwanie jest jednym z narzędzi. Jak ją wdrażamy, zobaczysz na stronie chatbotów AI i Voice AI.

← Wszystkie: Słownik

FAQ

Częste pytania

01.Czy RAG to to samo co trenowanie modelu na moich danych?

Nie i ta różnica ma znaczenie biznesowe. RAG pokazuje modelowi Twoje dokumenty w momencie pytania i zostawia model nietknięty. Trenowanie zmienia sam model. RAG jest tańszy, aktualizuje się w chwili edycji dokumentu i potrafi wskazać źródło, którego użył.

02.Czy przy RAG moje dane wychodzą poza moje systemy?

Do dostawcy modelu trafiają tylko znalezione fragmenty przy każdym pytaniu, a dostawcę i region wybierasz Ty. Sama baza dokumentów może stać w Twojej infrastrukturze w UE. Klientom z ostrymi wymogami uruchamiamy i bazę, i model wewnątrz ich środowiska.

03.Dlaczego chatbot na RAG-u wciąż się myli?

Prawie zawsze dlatego, że wyszukiwanie zwróciło zły fragment, a nie dlatego, że model był słaby. Naprawa to lepszy podział na fragmenty, lepsze metadane i zestaw testowy z prawdziwych pytań, i tam idzie większość pracy przy budowie.

04.Ile dokumentów obsłuży RAG?

Rzadko ogranicza liczba dokumentów, częściej jakość wyszukiwania po nich. Uruchamialiśmy to na kilkudziesięciu stronach regulaminów i na dziesiątkach tysięcy rekordów. To drugie wymaga porządnej bazy wektorowej i ewaluacji, a nie większego modelu.

05.Ile kosztuje utrzymanie RAG-a?

Koszt bieżący to znalezione fragmenty plus pytanie i odpowiedź, rozliczane za tokeny przez wybrany model, plus niewielki hosting bazy dokumentów. Najdroższe są długie konteksty, więc ciaśniejsze wyszukiwanie jest też tańszym wyszukiwaniem.

Powiązane strony

Który proces kosztuje Cię najwięcej?

Trzydzieści minut, bezpłatnie. Wychodzisz z konkretnym planem naprawy i kwotą, jaką ten proces kosztuje. Plan zostaje u Ciebie, nawet jeśli wdrożysz go bez nas.

Zamów bezpłatny audyt