Bazy wiedzy
Udostępnij agentom zewnętrzne dane i podłącz je do celu.
Z bazy wiedzy model korzysta w trakcie pisania: sięga po publikacje naukowe, hasła encyklopedyczne albo twój własny katalog, na przykład oferty, wydarzenia, nagrania. Bazy wiedzy znajdziesz w Biblioteka → Bazy wiedzy.
Bazy wiedzy nie tworzą artykułów ani klastrów. Nic z nich nie trafia do Strumienia i nic nie przechodzi przez filtr trafności — służą wyłącznie do wzbogacania powstającego tekstu.
Bazy, które masz od początku
Każde konto dostaje przy rejestracji dwie bazy domyślne:
- PubMed — abstrakty recenzowanych publikacji z bazy NCBI. Domyślnie przeszukuje ostatnie 365 dni i zwraca do 20 wyników.
- Wikipedia (pl) — hasła polskiej Wikipedii: definicje, tło pojęć i kontekst historyczny.
Obie działają w trybie na żywo: pytamy zewnętrzne API dopiero wtedy, gdy model o coś zapyta. Nic nie jest u nas przechowywane i nic nie kosztuje, dopóki nie zostaną użyte. Dlatego są dostępne na każdym pakiecie.
Tryb na żywo i tryb indeksowany
| Na żywo | Indeksowany | |
|---|---|---|
| Kiedy pytamy źródło | w chwili wywołania przez model | według harmonogramu, z góry |
| Gdzie leżą dane | nigdzie — odpowiedź jest jednorazowa | w SemanticHubie, jako wpisy z embeddingami |
| Wyszukiwanie | takie, jakie daje cudze API | semantyczne, po podobieństwie treści |
| Koszt | tylko przy użyciu | za każdy nowy i zmieniony wpis |
Bazy domyślne działają na żywo. Baza, którą dodasz sam, jest indeksowana: pobieramy z niej wpisy, rozpoznajemy je po identyfikatorze i skrócie treści, a embedding liczymy wyłącznie dla wpisów nowych i zmienionych. Wpis, który się nie zmienił, nie kosztuje nic.
Dodaj własne API
Potrzebujesz publicznie dostępnego adresu, który na żądanie GET zwraca listę obiektów w JSON. Adresy w sieci lokalnej są odrzucane.
Nazwij bazę i opisz, do czego służy
Nazwa i opis trafiają do modelu — to jedyna wskazówka, po której wie, kiedy po tę bazę sięgnąć. Napisz ją tak, jak wyjaśniłbyś koledze, co w tej bazie jest.
Podaj adres i sposób uwierzytelnienia
Do wyboru: Brak, Token Bearer, Nagłówek i Parametr adresu. Przy nagłówku i parametrze podajesz własną nazwę, pod którą wyślemy token. Token zapisujemy zaszyfrowany i nigdy nie wraca w odpowiedzi API — później widzisz tylko, że jest ustawiony.
Wskaż listę i zmapuj pola
W Ścieżce do listy podaj miejsce, w którym leży tablica wpisów (na przykład data.items); zostaw puste, gdy API zwraca gołą listę. Następnie wskaż ścieżki do pięciu pól: Identyfikator, Tytuł, Treść, Adres wpisu i Data.
Identyfikator musi być stały — po nim rozpoznajemy, że to ten sam wpis. Treść trafia do embeddingu i do modelu, więc wpis bez treści jest pomijany. Adres wpisu jest potrzebny, żeby agent mógł podać go jako źródło. Pusty tytuł zastąpimy pierwszą linią treści.
Sprawdź połączenie
Sprawdź połączenie pokazuje obok siebie surową odpowiedź źródła i wpisy, które z niej wyszły. Bez tego kroku nie da się zapisać bazy: przycisk zapisu pozostaje nieaktywny, dopóki podgląd nie zwróci przynajmniej jednego wpisu. Mapowanie na ślepo zawodzi dopiero przy pierwszej nocnej synchronizacji.
Ustal harmonogram i retencję
Synchronizuj co: tylko ręcznie, 1 h, 6 h albo 24 h. Usuwaj wpisy starsze niż: nigdy, 30, 90 albo 365 dni — liczone od pierwszego zobaczenia wpisu.
Synchronizacja i przeglądanie wpisów
Ekran bazy pokazuje stan ostatniego przebiegu, zapełnienie limitu pakietu i zaindeksowany korpus z wyszukiwarką — dzięki temu na pytanie „czemu model tego nie znalazł" odpowiadasz zajrzeniem do wpisów, a nie zgadywaniem. Przycisk obok nazwy zależy od stanu: Synchronizuj teraz, Spróbuj ponownie, Wznów, Przerwij albo Zobacz pominięte. W trakcie przebiegu widać numer strony oraz liczbę wpisów nowych, zmienionych i pominiętych. Przebieg pojawia się też w Kolejce jako zadanie synchronizacji bazy wiedzy, ale nie wchodzi w jej kolejność — nie opóźnia pisania tekstów.
Stany synchronizacji:
| Stan | Co oznacza |
|---|---|
| Gotowa do użycia | Stan bazy działającej na żywo — nie ma czego synchronizować. |
| Jeszcze nie synchronizowano | Baza istnieje, ale nie było jeszcze żadnego przebiegu. |
| Synchronizacja w toku | Przebieg trwa. |
| Zsynchronizowano | Ostatni przebieg zakończył się w całości. |
| Zsynchronizowano, część wpisów pominięto | Przebieg się udał, ale części wpisów nie dało się zmapować. |
| Synchronizacja nie powiodła się | Ostatni przebieg zakończył się błędem. |
| Automatyczna synchronizacja wstrzymana po 3 błędach | Trzy nieudane przebiegi z rzędu. Automat przestaje odpytywać źródło. |
| Limit wpisów w pakiecie osiągnięty | Zaindeksowane wpisy zostają; zatrzymały się tylko nowe. |
Dodanie bazy to za mało — trzeba ją dołączyć
To najczęstsze nieporozumienie. Baza w Bibliotece jest tylko twoim katalogiem. Dopiero dołączenie daje do niej dostęp — na liście baza bez dołączeń jest opisana wprost jako niewidoczna dla modelu.
Dołącz bazę do celu
W Cel → Ustawienia → Bazy wiedzy zaznacz bazy, które mają być dostępne dla agentów tego celu.
Włącz umiejętność wiedzy w węźle workflow
Otwórz węzeł w edytorze workflow i dodaj mu umiejętność sięgania po bazy wiedzy. Dopiero wtedy w panelu węzła pojawia się lista baz.
Zostaw wybór pusty albo zawęź go świadomie
Węzeł bez zaznaczonej żadnej bazy dziedziczy wszystkie bazy celu. Zaznaczenie konkretnych baz zawęża węzeł do nich. Węzeł nigdy nie dostanie bazy, której nie ma cel — na jego liście pojawiają się wyłącznie bazy dołączone do celu.
Jeśli ostatnia synchronizacja dołączonej bazy się nie powiodła, panel ostrzega przy niej wprost, że model dostanie nieaktualne dane.
Limity pakietów
| Pakiet | Bazy wiedzy |
|---|---|
| Free | Bazy domyślne tylko do odczytu. Bez własnych źródeł i bez synchronizacji. |
| Pro | Do 10 źródeł i 20 000 wpisów. |
| Scale | Do 30 źródeł i 200 000 wpisów. |
Limit wpisów jest też dziennym limitem indeksowania: tyle wpisów może w ciągu doby przejść przez embedding.