Bazy wiedzy

Udostępnij agentom zewnętrzne dane i podłącz je do celu.

Z bazy wiedzy model korzysta w trakcie pisania: sięga po publikacje naukowe, hasła encyklopedyczne albo twój własny katalog, na przykład oferty, wydarzenia, nagrania. Bazy wiedzy znajdziesz w Biblioteka → Bazy wiedzy.

Bazy wiedzy nie tworzą artykułów ani klastrów. Nic z nich nie trafia do Strumienia i nic nie przechodzi przez filtr trafności — służą wyłącznie do wzbogacania powstającego tekstu.

Bazy, które masz od początku

Każde konto dostaje przy rejestracji dwie bazy domyślne:

  • PubMed — abstrakty recenzowanych publikacji z bazy NCBI. Domyślnie przeszukuje ostatnie 365 dni i zwraca do 20 wyników.
  • Wikipedia (pl) — hasła polskiej Wikipedii: definicje, tło pojęć i kontekst historyczny.

Obie działają w trybie na żywo: pytamy zewnętrzne API dopiero wtedy, gdy model o coś zapyta. Nic nie jest u nas przechowywane i nic nie kosztuje, dopóki nie zostaną użyte. Dlatego są dostępne na każdym pakiecie.

Tryb na żywo i tryb indeksowany

Na żywoIndeksowany
Kiedy pytamy źródłow chwili wywołania przez modelwedług harmonogramu, z góry
Gdzie leżą danenigdzie — odpowiedź jest jednorazowaw SemanticHubie, jako wpisy z embeddingami
Wyszukiwanietakie, jakie daje cudze APIsemantyczne, po podobieństwie treści
Koszttylko przy użyciuza każdy nowy i zmieniony wpis

Bazy domyślne działają na żywo. Baza, którą dodasz sam, jest indeksowana: pobieramy z niej wpisy, rozpoznajemy je po identyfikatorze i skrócie treści, a embedding liczymy wyłącznie dla wpisów nowych i zmienionych. Wpis, który się nie zmienił, nie kosztuje nic.

Dodaj własne API

Potrzebujesz publicznie dostępnego adresu, który na żądanie GET zwraca listę obiektów w JSON. Adresy w sieci lokalnej są odrzucane.

Nazwij bazę i opisz, do czego służy

Nazwa i opis trafiają do modelu — to jedyna wskazówka, po której wie, kiedy po tę bazę sięgnąć. Napisz ją tak, jak wyjaśniłbyś koledze, co w tej bazie jest.

Podaj adres i sposób uwierzytelnienia

Do wyboru: Brak, Token Bearer, Nagłówek i Parametr adresu. Przy nagłówku i parametrze podajesz własną nazwę, pod którą wyślemy token. Token zapisujemy zaszyfrowany i nigdy nie wraca w odpowiedzi API — później widzisz tylko, że jest ustawiony.

Wskaż listę i zmapuj pola

W Ścieżce do listy podaj miejsce, w którym leży tablica wpisów (na przykład data.items); zostaw puste, gdy API zwraca gołą listę. Następnie wskaż ścieżki do pięciu pól: Identyfikator, Tytuł, Treść, Adres wpisu i Data.

Identyfikator musi być stały — po nim rozpoznajemy, że to ten sam wpis. Treść trafia do embeddingu i do modelu, więc wpis bez treści jest pomijany. Adres wpisu jest potrzebny, żeby agent mógł podać go jako źródło. Pusty tytuł zastąpimy pierwszą linią treści.

Sprawdź połączenie

Sprawdź połączenie pokazuje obok siebie surową odpowiedź źródła i wpisy, które z niej wyszły. Bez tego kroku nie da się zapisać bazy: przycisk zapisu pozostaje nieaktywny, dopóki podgląd nie zwróci przynajmniej jednego wpisu. Mapowanie na ślepo zawodzi dopiero przy pierwszej nocnej synchronizacji.

Ustal harmonogram i retencję

Synchronizuj co: tylko ręcznie, 1 h, 6 h albo 24 h. Usuwaj wpisy starsze niż: nigdy, 30, 90 albo 365 dni — liczone od pierwszego zobaczenia wpisu.

Synchronizacja i przeglądanie wpisów

Ekran bazy pokazuje stan ostatniego przebiegu, zapełnienie limitu pakietu i zaindeksowany korpus z wyszukiwarką — dzięki temu na pytanie „czemu model tego nie znalazł" odpowiadasz zajrzeniem do wpisów, a nie zgadywaniem. Przycisk obok nazwy zależy od stanu: Synchronizuj teraz, Spróbuj ponownie, Wznów, Przerwij albo Zobacz pominięte. W trakcie przebiegu widać numer strony oraz liczbę wpisów nowych, zmienionych i pominiętych. Przebieg pojawia się też w Kolejce jako zadanie synchronizacji bazy wiedzy, ale nie wchodzi w jej kolejność — nie opóźnia pisania tekstów.

Stany synchronizacji:

StanCo oznacza
Gotowa do użyciaStan bazy działającej na żywo — nie ma czego synchronizować.
Jeszcze nie synchronizowanoBaza istnieje, ale nie było jeszcze żadnego przebiegu.
Synchronizacja w tokuPrzebieg trwa.
ZsynchronizowanoOstatni przebieg zakończył się w całości.
Zsynchronizowano, część wpisów pominiętoPrzebieg się udał, ale części wpisów nie dało się zmapować.
Synchronizacja nie powiodła sięOstatni przebieg zakończył się błędem.
Automatyczna synchronizacja wstrzymana po 3 błędachTrzy nieudane przebiegi z rzędu. Automat przestaje odpytywać źródło.
Limit wpisów w pakiecie osiągniętyZaindeksowane wpisy zostają; zatrzymały się tylko nowe.

Dodanie bazy to za mało — trzeba ją dołączyć

To najczęstsze nieporozumienie. Baza w Bibliotece jest tylko twoim katalogiem. Dopiero dołączenie daje do niej dostęp — na liście baza bez dołączeń jest opisana wprost jako niewidoczna dla modelu.

Dołącz bazę do celu

W Cel → Ustawienia → Bazy wiedzy zaznacz bazy, które mają być dostępne dla agentów tego celu.

Włącz umiejętność wiedzy w węźle workflow

Otwórz węzeł w edytorze workflow i dodaj mu umiejętność sięgania po bazy wiedzy. Dopiero wtedy w panelu węzła pojawia się lista baz.

Zostaw wybór pusty albo zawęź go świadomie

Węzeł bez zaznaczonej żadnej bazy dziedziczy wszystkie bazy celu. Zaznaczenie konkretnych baz zawęża węzeł do nich. Węzeł nigdy nie dostanie bazy, której nie ma cel — na jego liście pojawiają się wyłącznie bazy dołączone do celu.

Jeśli ostatnia synchronizacja dołączonej bazy się nie powiodła, panel ostrzega przy niej wprost, że model dostanie nieaktualne dane.

Limity pakietów

PakietBazy wiedzy
FreeBazy domyślne tylko do odczytu. Bez własnych źródeł i bez synchronizacji.
ProDo 10 źródeł i 20 000 wpisów.
ScaleDo 30 źródeł i 200 000 wpisów.

Limit wpisów jest też dziennym limitem indeksowania: tyle wpisów może w ciągu doby przejść przez embedding.

Wszystkie strony