Informacje dla wydawców

SemanticHubBot

SemanticHubBot to crawler serwisu SemanticHub. Pobiera artykuły z serwisów wskazanych przez naszych użytkowników, grupuje je tematycznie i pokazuje redakcjom jako źródła z odnośnikiem do oryginału.

User-Agent
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; SemanticHubBot/1.0; +https://semantichub.app/bot) Chrome/140.0 Safari/537.36
Token w robots.txt
SemanticHubBot
Adresy IP
185.193.113.24783.243.37.22
robots.txt
Respektowany zgodnie z RFC 9309
Sygnały użycia treści
Content-Signal, AIPREF, TDMRep
Sprawdzanie sygnałów
Codziennie

1. Co robi SemanticHubBot

Bot odwiedza wyłącznie serwisy, które użytkownicy SemanticHub dodali jako źródła. Pobiera nowe artykuły, a redakcje widzą je pogrupowane tematycznie, zawsze z odnośnikiem do oryginału.

Każde żądanie przedstawia się nagłówkiem Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; SemanticHubBot/1.0; +https://semantichub.app/bot) Chrome/140.0 Safari/537.36. Nagłówek ma format Googlebota: zaczyna się jak nagłówek przeglądarki, bo część zapór WAF zrywa połączenie z każdym innym klientem. W środku zawsze jest token SemanticHubBot i adres tej strony, więc bot nie ukrywa, kim jest.

W robots.txt i w regułach zapory rozpoznawaj nas po tokenie SemanticHubBot, a nie po całym nagłówku.

2. Czego nie robimy

  • Nie trenujemy modeli językowych na pobranych tekstach.
  • Nie udostępniamy pobranych tekstów dalej jako zbioru danych.
  • Nie omijamy paywalli ani logowania.

3. Dlaczego warto nas wpuścić

Każdy artykuł pokazujemy redakcjom z odnośnikiem do oryginału. Materiały, które nasi użytkownicy publikują u siebie, mogą zawierać linki do źródeł. To ruch z odesłań i linki zwrotne, które wspierają SEO Twojego serwisu.

Wspiera to także GEO, czyli widoczność w odpowiedziach narzędzi AI. Treść cytowana z podaniem źródła może trafić do takich odpowiedzi razem z odnośnikiem do Twojego serwisu.

Dlatego zachęcamy do dopuszczenia SemanticHubBota w WAF-ie lub w systemie zarządzania botami. Adresy do listy dozwolonych podajemy w sekcji Jak rozpoznać prawdziwego SemanticHubBota.

4. Jak rozpoznać prawdziwego SemanticHubBota

SemanticHubBot pobiera treści wyłącznie z adresów 185.193.113.247, 83.243.37.22. Aktualna lista adresów w formacie maszynowym, takim samym jak listy Googlebota, jest pod /semantichubbot.json.

Żądanie z naszym User-Agentem, które przychodzi z innego adresu, nie pochodzi od nas i możesz je zablokować.

5. Jak nas zablokować

Respektujemy robots.txt zgodnie z RFC 9309. Żeby całkowicie wyłączyć nasz dostęp, dodaj do pliku /robots.txt:

User-agent: SemanticHubBot
Disallow: /

6. Sygnały użycia treści

Możesz zezwolić na pobieranie i jednocześnie zastrzec samo wykorzystanie treści. Czytamy w tym celu trzy rodzaje sygnałów:

SygnałGdzie go umieścić
Content-SignalDeklaracja w robots.txt, np. ai-input=no, ai-train=no
IETF AIPREFDeklaracja Content-Usage w robots.txt, np. train-ai=n
W3C TDMRepPlik /.well-known/tdmrep.json, nagłówek TDM-Reservation albo znacznik <meta name="tdm-reservation" content="1">

Przykład w robots.txt:

User-agent: SemanticHubBot
Content-Signal: ai-input=no, ai-train=no
Allow: /

7. Jak często sprawdzamy

Sygnały zgody sprawdzamy codziennie dla serwisów używanych aktywnie i zapisujemy każdą zmianę wraz z datą. Zmiana w robots.txt jest u nas widoczna najpóźniej następnego dnia.

8. Kontakt

Pytania i zgłoszenia przyjmujemy przez formularz kontaktowy.