Informacje dla wydawców
SemanticHubBot
SemanticHubBot to crawler serwisu SemanticHub. Pobiera artykuły z serwisów wskazanych przez naszych użytkowników, grupuje je tematycznie i pokazuje redakcjom jako źródła z odnośnikiem do oryginału.
- User-Agent
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; SemanticHubBot/1.0; +https://semantichub.app/bot) Chrome/140.0 Safari/537.36- Token w robots.txt
SemanticHubBot- Adresy IP
185.193.113.24783.243.37.22- robots.txt
- Respektowany zgodnie z RFC 9309
- Sygnały użycia treści
- Content-Signal, AIPREF, TDMRep
- Sprawdzanie sygnałów
- Codziennie
1. Co robi SemanticHubBot
Bot odwiedza wyłącznie serwisy, które użytkownicy SemanticHub dodali jako źródła. Pobiera nowe artykuły, a redakcje widzą je pogrupowane tematycznie, zawsze z odnośnikiem do oryginału.
Każde żądanie przedstawia się nagłówkiem Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; SemanticHubBot/1.0; +https://semantichub.app/bot) Chrome/140.0 Safari/537.36. Nagłówek ma format Googlebota: zaczyna się jak nagłówek przeglądarki, bo część zapór WAF zrywa połączenie z każdym innym klientem. W środku zawsze jest token SemanticHubBot i adres tej strony, więc bot nie ukrywa, kim jest.
W robots.txt i w regułach zapory rozpoznawaj nas po tokenie SemanticHubBot, a nie po całym nagłówku.
2. Czego nie robimy
- Nie trenujemy modeli językowych na pobranych tekstach.
- Nie udostępniamy pobranych tekstów dalej jako zbioru danych.
- Nie omijamy paywalli ani logowania.
3. Dlaczego warto nas wpuścić
Każdy artykuł pokazujemy redakcjom z odnośnikiem do oryginału. Materiały, które nasi użytkownicy publikują u siebie, mogą zawierać linki do źródeł. To ruch z odesłań i linki zwrotne, które wspierają SEO Twojego serwisu.
Wspiera to także GEO, czyli widoczność w odpowiedziach narzędzi AI. Treść cytowana z podaniem źródła może trafić do takich odpowiedzi razem z odnośnikiem do Twojego serwisu.
Dlatego zachęcamy do dopuszczenia SemanticHubBota w WAF-ie lub w systemie zarządzania botami. Adresy do listy dozwolonych podajemy w sekcji Jak rozpoznać prawdziwego SemanticHubBota.
4. Jak rozpoznać prawdziwego SemanticHubBota
SemanticHubBot pobiera treści wyłącznie z adresów 185.193.113.247, 83.243.37.22. Aktualna lista adresów w formacie maszynowym, takim samym jak listy Googlebota, jest pod /semantichubbot.json.
Żądanie z naszym User-Agentem, które przychodzi z innego adresu, nie pochodzi od nas i możesz je zablokować.
5. Jak nas zablokować
Respektujemy robots.txt zgodnie z RFC 9309. Żeby całkowicie wyłączyć nasz dostęp, dodaj do pliku /robots.txt:
User-agent: SemanticHubBot
Disallow: /6. Sygnały użycia treści
Możesz zezwolić na pobieranie i jednocześnie zastrzec samo wykorzystanie treści. Czytamy w tym celu trzy rodzaje sygnałów:
| Sygnał | Gdzie go umieścić |
|---|---|
Content-Signal | Deklaracja w robots.txt, np. ai-input=no, ai-train=no |
| IETF AIPREF | Deklaracja Content-Usage w robots.txt, np. train-ai=n |
| W3C TDMRep | Plik /.well-known/tdmrep.json, nagłówek TDM-Reservation albo znacznik <meta name="tdm-reservation" content="1"> |
Przykład w robots.txt:
User-agent: SemanticHubBot
Content-Signal: ai-input=no, ai-train=no
Allow: /7. Jak często sprawdzamy
Sygnały zgody sprawdzamy codziennie dla serwisów używanych aktywnie i zapisujemy każdą zmianę wraz z datą. Zmiana w robots.txt jest u nas widoczna najpóźniej następnego dnia.
8. Kontakt
Pytania i zgłoszenia przyjmujemy przez formularz kontaktowy.