Bad Bots blocken oder nicht?

GrumpyCat schrieb:
Bei meinen Servern würden solche Requests niedriger priorisiert werden als eingeloggte Benutzer
Ich betreibe keine Websites mit LogIn. Bei mir ist alles blank veröffentlicht. Noch nicht einmal ein Cookie Consent, da cookieless.

WulfmanGER schrieb:
Lieblings UA von AI-Bots ist übrigens Safari ... also der Client-Safari-UA.
Ja, das ist mir auch schon aufgefallen. Zusammen mit Chrome.
WulfmanGER schrieb:
Und das ist halt das schlimme bei AI-Bots - die Masse in der sie aufschlagen und nicht mehr gehen (siehe mein Post auf Seite 2). Oder setzt sich das Plugin wo anders hin?
Ja, die Masse ist - mittlerweile - einerseits das Krasse daran geworden, aber durch die Masse sind diese Bots erkennbar.
Es kommt drauf an was du willst. Willst du nur ein sauberes Tracking (Tracking blocken), oder willst du einen sauberen Traffic (Content blocken)? Die Filterregeln, die das Matomo Plugin verwendet, können auch per PHP verwendet werden, um den Traffic zu blocken.
WulfmanGER schrieb:
(mein Hoster wo Matomo liegt, gibt dann aus das die Domain nicht aktiv ist - toll) - Traffic gab es immer noch. Erst als ich den DNS-Eintrag für die Domain gekickt hatte, hörte es auf (logisch).
Ja, beim Blocken muss am besten 0 kb als Antwort gesendet werden. Aber schon der Request an sich und der Abruf des SSL Certs ist Traffic. Das sind zwar nur wenige kb, aber es summiert sich massiv.

Mit Löschung des DNS läuft alles ins Leere. Da antworten dann irgendwelche Internetknoten, dass zur Domain keine IP hinterlegt ist. Das ist dann nur Traffic irgendwo in der Internet-Peripherie.

Zum Blocken von Bad Bots im Traffic musst du ein bisschen PHP können. Dann musst du dir die Free IP to ASN Database (mmdb) besorgen (monatlich) und die mit PHP in deine Website einbauen, so dass du per Request-IP und ASN Name blocken kannst. Dann die IP-CIDR-Listen der 5 Big Cloud Anbieter (JSON, CSV) und von OpenAI (JSON) besorgen (monatlich) und (am besten mit Python) in mmdb Datenbanken konvertieren und ebenso mit der Request-IP nutzen.

Dann verschiedene eigene Regeln mit PHP erstellen. Dazu vorher (Wochen, Monate) bei jedem Request per PHP die Daten aus getallheaders() in ein File loggen, sowie für eine Lite-Version zur Übersicht die UserAgenten plus Request-Daten (Date, Time, IP, Domain/URL) in ein File loggen. Diese stetig kontrollieren und nach Mustern suchen. Mittels den Mustern mit PHP Block-Regeln erstellen. Informieren, welche Browser welche Header senden, sowie was jeweils derzeit "normal" und "current" ist.

Veraltete Browser-Versionen blocken. Dazu hab ich noch ein paar Fragen und werde dafür einen neuen Topic aufmachen. Viele sind hier schon abgesprungen. Es ist alles so schnelllebig geworden.
 
Ersten Schätzungen nach werden rund 80 % an Traffic geblockt bei ungefähr gleichbleibend viel Website-Besuchern und inklusive Good Bots.

Hardcore-Freaks werden jetzt behaupten, dass ich immernoch 90 % Bad-Bot Traffic habe.
 
Zuletzt bearbeitet:
Ältere Browser blocken ist demnach weniger das Problem, da zu 99 % Bots. Schwieriger wird es mit Bots, die current User Agents verwenden und zudem random IPs von herkömmlichen Internet-Providern. Da es auch Human gibt, die sich wie Bots verhalten (mit Unterstützung von Addons wie User Agent Switcher, VPN, IP Switcher, ...), wird es extrem schwer. Da ist wohl nichts zu machen. Es sind zum Glück nicht so viele.

Das bisherige Ergebnis: 80 weniger Traffic bei ungefähr gleichbleibend viel Besuchern und ein saubereres Tracking.
 
6 weitere ASN Firmennamen auf der Blacklist.

Einige machen es einem etwas schwer. Sie schreiben nicht eindeutig, dass sie Provider sind, sondern ... es ist komplex. Sie bieten an, den gesamten Internetverkehr über eine (nicht eigene) Cloud laufen zu lassen. Da gibt es wiederum Provider, die exakt das anbieten, und mit denen diese ASN Firmen zusammenarbeiten. Die ASN Firmen bieten zudem eigene KI Modelle an, die sie selbst trainieren. Klar, kannste machen, aber dann biste halt blacklisted. Wenn deine Kunden dann fragen: Hey, wieso erreiche ich die Website nicht übers Firmennetzwerk, aber über mein privates Handy? Kannste antworten: Wir haben Bockmist gebaut, weil wir hätten unsere Bad Bots sauber von allem anderen trennen sollen ... jetzt sind alle Firmen-IPs blacklistet.
 
Das hier ist so ein Kandidat: https://ghostnet.de/dienstleistungen/
Wenn diese selbst oder andere Firmen bei diesen Bad Bots betreiben, habe sie ihr Geschäftsmodell vermasselt.
Sorry, aber ich habe keine Lust mehr diesen KI-Wahnsinn mit meinem Content zu supporten. Das ist vollkommen aus dem Ruder gelaufen. Da helfen nur noch harte Maßnahmen, die vielen nicht gefallen werden.

Bedankt euch bei den Firmen. Ich habe keinerlei Verpflichtung meinen Content für alles bereitzustellen. Das klingt hier aber bei einigen so, dass ich irgendwelche Verpflichtungen hätte. Dass es mir verboten sei Requests zu blocken. Dass es mir verboten sei meinen Content vor unerlaubter Nutzung zu schützen. Und von was träumt ihr Nachts?
 
Niemand weiß, was du uns überhaupt vorenthalten willst. Und bisher war jeder einzelne deiner Threads zu deiner niemals genannten Webseiten immer nur darüber, dass alle anderen verpflichtet sind, sie in einer ganz bestimmten Art und Weise zu benutzen.
 
  • Gefällt mir
Reaktionen: dasBaum_CH
Mirlo schrieb:
Das hier ist so ein Kandidat: https://ghostnet.de/dienstleistungen/
Wenn diese selbst oder andere Firmen bei diesen Bad Bots betreiben, habe sie ihr Geschäftsmodell vermasselt.
Sorry, aber ich habe keine Lust mehr diesen KI-Wahnsinn mit meinem Content zu supporten. Das ist vollkommen aus dem Ruder gelaufen. Da helfen nur noch harte Maßnahmen, die vielen nicht gefallen werden.
Du hast ein eigenes AS?
 
Ein weiterer dubioser Kandidat: KeFF Networks Ltd
https://scamalytics.com/ip/193.189.100.201
Bei dieser Firma sind demnach nicht alle IPs betroffen. Da müsste wenn dann (← lies!) über die IP geblockt werden.

Es gibt eine IPtoProxy Database: https://www.ip2proxy.com/
Die gibt es aber nicht umsonst.
Beispiel: 193.189.100.201
JSON:
    "is_proxy": true,
    "fraud_score": 99,
    "proxy": {
        "last_seen": 1,
        "proxy_type": "TOR",
        "threat": "SPAM/SCANNER",
        "provider": "Tor",
        "is_vpn": false,
        "is_tor": true,
        "is_data_center": false,
        "is_public_proxy": false,
        "is_web_proxy": false,
        "is_web_crawler": false,
        "is_ai_crawler": false,
        "is_residential_proxy": false,
        "is_consumer_privacy_network": false,
        "is_enterprise_private_network": false,
        "is_spammer": false,
        "is_scanner": true,
        "is_botnet": false,
        "is_bogon": false
    }
Damit könnte dann sehr spezifisch geblockt werden. Vermutlich machen das Webmaster größerer Websites bereits.
PS: Wer jetzt hauptschulemäßig denkt: "Tor blocken is assi!" ist ein Honk, weils nirgends geschrieben wurde. Computer einschalten heißt nicht Hirn ausschalten.
 
Mirlo schrieb:
Da helfen nur noch harte Maßnahmen, die vielen nicht gefallen werden.
Und dennoch bleibt es ein Kampf gegen Windmühlen. Es wird die Zeit kommen, wo du Bottraffic nicht mehr von echten Usern unterscheiden kannst.
Mirlo schrieb:
Ich habe keinerlei Verpflichtung meinen Content für alles bereitzustellen.
Paywalls existieren. Solange du Content frei zugänglich machst, wirst du damit leben müssen, dass sich jeder daran bedient. Traurig, aber nicht zu ändern.
 
Evil E-Lex schrieb:
Und dennoch bleibt es ein Kampf gegen Windmühlen.
An Don Quichotte mussste ich aber auch gerade denken. :schluck:

Dennoch finde ich @Mirlo s Hartnäckigkeit bewundernswert und finde das hier ein äußerst interessantes und spannendes Thema.
 
Evil E-Lex schrieb:
Es wird die Zeit kommen, wo du Bottraffic nicht mehr von echten Usern unterscheiden kannst.
Die Zeit hat schon vor vielen Jahren begonnen. Sie sind mehr geworden, aber insgesamt noch wenige. Der Grund dafür liegt eventuell am Preis, die diese Superbad-Bots kosten. Die zwar aufwendig, aber erkennbaren Bad Bots gibts scheinbar sehr günstig.

Es sind auch und werden stetig mehr, die Bad Bots blocken. Die meisten reden nur nicht darüber. Sogar Webhoster blocken bereits, wegen dem Traffic, den sie bezahlen müssen. Ich unterstütze meine Webhoster jetzt, indem ich blocke: rund 80 % weniger Traffic.

Es redet eventuell auch keiner darüber, weil es scheinbar keine pauschale Lösung gibt, bzw. die pauschalen Lösungen nicht viel taugen. Der eigene Traffic muss analysiert werden, um individuelle Block-Filter zu erstellen.

Simples Beispiel: Wenn auf deiner Website die Page mit dem URL-Path '/impress' requested wird, aber du keine Page mit dem URL-Path '/impress' hast, der - neben vielen anderen - sehr gerne von Bad Bots requested wird, kannst du ihn in eine Blacklist aufnehmen und damit einen Block-Filter erstellen. Diese Request dann mit 0 kb beantworten, anstatt mit einer (eigenen) 404 Page. Die (eigene) 404 Page abschalten und nur den 404 Header senden ist nicht zu empfehlen, da es aus analysetechnischer Sicht ratsam ist die 404 Page zu tracken.

Solche individuellen Block-Regeln können auch von Firmen genutzt werden, da sie dabei entscheiden, was geblockt wird und somit das Risiko selbst abschätzen können.
 
foofoobar schrieb:
Klingt ziemlich wirr
Du hast es immer noch nicht kapiert? Dann wird das wohl auch nichts mehr. Es geht die ganze Zeit lang nur darum Bad Bots keinen(!) Content zu liefern, also exakt 0 kb.

Das ist gar nicht so einfach zu realiseren, weil der Server vorgefertigte HTML-Pages für HTTP-Status-Codes ausliefert. Da muss ich mal gucken ob das bei Webhost deaktiviert werden kann.

Zudem steht Server 404 (htaccess) und PHP Bad Bot Blocking in Konflikt. Wenn es also keine Page zur URL gibt, dann eigentlich am besten eine eigene 404 (mit Link zur Startpage), die getrackt wird, damit falsch verteilte URLs sichtbar werden und bei größeren Besuchermengen zum Content redirected werden kann. Es gibt sie weiterhin, die DAUs, die zu dumm sind eine Internet-Adresse aus der Adresszeile des Browsers ohne Änderungen in einem Forum oder dergleichen zu posten. Da haste auf einmal einen Peak, aber alles 404, und bei massig Zero-Klicker massig Bouncing.

Bad Bots sollen aber bei falschen URLs kein 404 bekommen, sondern am besten gar nichts, 0, Null. Wenn der Server aber schon ein 404 Header sendet und den Request damit beendet, dann kann dieser Header nicht im PHP Code gegen einen anderen ausgetauscht werden. Gesendet ist gesendet.

Das Ziel ist 0 kb bei Bad-Bot-Requests ausliefern. Wegen Header und SSL-Certs ist das gar nicht drin, also ist das Ziel so wenig wie möglich Kilobits.

Schau einfach mal in dein Server access log. Da siehst du alle Request und unsagbar massenweise Requests zu nicht existierenden URLs, insbesondere wenn du kein Wordpress verwendest. Schaus dir einfach an. Es ist der absolute Wahnsinn, wie diese Bad Bots die Server vollkommen sinnlos mit Requests zubomben.

oder schau dir diese Statistik an: https://de.statista.com/infografik/27498/anteil-des-durch-bots-verursachten-webtraffics/
 
Zurück
Oben