Bad Bots blocken oder nicht?

Starr aufgrund von IPs/ASNs oder User Agent blocken ist doch Unsinn. Ersteres sagt nichts aus bzw. blockt auch viele legitime Zugriffe, zweiteres ist so, als würde man alle Einbrecher ins Haus lassen, die auf die Frage "Bist du ein Einbrecher?" mit "Nein" antworten.

Was noch ganz gut geht, IP-Blocking per Honeypot (geht mit fail2ban relativ simpel) oder einfach sonstwie verhaltensbasiert (z.B. bei einem Forum "mehr als 60 unterschiedliche Threads pro Minute abgerufen => IP für 24h blocken"). Aber da sind die Admins erfahrungsgemäß schnell mit den Regeln überfordert...
 
  • Gefällt mir
Reaktionen: dasBaum_CH
GrumpyCat schrieb:
Starr aufgrund von IPs/ASNs ... blocken ist doch Unsinn.
Macht Matomo mittlerweile auch: https://github.com/matomo-org/plugin-TrackingSpamPrevention/blob/5.x-dev/Configuration.php

Es ist sehr effektiv. Es gab aber auch schon einen False-positive: https://github.com/matomo-org/plugin-TrackingSpamPrevention/issues/165

Es ist also durchaus sensibel und sollte nicht für jeden Fall genutzt werden, sondern nur wenn eindeutig. Außer man will auch solche Bots blocken. Es ist auf jeden Fall effektiver als über CIDR-Listen zu blocken. Anders gesehen: Wenn die Firmen nicht-erkennbare Bots betreiben oder deren Betreiben zulassen: Pech gehabt - Alle Firmen-IPs verzockt. Wenn es eine Firmenwebsite ist, ist das Risiko einzuschätzen.

Es ist davon auszugehen, dass Anubis und Cloudflare das auch so machen.

GrumpyCat schrieb:
Was noch ganz gut geht, IP-Blocking per Honeypot
Das ist auch eine effektive Methode um Bots aufzuspüren. Bei mir sind es unter anderem Domainnamen mit Hyphen, die als nicht-canonical in Verwendung sind. Also canonical sind die Domainnamen ohne Hyphen. Aber auch das ist keine pauschale Lösung. Es muss jedesmal überprüft werden, und wenn ein Bot, dann über Headers Rules, UserAgent Patterns oder ASN Name blocken.

GrumpyCat schrieb:
Starr aufgrund von IPs/ASNs oder User Agent blocken ist doch Unsinn.
So gesehen ja, denn es muss jedesmal exakt abgewogen werden, ob über diese Methoden geblockt wird, bzw. werden kann. Das trifft nicht immer zu. Zudem kommt es nur selten vor, dass per kompletten UserAgent mittels equal Rule (==) geblockt werden kann. Meist sind es Keywords und/oder Muster in UserAgents sowie Headers.

Bei ASN-Blocking muss u. a. aufgepasst werden, dass keine VPN-User geblockt werden.

Rate Limit
Das ist eine verlockende Methode. Bei mindestens einer meiner Websites kommt dies jedoch nicht in Frage. Da dürfen User sehr schnell durchklicken. Bisheriger Rekord: 5 Page-Requests in 1 Second. Das sind dann aber meist keine fresh requests, sondern via Browser/Android-Navigation Back-Button. Dabei wird der Content aus dem Cache geladen und der Server registriert nur einen Request, was immens schneller ist als fresh Requests mit content load.
Um bei der Website ein Rate Limit einzubauen, müssten die Requests in eine Datenbank gespeichert und mittels dieser nach Mustern ((fresh_request === true) && (recurring_visit === false) && (last_visit_time < current_visit_time)) geblockt werden. Das ist zu aufwendig.

Gesetz
Der Counterpart von einem Gesetz zur Pflicht Bots erkenntlich zu machen wäre, dass Nicht-Bots sich erkenntlich machen und Bots diese Methode nicht verwenden dürfen. Aber auch das ist keine optimale Lösung.
 
Mirlo schrieb:
Macht Matomo mittlerweile auch
Klar machen viele Produkte unsinniges Zeugs, schon alleine weil die Leute danach fragen.
Mirlo schrieb:
Es ist sehr effektiv. Es gab aber auch schon einen False-positive
Wenn jemand z.B. seinen eigenen VPN-Server bei AWS betreiben will, wieso sollte ich ihn davon abhalten?
Oder frag mal Freifunk-Leute, was die von IP-Blocking halten.

Mirlo schrieb:
Es ist davon auszugehen, dass Anubis und Cloudflare das auch so machen.
Das sind beides aus unterschiedlichen Gründen Schrottlösungen. Zu Anubis habe ich oben schon einen Link gepostet; Cloudflare ist eine proprietäre nervige unberechenbare viele Sachen kaputtmachende "Lösung", die schon nur als CDN fraglich ist (z.B. ist Akamai als Alternative älter, größer, weniger nervig).
Mirlo schrieb:
Rate Limit
Das ist eine verlockende Methode. Bei mindestens einer meiner Websites kommt dies jedoch nicht in Frage. Da dürfen User sehr schnell durchklicken. Bisheriger Rekord: 5 Page-Requests in 1 Second.
Ich schrieb "Admins schnell mit den Regeln überfordert" und "Mehr als 60 Threads in 60 Sekunden". Regeln pro Request (allgemein) oder pro Sekunde aufzustellen macht keinen Sinn. Ist aber offensichtlich zu komplex. :)

U.a. deswegen auch mein Hinweis von vorher, das alles das eigentlich in die jeweilige Website-Software eingebaut werden müsste; auch nur die weiß auch (sicher), ob der Request z.B. von einem authentifizierten Benutzer kommt oder nicht.
 
  • Gefällt mir
Reaktionen: andy_m4
GrumpyCat schrieb:
Wenn jemand z.B. seinen eigenen VPN-Server bei AWS betreiben will, wieso sollte ich ihn davon abhalten?
Das wäre dann der Bot-War. Wenn AWS das Betreiben von nicht erkennbaren Bots erlaubt, dann hat AWS Pech gehabt und ist blacklistet, komplett. Die User suchen sich dann einen anderen Anbieter. Einfach mal die Machtverhältnisse umkehren. Bei Firmen-Websites ist das nicht ratsam. Bei vielen anderen schon.
GrumpyCat schrieb:
Ist aber offensichtlich zu komplex.
Ja, ist es. Es müssten alle Requests/Visits in einer Datenbank gespeichert werden, die dann fürs Filtern verwendet werden kann. Sehr aufwendig. Zumal das auch nur einen Teil der Bots blockt.
GrumpyCat schrieb:
das alles das eigentlich in die jeweilige Website-Software eingebaut werden müsste; auch nur die weiß auch (sicher), ob der Request z.B. von einem authentifizierten Benutzer kommt oder nicht.
Was heißt hier "authentifizierter Benutzer"? Bisher geht es hauptsächlich darum Bots zu erkennen und nicht darum Humans zu erkennen. Wenn ein Human wie ein Bot wirkt, dann Kollateralschaden. Wenn ein Bot wie ein Human wirkt, dann Lücke.

Das läuft dann auf das bereits erwähnte "Beschleunigen" der Sache hinaus, dass dadurch Bot-Betreiber immer mehr darum bemüht werden ihre Bots wie Humans wirken zu lassen. In diesem War werden massenweise IP CIDR-Blöcke per ASN Firmennamen komplett blacklistet und sind verloren.

Anders sieht es aus bei Cloud-Anbieter, die von starken Firmen genutzt werden, wie Akamai von Apple für das iCloud Private Relay (ähnlich VPN). Die können nicht blacklistet werden, weil dann alle Apple-Nutzer geblockt werden.

Bei reinen VPN-Anbietern, die keine Bots und erst recht keine nicht-erkennbaren Bots betreiben, besteht kein Anlass zum Blocken.

Es ist zudem zu beachten, dass wenn rein per PHP geblockt wird, nur der Website-Content geblockt wird. Alles andere, wie Image Requests, wird dabei nicht geblockt, insoweit (direct view) nicht per .htaccess geblockt ([F] = Forbidden). Geblockt werden allerdings auch Requests von nicht existierenden URLs, wenn eine eigene 404 Page besteht und das Blocken darin inkludiert ist. Damit werden dann auch Security-Bots geblockt, die das Internet auf Websites mit Schwachstellen durch-crawlen. Die zB alle Domains mit Wordpress-Urls requesten, auch wenn keines installiert ist.

Bei diesem komplett Blocken wird nicht zwischen Human und Bot, sondern zwischen Human / Good Bot und Bad Bot unterschieden. Bisher ist die Lösung dafür so, dass zuerst alle Bots geblockt und anschließend nur die Good Bots durchgelassen werden. Das kann auch als Bypass gestaltet werden.
 
Mirlo schrieb:
Es müssten alle Requests/Visits in einer Datenbank gespeichert werden, die dann fürs Filtern verwendet werden kann.
Nö, wozu? fail2ban schaut in die Logdateien und fertig. Kennst Du fail2ban nicht? Nicht dass das eine schöne oder wirklich ausgereifte Lösung wäre, aber es funktioniert.
Mirlo schrieb:
Was heißt hier "authentifizierter Benutzer"? Bisher geht es hauptsächlich darum Bots zu erkennen und nicht darum Humans zu erkennen.
Ist doch Unsinn. Wenn Dir Deine Benutzer was wert sind, müssen die 100%ig immer durchkommen, also gewhitelisted werden.
Und Bots können, solange der Server noch Kapazitäten hat, einfach durchgelassen werden. Hab ich ein paar Postings vorher beschrieben.
Das ganze Geraffel/Gehacke mit ASNs und Proof of Work (Anubis etc.) kann man sich dann sparen; beides bringt auch schlicht wenig, wenn's jemand ernst meint.
Mirlo schrieb:
Bei reinen VPN-Anbietern, die keine Bots und erst recht keine nicht-erkennbaren Bots betreiben, besteht kein Anlass zum Blocken.
Weil kein VPN-Kunde jemals Crawler betreibt oder wie?
 
Mirlo schrieb:
Wenn ein Human wie ein Bot wirkt, dann Kollateralschaden.
Darf man die URL Deiner Seite erfahren?
Dann setze ich die nämlich auf meine Blackliste, damit ich als Human Dich nicht versehentlich ansurfe.
 
GrumpyCat schrieb:
Kennst Du fail2ban nicht?
Nein. Es benötigt Server Logs. Bei den von mir verwendeten Webhostern werden diese default nicht angelegt, besteht kein Zugriff oder wurden von mir deaktiviert.
GrumpyCat schrieb:
Wenn Dir Deine Benutzer was wert sind, müssen die 100%ig immer durchkommen, also gewhitelisted werden.
Wieso müssen sie gewhitelisted werden, wenn sie gar nicht blockiert werden? Blockiert werden alle Bots und die Good Boots gewhitelisted.
GrumpyCat schrieb:
Und Bots können, solange der Server noch Kapazitäten hat, einfach durchgelassen werden.
Dann vertrittst du eine konträre Meinung, wenn du der Meinung bist, Bad Bots könnten durchgelassen werden.
GrumpyCat schrieb:
beides bringt auch schlicht wenig, wenn's jemand ernst meint.
Es gibt keine Lösung für
100 % Humans nicht blocken
100 % Good Bots nicht blocken
100 % Bad Bots blocken
Wer mit dieser Einstellung an die Sache heran geht hat von vornherein verloren. Wer 100 % aller Humans absolut sicher nicht blocken will, darf gar nicht blocken.
GrumpyCat schrieb:
Weil kein VPN-Kunde jemals Crawler betreibt oder wie?
Kann sich jeder selbst aussuchen. Wenn einer meint VPN und Crawler bei ein und derselben Firma zu nutzen, hat sich fürs Blocken entschieden.
andy_m4 schrieb:
Dann setze ich die nämlich auf meine Blackliste
Was sind denn das für primitive Sprüche. Nur weil du versehentlich geblockt werden könntest, was größtmöglich vermieden wird, soll gar nicht geblockt werden? Typische Nutznießer-Meinung. Sie wollen alles umsonst und sofort und geschenkt und Zero-Copyright und scheißen auf die Content-Creator und Webmaster ... Das ist ein Human, der sich wie ein Bad Bot verhält und geblockt wird. Du kannst es dir aussuchen. Falsche Entscheidung führt zum Blocken. Kein Bock auf solche Human Bots.

Alle anderen, die es versehentlich erwischt: Bedankt euch bei den Bad Bots Betreibern.

Webmaster entscheiden, wer den Content bekommt und wer nicht, und nicht die User. Schalt doch einfach dein Internet ab, dann wirst du nicht versehentlich geblockt und bist nicht darüber frustriert.
 
Mirlo schrieb:
Nur weil du versehentlich geblockt werden könntest, was größtmöglich vermieden wird, soll gar nicht geblockt werden?
Das hab ich so nicht gesagt.
Das Ding ist halt, diese AntiBot-Systeme halt häufig Menschen mit Behinderungen aussperren. Zum Beispiel weil die auf Assistenzsysteme angewiesen sind und die Verhalten sich dann eben nicht, wie es sogenannte "normale" Menschen tun.
Und dann diese Leute zu benachteiligen und das mit dem Wort Kollateralschaden abzutun, das ist fragwürdig.
Unglücklicherweise belässt Du es dabei nicht.

Mirlo schrieb:
Typische Nutznießer-Meinung. Sie wollen alles umsonst und sofort und geschenkt und Zero-Copyright und scheißen auf die Content-Creator und Webmaster ...
Diesen Menschen nicht nur zu sagen "Selbst schuld wenn Du Dich wie ein Bot verhältst. Pech wenn Du ausgesperrt wirst" dann auch noch hinterher zu rufen "Mit Schmarotzern will ich eh nichts zu tun haben" ist schon ziemlich eklig.

Mirlo schrieb:
Webmaster entscheiden, wer den Content bekommt und wer nicht,
Und Besucher suchen sich aus, welche Seite sie besuchen und welche nicht.
Wenn ich das aber sage, ist es Dir nicht recht.
Wirkt ein bisschen doppelmoralig.

Mirlo schrieb:
Schalt doch einfach dein Internet ab, dann wirst du nicht versehentlich geblockt und bist nicht darüber frustriert.
Bin nicht frustriert. Aber bei Dir merkt man das deutlich. ;-)
 
@andy_m4 , es bleibt dabei. Schuld an der Miseré sind ganz sicher nicht die Webmaster, die ihren Content vor den Bots schützen, sondern die Firmen, die nicht-erkennbare Bots auf ihren Systemen zulassen. Die Menschen mit Behinderungen sollen sich nicht bei den Webmastern beschweren, weil falsche Adresse, sondern bei den Firmen. Aber ist schon klar, alles soll auf die Webmaster abgewälzt werden. Diese sollen gefälligst den Dienstleister machen und alles und noch viel mehr für die User tun. Der User muss sich hingegen nur beschweren, bei den Webmastern. Blos nie bei den Firmen, die dafür verantwortlich sind.
Schieb die Schuld mal schön woanders hin. Hier ist die falsche Ahnnahmestelle für deine Beschwerden. Ich glaub es hakt. Jetzt sollen die Webmaster auch noch behindertenfeindlich sein ... Geht's noch?
Irgendwann reichts. Dann geht alles offline. Dann kannste zusehen wo du dich beschwerst. Pustekuchen.
 
Es funktioniert. ChatGPT meldet innerhalb einer Session, dass es keinen Zugriff auf eine Website hat, bei der das Blocking aktiv ist.
GrumpyCat schrieb:
Das ist irreführend bis falsch, wie LLM-Output es häufig ist.
ChatGPT macht default keinen direkten Requests aus der Session heraus, sondern greift auf bereits gecrawlte Daten in einer Datenbank zurück. Darauf beruft sich ChatGPT stetig aufs Neue. Aber es scheint Ausnahmen zu geben, oder es war ein Zufall, dass in der Session ein Request stattgefunden hat, als das Blocking deaktiviert wurde. Das funktioniert aber nicht immer und ChatGPT beruft sich stur darauf, keine direkten Requests zu machen. Wenn nichts in der Datenbank ist, dann keine Daten.

Das ist der UserAgent des Requests:
Code:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot

IP to ASN:
DP-IP: Microsoft Corporation
MaxMind: Microsoft Azure

Die IP steht allerdings nicht in den von OpenAI veröffentlichten IP-Listen:
https://developers.openai.com/api/docs/guides/ip-addresses
Sie steht auch nicht in der von Microsoft Azure veröffentlichen IP-Listen:
https://www.microsoft.com/en-us/download/details.aspx?id=56519
Es ist allerdings ein Good Bot, weil dieser sich mit "bot" im UserAgent zu erkennen gibt.
 
Mirlo schrieb:
Schieb die Schuld mal schön woanders hin.
Die EINZIG angemessene Reaktion wäre zu sagen:
"Sorry. Stimmt. Daran hab ich nicht gedacht. Meine Wortwahl war wohl vielleicht doch etwas daneben".
Es ist bezeichnend, das Du nicht mal das schaffst.

Mirlo schrieb:
Hier ist die falsche Ahnnahmestelle für deine Beschwerden.
Ich beschwere mich nicht. Ich hab lediglich Deine Aussagen kommentiert. Wenn Du nicht damit leben kannst, das Deine Aussagen kritisiert werden, solltest Du Dich nicht öffentlich äußern.

Ich bin ja bei Vielem durchaus bei Dir. Aber bei einigen Äußerungen halt nicht.
 
Lieber @andy_m4 , bitte unterlasse dein in diesem wie auch anderen Foren nicht geduldetes Argumentum ad hominem. Gaslighting wäre das nächste Thema, wenn du mir einreden willst, ich wäre ein schlechter Mensch.

Es wurde bereits erwähnt, dass es beim Blocken nicht ohne Kollateralschäden geht und das Blocken deshalb sehr sensibel abgewogen werden muss. Dass du den Begriff "Kollateralschäden" einseitig gegen mich benutzt und mir damit eine Behindertenfeindlichkeit unterjubeln willst ... das is so billig, das fliegt sofort auf und bermerkt jeder Leser selbst. Also lass es einfach. Begreife es als nett gemeinte Verwarnung. Das nächste mal wird gemeldet.

Du hättest einfach schreiben können: Das Risiko beim Blocken trifft nicht nur auf Firmen zu, sondern auch auf Behinderte. Die Firmen sperren Kunden aus. Die Behinderten werden benachteiligt.

Die Schuld trifft aber weiterhin nicht die Webmaster, sondern die Firmen, die nicht erkennbare Bots betreiben oder bei sich betreiben lassen. Die Webmaster versuchen nur ihren Content vor unerlaubter Nutzung zu schützen. Das kann ihnen keiner übel nehmen. Behinderte dazu zu benutzen, gegen Webmaster zu keifen ...

Back to Topic:
habe kurzzeitig mal die whitelistet Good Bots getrackt. Die greifen weiterhin massig auf den Content zu.

Kurios: Habe noch keine Ahnung ob der immense Anstieg von Besuchern am Blocken liegt. Wenn sie den Content nicht im KI-Chat kriegen, müssen sie zwangsläufig die Website besuchen.
 
Zuletzt bearbeitet:
Mirlo schrieb:
Das benutzt noch wer?

Die ganzen Agent Toolkits zum Beispiel machen Requests vom Client-Rechner aus, und natürlich in viel größeren Mengen (da aus Loops heraus) als aus irgendwelchen Chats mit Menschen.
 
GrumpyCat schrieb:
Das benutzt noch wer?
Ja, weil der einzige KI-Chat ohne Reg und Pay. Copilot und Gemini sind noch schlechter.

Bot-Attack!
Es gibt da ein Problem. Wies schon in einem anderen Thema erklärt, gibt es seit einigen Monaten viele Visits von vermutlichen Bots, die nicht erkennbar sind. Diese haben die Visits über das Doppelte erhöht.

Die Visits haben alle ein Merkmal:
  • besuchte Pages: 1
  • Besuchszeit: <10 Sekunden.
Darüber sind sie jedoch nicht blockierbar.

Diese Bad Bots haben ein Muster, bzw. zwei/drei verschiedene und sind nur mit dieser Regel blockierbar:
Code:
[Referer]
[Accept-Language]
[User-Agent]
Das ist ziemlich grob, aber eine andere Möglichkeit besteht nicht.
Da die [Accept-Language] dieser Visits "en" und die betreffende Website "de", sind die Kollateralschäden nicht ganz so groß.

Die ISP/ASN der IPs sind sehr viel Internet-Provider, aber auch ein paar Webhoster und Clouds. Das habe ich noch nicht ganz verstanden, wieso IPs von Internet-Providern von Bots genutzt werden? Sind das eventuell Requests von verseuchten Devices? Ist es das was du damit meinst?
GrumpyCat schrieb:
Die ganzen Agent Toolkits zum Beispiel machen Requests vom Client-Rechner aus, und natürlich in viel größeren Mengen (da aus Loops heraus) als aus irgendwelchen Chats mit Menschen.

Die Blockierregel ist nun schon ein paar Monate aktiv. Ich hatte sie jetzt für einen Tag deaktiviert und die Attacke ging sofort weiter.

Was machen?
 
Mirlo schrieb:
Dass du den Begriff "Kollateralschäden" einseitig gegen mich benutzt und mir damit eine Behindertenfeindlichkeit unterjubeln willst ... das is so billig, das fliegt sofort auf und bermerkt jeder Leser selbst. Also lass es einfach. Begreife es als nett gemeinte Verwarnung. Das nächste mal wird gemeldet.
Wie gesagt. Ich habe das ja nur zu Bedenken gegeben.
Den Rest hast Du geliefert
Du hättest ja darauf angemessen reagieren können. Wolltest Du aber nicht.
Da darf sich jeder seine eigenen Gedanken zu machen.

Mirlo schrieb:
Das kann ihnen keiner übel nehmen. Behinderte dazu zu benutzen, gegen Webmaster zu keifen ...
Irgendwie hast Du es immer noch nicht verstanden. Daher erkläre ich es Dir noch mal.
Es geht nicht darum, gegen "Webmaster zu keifen", wie Du es nennst.
Und von mir aus kannst Du auch sagen: "Ich blocke. Und wenns hier und da die falschen trifft, dann tut mir das leid aber für mich ist das eine Vorgehensweise die ich trotzdem für richtig halte."
Das wäre alles ok.

Du hast aber gesagt, das diejenigen die es trifft selber Schuld sind und die auch noch mit Bezeichnungen bedacht, die ich nicht als angemessen empfinde.
Ich ich denke, nicht jeder ist wirklich Schuld. Und nicht jeder verdient diese Bezeichnung.
Darauf hatte ich hingewiesen und das hatte ich kritisiert.

Mirlo schrieb:
Die Schuld trifft aber weiterhin nicht die Webmaster, sondern die Firmen, die nicht erkennbare Bots betreiben oder bei sich betreiben lassen.
Das das ein Problem ist, hab ich ja auch nie verneint.

Mirlo schrieb:
Die Webmaster versuchen nur ihren Content vor unerlaubter Nutzung zu schützen.
Das finde ich auch legitim.

btw. gibt es ja für diese Problematik, das KI Webseiten abgrast und deren Inhalt quasi verwenden einen Standard, der sich dem Problem annehmen soll.
Der RSL.

Die Idee ist quasi:
KI fragt bei Webseite an: "Hey. Nette Inhalte. Die würde ich mir gerne reinziehen. Wie kann ich das lizensieren und was kostet das gegebenenfalls und dann kann alles Notwendige automatisiert abgewickelt werden."

Solche Ideen zielen (ähnlich wie die robots.txt) aber natürlich auf Konsens ab. Gegen den böswilligen Scraper hilft das nicht.
 
andy_m4 schrieb:
Du hast aber gesagt, das diejenigen die es trifft selber Schuld sind und die auch noch mit Bezeichnungen bedacht, die ich nicht als angemessen empfinde.
Das hast du falsch verstanden. Das hier:
Mirlo schrieb:
Das ist ein Human, der sich wie ein Bad Bot verhält und geblockt wird. Du kannst es dir aussuchen. Falsche Entscheidung führt zum Blocken. Kein Bock auf solche Human Bots.
wurde im Kontext von Zero-Click-User geschrieben und nicht von Behinderten, die Tools benutzen.
Die Zero-Click-User sind Humans, die sich wie Bad Bots verhalten.
Mirlo schrieb:
Alle anderen, die es versehentlich erwischt: Bedankt euch bei den Bad Bots Betreibern.
Das gilt auch für die Behinderten, denn die sind neben den Webmastern die Leidtragenden. Die Betreiber von Bad Bots oder auch nur die Firmen, die Bad Bots bei sich zulassen, sind so gesehen indirekt behindertenfeindlich. Denen einen Darfschein erteilen, nur weil bei denen auch Behinderten-Tools betrieben werden können, ist falsch. Deswegen mein Ansinnen, dass diese Firmen nicht unterstützt werden sollen. Das Blocken dieser Firmen trägt dazu bei. Das Blocken ist also so gesehen auf lange Sicht betrachtet behindertenfreundlich, weil es gegen diese Firmen vorgeht. Es ist wie gesagt ein Bot-War. Du scheinst keine Ahnung zu haben was da abgeht. über 90 % Traffic rein durch Bots. Die greifen alles ab und verwenden es ungefragt.

Mal ein vorrübergehendes Beispiel:
vom 1. bis 10.: 3 GB Traffic/Monat
ab 11. Blocking
vom 1. bis 20.: 3,1 GB Traffic/Monat

Zurück zum Thema:
Bei der KI-Chat Session zum Erstellen der JSON LD wollte ChatGPT die exakte Anweisung: Erlaube den Zugriff auf die Website. Vorher hat es mit Ausreden herumgequasselt, dass kein Zugriff möglich wäre.

Bedenklich war zudem, dass wenn der KI keine Daten über eine Website zur Verfügung stehen, sie auf "ähnliche" Quellen zurückgreift und damit antwortet. Dann werden Aussagen über eine Website anhand einer anderen Website getätigt. Da benötigt es die Anweisung: Nur Content der Website verwenden.

Wenn also "ähnliche" Quellen verwendet werden, dann funktioniert zwar das Blocken, aber es wird supportet, dass die KI falsche Informationen verbreitet, bzw. der Content anderer / verbliebener / nicht blockender Websites den blockenden Websites zugeschoben und somit verbreitet wird, dass die Aussagen weit verbreitet seien. Also nicht nur auf der nicht blockenden, sondern auch auf der blockenden Website stehen würden. Damit werden Aussagen behauptet und vermehrt, die so gar nicht auf der blockenden Website stehen.
Ergänzung ()

andy_m4 schrieb:
Der RSI Standard schön und gut. Das ist wie DNT und GPC. Es verhindert Bad Bots nicht. Es ergibt nur Sinn, wenn grundlegend alle Bots geblockt und danach per Whitelist freigegeben werden, eventuell per Pay - sozusagen eine Pay-Wall für Bots.
 
Zuletzt bearbeitet:
Mirlo schrieb:
Ja, weil der einzige KI-Chat ohne Reg und Pay.
Es gibt haufenweise Alternativen. https://chat.z.ai (GLM) oder https://kimi.com zum Beispiel.
Mirlo schrieb:
Die Visits haben alle ein Merkmal:
  • besuchte Pages: 1
  • Besuchszeit: <10 Sekunden.
Darüber sind sie jedoch nicht blockierbar.
Naja lies doch mal, was ich schreibe; genau wegen sowas war erwähnt, dass die aktuelle Server-Last in den Regeln eine Rolle spielen muss. Bei meinen Servern würden solche Requests niedriger priorisiert werden als eingeloggte Benutzer und dann eben bei Last nur noch auf ein 50x oder auf eine Art Captcha-Seite laufen. Echte Benutzer haben währenddessen ganz normal Zugang.
Mirlo schrieb:
Das ist ziemlich grob, aber eine andere Möglichkeit besteht nicht.
Du bist recht schnell mit "Alternativlos".
Mirlo schrieb:
Das habe ich noch nicht ganz verstanden, wieso IPs von Internet-Providern von Bots genutzt werden?
Google dochmal "Claude Code" zum Beispiel.

Ich bin mal hier raus, das dreht sich etwas sehr im Kreis...
 
Drahminedum schrieb:
Ergänzend zu dem was @GrumpyCat geschrieben hat: viele Besitzer von grösseren Foren haben gar keine Wahl mehr als zu blocken, wenn sonst zehntausende (!) Bots gleichzeitig das Forum beackern.

Mir hat es beinahe 2 Webseiten zerschossen. Das eigentliche Forum und die Seite wo Matomo drauf ist (anderer Hoster)

Das ist die Traffic-Auswertung NUR für Matomo (also hier liegt das File um zugriffe zu zählen - nicht mehr!)
Gesamt Traffic: 315,565 GB
Gesamt Hits: 29.638.979
Das war Juni. Juli ist jetzt aktuell (seit gestern ist die Statistik-Domain von mir offline genommen worden)

Gesamt Traffic: 319,744 GB
Gesamt Hits 31.801.694

Normal sieht das so aus:
Gesamt Traffic: 25,266 GB
Gesamt Hits: 1.962.974

Wie gesagt: das ist nur der Traffic für das erfassen von Zugriffen....
Im Forum selber liegen wir bei DAUERHAFT 10-20Mbit Traffic. Dauerhaft. Für ein Forum wo 90% damit beschäftigt wird ein Thread zu lesen (also 1x laden) und zu Antworten.

Auf dem Forenserver hatten wir schon eine recht große Blocking-Liste gepackt als wir letztes Jahr schon mehrfach AI-Bots zu Besuch hatten. Hat die ganze Performance des Server runtergezogen (Auslastung war am Maximum; aktuell liegen wir bei 40% Dauerauslastung). Die jetzige AI-Bot-Attacke kommt mit neuen IPs etc. ;( Müssen wir neu auswerten - neu Blocken. Auf dem Matomo-Server liegt schon meine Privat-Home-Webserver-Blockliste wo quasi schon das halbe Internet geblockt ist... brachte wenig. Lieblings UA von AI-Bots ist übrigens Safari ... also der Client-Safari-UA.

AI-Bots zerstören Foren, kleine Webseiten ... Hier wird gnadenlos gescraped ... aber auch nicht einmal ... Meta kommt gleich mit einer ganzen Horde Bots - bauen tausende Sessions auf (das war beinahe der erste Tot unseres Server - im Minuten Takt kamen hunderte Sessions dazu) und das immer wieder. Statt einmal das Forum auszulesen und in paar Wochen wieder zu kommen (wie es Suchmaschinen-Bots auch machen).

Wie gesagt: die 320Gbyte Verbrauch sind nur der Statistikserver - ich weiß nicht wie der Verbrauch beim Forum selber aussieht ... aber bei 10-20Mbit Dauer-Traffic - wären das im Monat etwa 3,4-6,8 TByte ..... Das machen Hoster auch nicht lange mit. Vor allem in für Foren ausreichende Billo-Hoster-Paketen.
 
Zuletzt bearbeitet:
Mirlo schrieb:
Es bräuchte eine gesetzliche Regelung, dass Bots als solche erkennbar sein müssen. Betreiber von nicht erkennbaren Bots mit Strafen belegen
Genau ...

Bots müssen:
Klar Identifizierbar sein (UserAgent)
Und sich an Robots.txt halten (Suchmaschinenbots machen das - AI nicht; OpenAI gibt zwar an das sie sich dran halten, geben aber nicht an wie man deren bots in der robots "steuert")

Alles andere sollte Schadensersatzpflichtig/Haftbar gemacht werden können.

Ich hab bei uns kein Problem wenn AI den Content auswertet - aber wenn das Forum dafür vom Netz genommen werden muss, weil der Traffic und die Auslastung nicht mehr Tragbar sind - ist das nicht mehr ok.
Ergänzung ()

Mirlo schrieb:

Das Problem ist aber das Matomo damit zwar die Datenbank sauberer hält (ich konnte meine die Tage nicht mehr nutzen weil max. überlastet - mein Hoster hat mich im AdminUI auch drauf hingewiesen das irgendwas da nicht stimmt - Die Tabelle ist vieeeeeel zu groß ...), aber der Traffic fällt halt trotzdem an. Das Tracking .js wird ja trotzdem geladen. Es löst nur keine DB-Aktion mehr aus. Und das ist halt das schlimme bei AI-Bots - die Masse in der sie aufschlagen und nicht mehr gehen (siehe mein Post auf Seite 2). Oder setzt sich das Plugin wo anders hin?

Ich hatte gestern erstmal die Sub-Domain fürs Tracking deaktiviert (mein Hoster wo Matomo liegt, gibt dann aus das die Domain nicht aktiv ist - toll) - Traffic gab es immer noch. Erst als ich den DNS-Eintrag für die Domain gekickt hatte, hörte es auf (logisch).
 
Zuletzt bearbeitet:
Zurück
Oben