← All stories

Anthropic legt angebliche KI-Destillationskampagnen von Rivalen offen

Anthropic veröffentlichte einen Bericht, dem zufolge in China ansässige KI-Unternehmen anhaltende und zunehmend ausgefeilte Destillationskampagnen gegen Claude durchgeführt haben. Dabei soll es in fünf Kampagnen fast 200 Millionen Interaktionen gegeben haben.

Warum das wichtig ist

Anthropic könnte Kontoverifizierung, Abfragelimits, den Umfang der ausgegebenen Informationen und die Missbrauchsüberwachung verschärfen. Das würde die Kosten für Schutzmaßnahmen erhöhen und zugleich die Menge an Modellverhalten verringern, die über die Schnittstelle zugänglich ist.

Tech Trends Today publication

Was sich geändert hat

Anthropic berichtete von fast 200 Millionen Interaktionen im Rahmen von fünf mutmaßlichen Destillationskampagnen, die auf Claudes agentische Fähigkeiten, Tool-Nutzung, Programmierung, Datenanalyse und logisches Denken abzielten. Das Unternehmen schrieb die Kampagnen Alibaba, Moonshot AI und DeepSeek zu; diese Vorwürfe sind jedoch nicht unabhängig bestätigt. TechCrunch berichtet.

Die größte Kampagne, die den Qwen-Modellteams von Alibaba zugeschrieben wird, umfasste von Mai bis Juli 2026 insgesamt 151 Millionen Interaktionen über 3.500 Konten und erreichte mit fast drei Millionen Interaktionen pro Tag ihren Höchststand. Eine weitere Kampagne schrieb Anthropic Moonshot AI, dem Entwickler von Kimi, zu. Sie umfasste fast 300.000 Anfragen, die innerhalb von zehn Tagen über 5.000 Konten geleitet wurden. Eine Anfrage forderte Claude auf, Überwachungsaufnahmen auf ungewöhnliches Verhalten zu prüfen.

Die Kampagnen sollen Prompts verwendet haben, die darauf abzielten, Inhalte des Arbeitsgedächtnisses offenzulegen, darunter eine als reine Katakana-Übersetzungsaufgabe formulierte Anfrage. OpenAI berichtete unabhängig davon über Aktivitäten, die es DeepSeek zuschrieb.

Warum das wichtig ist

Bei der Destillation werden die Ausgaben eines Modells als Trainingsmaterial für ein anderes Modell verwendet. Der Bericht von Anthropic legt nahe, dass sich proprietäre Fähigkeiten zum Schlussfolgern und zur Tool-Nutzung durch koordinierte Abfragen in großer Zahl gezielt abgreifen lassen, ohne Zugriff auf die Modellparameter zu benötigen.

Wenn die Interaktionen brauchbares Trainingsmaterial hervorbrachten, könnten sie den Zeit- oder Kostenaufwand für die Verbesserung ausgewählter Fähigkeiten eines Konkurrenzmodells verringern. Der Bericht von Anthropic belegt jedoch nicht, dass die Versuche erfolgreich waren oder zu einem kommerziell eingesetzten oder militärischen System geführt haben.

Anthropic könnte mit einer strengeren Kontoverifizierung, Abfragelimits, weniger detaillierten Ausgaben und einer intensiveren Überwachung von Missbrauch reagieren. Das könnte proprietäre Fähigkeiten schützen, zugleich aber automatisierte Bewertungen, Modellvergleiche und die Anwendungsentwicklung verlangsamen oder verteuern.

Die historische Parallele

Forschende demonstrierten bereits die Black-Box-Extraktion von Produktionsmodellen von BigML und Amazon Machine Learning über Vorhersage-APIs, ohne auf deren Parameter zugreifen zu können. Wiederholte, strategisch ausgewählte Abfragen machten diese Schnittstellen zu Quellen für Trainingsdaten. Die historische Studie.

Bei dieser Arbeit ging es um Klassifikatoren und Regressionsmodelle, nicht um generative Systeme mit Schlussfolgerungsfähigkeiten. Spätere Forschungen beschrieben eine Verhaltensüberwachung, die in ihren Experimenten Extraktionsangriffe ohne Fehlalarme erkannte. Das spricht für mehrschichtige Schutzmaßnahmen, statt sich ausschließlich darauf zu verlassen, Konfidenzwerte zu verbergen.

Der Präzedenzfall spricht für ein Wettrüsten zwischen Extraktion und Erkennung, belegt jedoch weder die Zuschreibung durch Anthropic noch den Erfolg der aktuellen Kampagnen oder eine geopolitische Absicht.

Wie sich die Auswirkungen ausbreiten könnten

Anthropic und andere Anbieter von Frontier-Modellen könnten Konten gruppieren, wiederholte Abfragemuster überwachen, Abfragelimits verschärfen und weniger Details zu den Schlussfolgerungen offenlegen. Wenn diese Kontrollen koordinierte Kampagnen von gewöhnlicher Nutzung unterscheiden können, dürfte der Zugang für Unternehmen mit zusätzlichen Compliance-Anforderungen bestehen bleiben.

Wenn Experimente mit großen Abfragemengen schwieriger werden, könnten Unternehmen Bewertung und Entwicklung auf selbst gehostete oder alternative Modelle verlagern. Kleinere Entwickler könnten dabei stärker unter den Einschränkungen leiden, weil sie weniger Ausweichmöglichkeiten und geringere Kapazitäten zum Aufbau privater Infrastruktur haben.

Wettbewerber könnten sich einen Vorteil verschaffen, indem sie zuverlässigen Zugang mit glaubwürdigen Schutzmaßnahmen gegen Extraktion anbieten. Wenn Anbieter missbräuchlichen Datenverkehr nicht von legitimer Automatisierung unterscheiden können, könnten umfassendere Beschränkungen den nutzbaren Zugang verringern und die Kluft zwischen gut finanzierten Unternehmen und kleineren Entwicklern vergrößern.

Folgenabschätzung

Anthropic muss mit höheren Kosten für Erkennung, Zuordnung und Zugriffskontrolle rechnen. Zugleich besteht das Risiko, dass defensive Änderungen Claude weniger komfortabel nutzbar machen.

Alibaba und Moonshot AI drohen Reputations-, Geschäfts- und Zugangsrisiken, falls die Vorwürfe als glaubwürdig gelten. Der Bericht belegt nicht, dass eines der beiden Unternehmen die Aktivitäten genehmigt oder eine erfolgreiche Modellverbesserung erzielt hat.

Unternehmenskunden könnten von einem besseren Schutz der Fähigkeiten der Anbieter profitieren, doch strengere Kontrollen könnten automatisierte Tests und Bewertungen beeinträchtigen. Unabhängige und kleinere Entwickler könnten eine kostengünstige Quelle für Trainings- und Bewertungsmaterial verlieren, wenn Anbieter die Ausgabedetails reduzieren oder umfassendere Kontrollen einführen.

Szenarien

Unser Ausblick (informierte Spekulation): In den kommenden sechs bis zwölf Monaten werden Anbieter voraussichtlich die Kosten koordinierter Extraktion erhöhen und zugleich den gewöhnlichen Zugang für Unternehmen durch gezielte Kontrollen aufrechterhalten.

Am wahrscheinlichsten

Wenn Anbieter gruppierte Konten und wiederholte Prompts im Stil von Extraktionsversuchen erkennen können, werden sie abgestufte Verifizierungsmaßnahmen, Abfragelimits und Ausgabekontrollen einführen, statt APIs pauschal zu beschränken. Der Zugang für Unternehmen mit hohem Abfragevolumen würde unter strengerer Überwachung bestehen bleiben, während Wettbewerber den Schutz ihrer Modelle als Bestandteil ihrer Angebote für Unternehmenskunden vermarkten.

Positives Szenario

Wenn die Verhaltensüberwachung mit wenigen Fehlalarmen funktioniert, könnten Anbieter missbräuchlichen Datenverkehr eindämmen und ihre API-Dienste sicherer sowie besser prüfbar machen. Unternehmenskunden könnten darauf reagieren, indem sie den Einsatz externer Modelle ausweiten, die strengere Sicherheitsanforderungen erfüllen.

Negatives Szenario

Wenn Anbieter Extraktion nicht zuverlässig von legitimer Nutzung mit hohem Abfragevolumen unterscheiden können, könnten sie weitreichende Obergrenzen einführen und die Ausgabedetails reduzieren. Kleinere Entwickler könnten sich von Frontier-APIs abwenden, während größere Unternehmen stärker in private Infrastruktur investieren und die Lücke bei den Fähigkeiten vergrößern.

Was als Nächstes zu beobachten ist

  • Anbieter kündigen Änderungen bei Kontoverifizierung, Abfragelimits oder Ausgabekontrollen an, die auf koordinierte Abfragen zielen.
  • Unabhängige technische Belege zeigen, ob die Kampagnen brauchbares Trainingsmaterial hervorgebracht haben.
  • Unternehmenskunden berichten über Veränderungen bei API-Zuverlässigkeit, Onboarding, Bewertungsabläufen oder Compliance-Kosten.
  • Wettbewerber führen Überwachung gegen Extraktionsversuche und Zugriffskontrollen als Funktionen für Unternehmenskunden ein.
Sources (4)
  1. TechCrunchAnthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
  2. arxiv.orgStealing Machine Learning Models via Prediction APIs
  3. arxiv.orgPRADA: Protecting Against DNN Model Stealing Attacks
  4. arxiv.orgA Survey on Model Extraction Attacks and Defenses for Large Language Models

Kommentare

Noch keine Kommentare.