Agent Runs · Swarm Lab
Arbeit, die unmöglich klingt. Erledigt von einem Schwarm.
Ein Flagship-Agent-Run zerlegt einen Auftrag in Konzerngröße in Tausende kleine Agenten-Aufgaben: jeden Vertrag lesen, jeden Lieferanten prüfen, eine ganze Branche kartieren. Supervisor-Agenten prüfen die Arbeit erneut, ein Mensch zeichnet jede Risikoentscheidung ab, und Sie erhalten das Ergebnis mit einem Nachweisprotokoll. Der Preis steht vor dem Start fest.
Zuletzt aktualisiert:
Unmöglich → geliefert
Sieben Flagship-Runs, die wir heute planen. Drehen Sie eine Karte um, um zu sehen, wie der Schwarm vorgeht.
F1
Jeden Vertrag lesen, den Sie je unterschrieben haben — bis Freitag.
So arbeitet der Schwarm
Agenten lesen jeden Vertrag und erfassen Parteien, Fristen, Verlängerungsklauseln, Haftungsgrenzen und Change-of-Control-Klauseln. Supervisoren lesen eine Stichprobe jedes Agenten erneut. Ein Editor erstellt das Risikoregister.
- Umfang
- ~20.000 Verträge
- Laufzeit
- 72 Stunden
- Qualitätsprüfung
- Eine doppelt gelesene Stichprobe; Abweichungen gehen an Ihre Rechtsabteilung. Die gefundene Fehlerquote steht im Bericht.
Ab 40.000 €F2
Jede Rechnung finden, die Sie in den letzten drei Jahren doppelt bezahlt haben — und bis zu zehn, wo Unterlagen vorliegen.
So arbeitet der Schwarm
Die Agenten vereinheitlichen Ihre Zahlungshistorie über alle Gesellschaften (drei Jahre als Standard, bis zu zehn, wo Unterlagen vorliegen), gleichen Beträge, Lieferanten, Daten und Referenzvarianten ab und belegen jede vermutete Doppelzahlung mit beiden Zahlungen.
- Umfang
- 3 Jahre (bis 10), alle Gesellschaften
- Laufzeit
- 1 Woche
- Qualitätsprüfung
- Jeder Fall kommt mit Belegen. Ihre Kreditorenbuchhaltung bestätigt, bevor etwas zurückgefordert wird.
Ab 30.000 €oder erfolgsabhängigF3
Ein System dokumentieren, das niemand mehr kennt.
So arbeitet der Schwarm
Die Agenten lesen den VB6-, COBOL- oder Access-Code Modul für Modul, beschreiben, was jeder Teil tut und welche Daten er berührt, und entwerfen aus der Abhängigkeitskarte einen Migrationsplan.
- Umfang
- Die gesamte Codebasis
- Laufzeit
- 2 Wochen
- Qualitätsprüfung
- Ein zweiter Agent prüft die Dokumentation jedes Moduls gegen den Code; Ihre Entwickler prüfen eine Stichprobe und den Plan.
Ab 60.000 €F4
Ihren gesamten Lieferantenstamm in 48 Stunden prüfen.
So arbeitet der Schwarm
Die Agenten prüfen jeden Lieferanten gegen Sanktionslisten, VIES, Insolvenzregister und Presse und schreiben zu jedem Treffer einen kurzen Befund mit Quelle.
- Umfang
- ~20.000 Lieferanten
- Laufzeit
- 48 Stunden
- Qualitätsprüfung
- Jeder Treffer verweist auf seine Quelle. Ein Mensch entscheidet, ob ein Treffer echt ist.
Ab 25.000 €F5
Jedes Unternehmen Ihrer Branche in der EU kartieren — in einer Woche.
So arbeitet der Schwarm
Die Agenten sammeln öffentliche Daten zu jedem Unternehmen, bewerten es nach vorab vereinbarten Kriterien und belegen die Herkunft jedes Datenpunkts.
- Umfang
- ~50.000 Unternehmen
- Laufzeit
- 1 Woche
- Qualitätsprüfung
- Eine Stichprobe wird von einem Menschen geprüft; die Bewertungsregeln stehen vor dem Run fest.
Ab 20.000 €F6
Alle EU- und Luxemburger Vorschriften, die für Sie gelten, in einem Register.
So arbeitet der Schwarm
Die Agenten lesen die für Ihre Tätigkeiten geltenden Texte und listen jede Pflicht mit dem Artikel, aus dem sie folgt, der verantwortlichen Stelle und der Häufigkeit.
- Umfang
- Alle anwendbaren EU- und Luxemburger Texte
- Laufzeit
- 10 Tage
- Qualitätsprüfung
- Jede Pflicht nennt ihren Artikel. Ein Anwalt — Ihr Rechtsbeistand oder eine Kanzlei Ihrer Wahl — zeichnet vor der Lieferung ab.
Ab 30.000 €F8
50.000 Patente und Fachartikel in fünf Tagen sichten.
So arbeitet der Schwarm
Die Agenten lesen jedes Dokument, behalten die für Ihre Ansprüche relevanten Passagen und ordnen sie, sodass Ihr Patentanwalt Dutzende statt Tausende liest.
- Umfang
- ~50.000 Patente und Artikel
- Laufzeit
- 5 Tage
- Qualitätsprüfung
- Jedes Ergebnis zeigt die genaue Passage. Ihr Patentanwalt entscheidet.
Ab 25.000 €
Das sind Angebote, dimensioniert anhand unserer Demo-Runs. Noch wurde kein Flagship-Run geliefert; sobald das geschieht, wird die gemessene Genauigkeit hier veröffentlicht.
Belege von der Forschungsfront
Was große Agenten-Kampagnen bereits öffentlich geleistet haben, mit den Zahlen, die die Labore veröffentlicht haben.
Öffentliche Ergebnisse von KI-Laboren — keine Projekte von 20 More.
, Anthropic
Ein C-Compiler, geschrieben von 16 parallelen Agenten
Ein Team aus 16 Claude-Agenten schrieb einen C-Compiler mit 100.000 Zeilen in Rust, der Linux 6.9 auf x86, ARM und RISC-V bauen kann.
- 16
- Agenten parallel
- ~2.000
- Claude-Code-Sitzungen
- ~20.000 $
- API-Kosten
Einschränkung: Ein Forschungsprojekt von Anthropics eigenen Ingenieuren, keine Kundenlieferung.
Quelle: Anthropic Engineering — Building a C compiler with parallel Claudes
, Anthropic
Project Glasswing: Schwachstellen in über 1.000 Open-Source-Projekten
Claude Mythos Preview untersuchte über 1.000 Open-Source-Projekte. Unabhängige Sicherheitsfirmen bewerteten 1.752 der als hoch oder kritisch eingestuften Befunde.
- 23.019
- Befunde insgesamt
- 1.752
- hohe/kritische Befunde bewertet
- 90,6 %
- davon waren echt
Einschränkung: Die 90,6 % beziehen sich auf die 1.752 unabhängig bewerteten hohen und kritischen Befunde, nicht auf alle 23.019.
, Anthropic
Ein neues Enzymsystem, gefunden in einer Kampagne mit ~950 Sitzungen
Claude-Agenten durchsuchten rund 21 Stunden lang Proteindaten und fanden ein bisher unbeschriebenes Enzymsystem mit CRISPR-ähnlichen Wiederholungen, genannt ART.
- ~950
- Agenten-Sitzungen
- ~21 h
- Suche
- 210 Mio.
- Tokens
Tippen Sie auf einen Schritt, um zu sehen, was dort geschah.
Einschränkung: Die gesamte Laborarbeit leisteten Wissenschaftler, und die Funktion des neuen Systems ist noch unbekannt.
Unsere Kampagnen
Fragen zu Flagship-Runs
Heißt Flagship-Run Tausende Agenten gleichzeitig?
Nein. Es heißt Tausende Agenten-Aufgaben. Höchstens etwa 50 Agenten arbeiten gleichzeitig, in Chargen, bis jede Aufgabe erledigt und geprüft ist.
Haben Sie schon einen Flagship-Run geliefert?
Noch nicht. Die Runs auf dieser Seite sind Angebote, dimensioniert anhand unserer Demo-Runs. Die ersten gemessenen Ergebnisse werden auf dieser Seite veröffentlicht.
Wie messen Sie die Genauigkeit?
Ein Mensch vergleicht eine Zufallsstichprobe des Ergebnisses mit den Quelldokumenten. Der Bericht nennt die gefundene Fehlerquote und wie die Stichprobe gezogen wurde.
Was kostet ein Flagship-Run?
Flagship-Runs beginnen bei 20.000 €, mit einem Festpreis, der nach einem Scoping-Gespräch vereinbart wird. Jede Karte zeigt ihren Einstiegspreis.
Wohin gehen unsere Daten?
Die Modelle laufen in EU-Regionen (Claude über Amazon Bedrock). Der Run kann in Ihrem eigenen Cloud-Konto laufen, und wir speichern nie Ihre Passwörter. Vor dem Start unterzeichnen wir einen DSGVO-Auftragsverarbeitungsvertrag.
Flagship-Run anfragen
Vier Fragen. Wir antworten innerhalb von zwei Werktagen mit Umfang, Dauer und Festpreis.
Ab 20.000 €