Agent Runs · Swarm Lab
Un travail qui semble impossible. Fait par un essaim.
Un Agent Run flagship découpe un projet à l’échelle d’une grande entreprise en milliers de petites tâches d’agents : lire chaque contrat, contrôler chaque fournisseur, cartographier tout un secteur. Des agents superviseurs revérifient le travail, une personne valide chaque décision à risque et vous recevez le résultat avec un journal de preuves. Le prix est fixé avant le démarrage.
Dernière mise à jour:
Impossible → livré
Sept runs flagship que nous cadrons aujourd’hui. Retournez une carte pour voir comment l’essaim s’y prend.
F1
Lire tous les contrats que vous avez signés — d’ici vendredi.
Comment l’essaim procède
Des agents lisent chaque contrat et en extraient les parties, les dates, la reconduction, les plafonds de responsabilité et les clauses de changement de contrôle. Des superviseurs relisent un échantillon de chaque agent. Un éditeur construit le registre des risques.
- Volume
- ~20 000 contrats
- Durée du run
- 72 heures
- Contrôle qualité
- Un échantillon lu deux fois ; les désaccords vont à votre service juridique. Le taux d’erreur constaté figure dans le rapport.
Dès 40 000 €F2
Retrouver chaque facture payée deux fois ces trois dernières années — et jusqu’à dix ans si les archives existent.
Comment l’essaim procède
Les agents normalisent votre historique de paiements sur toutes les entités (trois ans en standard, jusqu’à dix si les archives existent), rapprochent montants, fournisseurs, dates et variantes de références, et documentent chaque doublon suspect avec les deux paiements.
- Volume
- 3 ans (jusqu’à 10), toutes entités
- Durée du run
- 1 semaine
- Contrôle qualité
- Chaque cas est accompagné de ses preuves. Votre comptabilité fournisseurs confirme avant toute demande de remboursement.
Dès 30 000 €ou au résultatF3
Documenter un système que plus personne ne connaît.
Comment l’essaim procède
Les agents lisent le code VB6, COBOL ou Access module par module, décrivent ce que fait chaque partie et quelles données elle touche, puis rédigent un plan de migration à partir de la carte des dépendances.
- Volume
- Toute la base de code
- Durée du run
- 2 semaines
- Contrôle qualité
- Un second agent vérifie la documentation de chaque module contre le code ; vos développeurs relisent un échantillon et le plan.
Dès 60 000 €F4
Contrôler toute votre base fournisseurs en 48 heures.
Comment l’essaim procède
Les agents vérifient chaque fournisseur dans les listes de sanctions, VIES, les registres d’insolvabilité et la presse, et rédigent une courte conclusion sourcée par alerte.
- Volume
- ~20 000 fournisseurs
- Durée du run
- 48 heures
- Contrôle qualité
- Chaque alerte renvoie à sa source. Une personne décide si la correspondance est réelle.
Dès 25 000 €F5
Cartographier toutes les entreprises de votre secteur en Europe — en une semaine.
Comment l’essaim procède
Les agents collectent les données publiques de chaque entreprise, la notent selon des critères convenus à l’avance et citent l’origine de chaque donnée.
- Volume
- ~50 000 entreprises
- Durée du run
- 1 semaine
- Contrôle qualité
- Un échantillon est vérifié par une personne, et les règles de notation sont écrites avant le run.
Dès 20 000 €F6
Transformer toutes les règles UE et luxembourgeoises qui vous concernent en un seul registre.
Comment l’essaim procède
Les agents lisent les textes applicables à vos activités et listent chaque obligation avec l’article dont elle découle, son responsable et sa fréquence.
- Volume
- Tous les textes UE et luxembourgeois applicables
- Durée du run
- 10 jours
- Contrôle qualité
- Chaque obligation cite son article. Un avocat — le vôtre ou un cabinet de votre choix — valide avant la livraison.
Dès 30 000 €F8
Passer au crible 50 000 brevets et articles en cinq jours.
Comment l’essaim procède
Les agents lisent chaque document, gardent les passages pertinents pour vos revendications et les classent : votre conseil en lit quelques dizaines, pas des milliers.
- Volume
- ~50 000 brevets et articles
- Durée du run
- 5 jours
- Contrôle qualité
- Chaque résultat montre le passage exact. Votre conseil en brevets décide.
Dès 25 000 €
Ce sont des offres, dimensionnées à partir de nos runs de démonstration. Aucun run flagship n’a encore été livré ; quand ce sera le cas, sa précision mesurée sera publiée ci-dessous.
Preuves venues de la frontière
Ce que de grandes campagnes d’agents ont déjà accompli publiquement, avec les chiffres publiés par les laboratoires.
Résultats publics de laboratoires d’IA — pas des projets de 20 More.
, Anthropic
Un compilateur C écrit par 16 agents en parallèle
Une équipe de 16 agents Claude a écrit un compilateur C de 100 000 lignes, en Rust, capable de compiler Linux 6.9 sur x86, ARM et RISC-V.
- 16
- agents en parallèle
- ~2 000
- sessions Claude Code
- ~20 000 $
- de coûts d’API
Réserve: Un projet de recherche des ingénieurs d’Anthropic, pas une livraison client.
Source: Anthropic Engineering — Building a C compiler with parallel Claudes
, Anthropic
Project Glasswing : des vulnérabilités dans plus de 1 000 projets open source
Claude Mythos Preview a analysé plus de 1 000 projets open source. Des sociétés de sécurité indépendantes ont évalué 1 752 des résultats classés élevés ou critiques.
- 23 019
- résultats au total
- 1 752
- résultats élevés/critiques évalués
- 90,6 %
- étaient réels
Réserve: Les 90,6 % portent sur les 1 752 résultats élevés et critiques évalués de façon indépendante, pas sur les 23 019.
, Anthropic
Un nouveau système enzymatique trouvé par une campagne d’environ 950 sessions
Des agents Claude ont fouillé des données de protéines pendant environ 21 heures et trouvé un système enzymatique inconnu à répétitions de type CRISPR, baptisé ART.
- ~950
- sessions d’agents
- ~21 h
- de recherche
- 210 M
- tokens
Touchez une étape pour voir ce qui s’y est passé.
Réserve: Des scientifiques ont réalisé tout le travail de laboratoire, et la fonction du nouveau système n’est pas encore connue.
Nos campagnes
Questions sur les runs flagship
Un run flagship, ce sont des milliers d’agents en même temps ?
Non. Ce sont des milliers de tâches d’agents. Au plus une cinquantaine d’agents travaillent en même temps, par lots, jusqu’à ce que chaque tâche soit faite et vérifiée.
Avez-vous déjà livré un run flagship ?
Pas encore. Les runs de cette page sont des offres, dimensionnées à partir de nos runs de démonstration. Les premiers résultats mesurés seront publiés sur cette page.
Comment mesurez-vous la précision ?
Une personne compare un échantillon aléatoire du résultat aux documents sources. Le rapport indique le taux d’erreur constaté et la façon dont l’échantillon a été tiré.
Combien coûte un run flagship ?
Les runs flagship démarrent à 20 000 €, avec un prix fixe convenu après un appel de cadrage. Chaque carte indique son prix de départ.
Où vont nos données ?
Les modèles tournent dans des régions de l’UE (Claude via Amazon Bedrock). Le run peut s’exécuter dans votre propre compte cloud, et nous ne stockons jamais vos mots de passe. Nous signons un accord de traitement RGPD avant tout démarrage.
Cadrer un run flagship
Quatre questions. Nous répondons sous deux jours ouvrés avec ce que ferait le run, sa durée et un prix fixe.
Dès 20 000 €