Nous utilisons des cookies pour la mesure d’audience et la mesure de nos annonces Google Ads. Rien n’est chargé avant votre accord. Politique de cookies

Agent Runs · Swarm Lab

Un travail qui semble impossible. Fait par un essaim.

Un Agent Run flagship découpe un projet à l’échelle d’une grande entreprise en milliers de petites tâches d’agents : lire chaque contrat, contrôler chaque fournisseur, cartographier tout un secteur. Des agents superviseurs revérifient le travail, une personne valide chaque décision à risque et vous recevez le résultat avec un journal de preuves. Le prix est fixé avant le démarrage.

Dernière mise à jour:

Impossible → livré

Sept runs flagship que nous cadrons aujourd’hui. Retournez une carte pour voir comment l’essaim s’y prend.

  • F1

    Lire tous les contrats que vous avez signés — d’ici vendredi.

    Comment l’essaim procède

    Des agents lisent chaque contrat et en extraient les parties, les dates, la reconduction, les plafonds de responsabilité et les clauses de changement de contrôle. Des superviseurs relisent un échantillon de chaque agent. Un éditeur construit le registre des risques.

    Volume
    ~20 000 contrats
    Durée du run
    72 heures
    Contrôle qualité
    Un échantillon lu deux fois ; les désaccords vont à votre service juridique. Le taux d’erreur constaté figure dans le rapport.
    Dès 40 000 €
  • F2

    Retrouver chaque facture payée deux fois ces trois dernières années — et jusqu’à dix ans si les archives existent.

    Comment l’essaim procède

    Les agents normalisent votre historique de paiements sur toutes les entités (trois ans en standard, jusqu’à dix si les archives existent), rapprochent montants, fournisseurs, dates et variantes de références, et documentent chaque doublon suspect avec les deux paiements.

    Volume
    3 ans (jusqu’à 10), toutes entités
    Durée du run
    1 semaine
    Contrôle qualité
    Chaque cas est accompagné de ses preuves. Votre comptabilité fournisseurs confirme avant toute demande de remboursement.
    Dès 30 000 €ou au résultat
  • F3

    Documenter un système que plus personne ne connaît.

    Comment l’essaim procède

    Les agents lisent le code VB6, COBOL ou Access module par module, décrivent ce que fait chaque partie et quelles données elle touche, puis rédigent un plan de migration à partir de la carte des dépendances.

    Volume
    Toute la base de code
    Durée du run
    2 semaines
    Contrôle qualité
    Un second agent vérifie la documentation de chaque module contre le code ; vos développeurs relisent un échantillon et le plan.
    Dès 60 000 €
  • F4

    Contrôler toute votre base fournisseurs en 48 heures.

    Comment l’essaim procède

    Les agents vérifient chaque fournisseur dans les listes de sanctions, VIES, les registres d’insolvabilité et la presse, et rédigent une courte conclusion sourcée par alerte.

    Volume
    ~20 000 fournisseurs
    Durée du run
    48 heures
    Contrôle qualité
    Chaque alerte renvoie à sa source. Une personne décide si la correspondance est réelle.
    Dès 25 000 €
  • F5

    Cartographier toutes les entreprises de votre secteur en Europe — en une semaine.

    Comment l’essaim procède

    Les agents collectent les données publiques de chaque entreprise, la notent selon des critères convenus à l’avance et citent l’origine de chaque donnée.

    Volume
    ~50 000 entreprises
    Durée du run
    1 semaine
    Contrôle qualité
    Un échantillon est vérifié par une personne, et les règles de notation sont écrites avant le run.
    Dès 20 000 €
  • F6

    Transformer toutes les règles UE et luxembourgeoises qui vous concernent en un seul registre.

    Comment l’essaim procède

    Les agents lisent les textes applicables à vos activités et listent chaque obligation avec l’article dont elle découle, son responsable et sa fréquence.

    Volume
    Tous les textes UE et luxembourgeois applicables
    Durée du run
    10 jours
    Contrôle qualité
    Chaque obligation cite son article. Un avocat — le vôtre ou un cabinet de votre choix — valide avant la livraison.
    Dès 30 000 €
  • F8

    Passer au crible 50 000 brevets et articles en cinq jours.

    Comment l’essaim procède

    Les agents lisent chaque document, gardent les passages pertinents pour vos revendications et les classent : votre conseil en lit quelques dizaines, pas des milliers.

    Volume
    ~50 000 brevets et articles
    Durée du run
    5 jours
    Contrôle qualité
    Chaque résultat montre le passage exact. Votre conseil en brevets décide.
    Dès 25 000 €

Ce sont des offres, dimensionnées à partir de nos runs de démonstration. Aucun run flagship n’a encore été livré ; quand ce sera le cas, sa précision mesurée sera publiée ci-dessous.

Preuves venues de la frontière

Ce que de grandes campagnes d’agents ont déjà accompli publiquement, avec les chiffres publiés par les laboratoires.

Résultats publics de laboratoires d’IA — pas des projets de 20 More.

  1. , Anthropic

    Un compilateur C écrit par 16 agents en parallèle

    Une équipe de 16 agents Claude a écrit un compilateur C de 100 000 lignes, en Rust, capable de compiler Linux 6.9 sur x86, ARM et RISC-V.

    16
    agents en parallèle
    ~2 000
    sessions Claude Code
    ~20 000 $
    de coûts d’API

    Réserve: Un projet de recherche des ingénieurs d’Anthropic, pas une livraison client.

    Source: Anthropic Engineering — Building a C compiler with parallel Claudes

  2. , Anthropic

    Project Glasswing : des vulnérabilités dans plus de 1 000 projets open source

    Claude Mythos Preview a analysé plus de 1 000 projets open source. Des sociétés de sécurité indépendantes ont évalué 1 752 des résultats classés élevés ou critiques.

    23 019
    résultats au total
    1 752
    résultats élevés/critiques évalués
    90,6 %
    étaient réels

    Réserve: Les 90,6 % portent sur les 1 752 résultats élevés et critiques évalués de façon indépendante, pas sur les 23 019.

    Source: Anthropic — Project Glasswing: initial update

  3. , Anthropic

    Un nouveau système enzymatique trouvé par une campagne d’environ 950 sessions

    Des agents Claude ont fouillé des données de protéines pendant environ 21 heures et trouvé un système enzymatique inconnu à répétitions de type CRISPR, baptisé ART.

    ~950
    sessions d’agents
    ~21 h
    de recherche
    210 M
    tokens

    Touchez une étape pour voir ce qui s’y est passé.

    Réserve: Des scientifiques ont réalisé tout le travail de laboratoire, et la fonction du nouveau système n’est pas encore connue.

    Source: Anthropic — Claude discovers a novel enzyme system

Nos campagnes

Nos premières études de cas flagship seront publiées ici, avec leur précision mesurée.

Questions sur les runs flagship

Un run flagship, ce sont des milliers d’agents en même temps ?

Non. Ce sont des milliers de tâches d’agents. Au plus une cinquantaine d’agents travaillent en même temps, par lots, jusqu’à ce que chaque tâche soit faite et vérifiée.

Avez-vous déjà livré un run flagship ?

Pas encore. Les runs de cette page sont des offres, dimensionnées à partir de nos runs de démonstration. Les premiers résultats mesurés seront publiés sur cette page.

Comment mesurez-vous la précision ?

Une personne compare un échantillon aléatoire du résultat aux documents sources. Le rapport indique le taux d’erreur constaté et la façon dont l’échantillon a été tiré.

Combien coûte un run flagship ?

Les runs flagship démarrent à 20 000 €, avec un prix fixe convenu après un appel de cadrage. Chaque carte indique son prix de départ.

Où vont nos données ?

Les modèles tournent dans des régions de l’UE (Claude via Amazon Bedrock). Le run peut s’exécuter dans votre propre compte cloud, et nous ne stockons jamais vos mots de passe. Nous signons un accord de traitement RGPD avant tout démarrage.

Cadrer un run flagship

Quatre questions. Nous répondons sous deux jours ouvrés avec ce que ferait le run, sa durée et un prix fixe.

Dès 20 000 €