Brief IA : Meta : Muse gère permissions et activités, Warp annonce des PR en 35 min

Meta : Muse gère permissions et activités, Warp annonce des PR en 35 min

Brief IA
Tom Levy·4 min·7 vues

Warp annonce qu'il génère une pull request en 35 minutes, avec une première revue humaine intervenant 3,5 heures plus tard, soulignant un goulet d'étranglement dans son processus d'ingénierie. De son côté, Muse, l'agent personnel de Meta, fournit un fil d'activité détaillé pour chaque tâche, mais a échoué à finaliser un achat via le navigateur, illustrant les limites actuelles des agents grand public.

En bref
1Warp affirme générer une pull request en 35 minutes, la première revue humaine intervenant 3,5 heures plus tard.
2Muse fournit un fil d’activité détaillant outils, scripts, recherches et étapes pour chaque tâche.
3Muse a échoué à acheter des New Balance 9060 d’une couleur précise via le navigateur.
💡Pourquoi c'est importantCes démonstrations confrontent un agent grand public et une usine logicielle sur des processus concrets, en mettant en avant des métriques d’exécution et des choix de conception autour des permissions et de la transparence.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Un test utilisateur détaille comment Muse, l’agent personnel de Meta, gère rendez-vous, briefings familiaux et objectifs tout en cadrant finement les permissions. En parallèle, Warp met en scène ses « usines » capables de transformer une demande Slack en pull request, qu’il dit prête en 35 minutes, avec une revue humaine qui arrive des heures plus tard. Deux visions de l’IA, grand public et ingénierie, se rencontrent sur la transparence, les limites du navigateur et des métriques très concrètes.

Chez Warp, la revue humaine arrive 3,5 h après une PR générée en 35 min

Warp indique que les humains chargés de la revue de code constituent désormais le principal goulet d’étranglement dans son processus d’ingénierie. Selon l’entreprise, la première révision humaine intervient en moyenne 3,5 heures après la création d’une pull request, tandis que l’usine Wilson met 35 minutes pour passer du lancement à la PR. Du côté grand public, Claire considère que l’usage du navigateur reste le point faible des agents, citant l’exemple où Muse n’a pas réussi à acheter des New Balance 9060 d’une couleur précise, renvoyant des résultats incorrects et ne finalisant pas l’achat.

Permissions contextuelles et journal d’activité détaillé au cœur de Muse

Claire explique que Muse demande l’autorisation précisément lorsque l’accès s’avère nécessaire, valide les informations obtenues et sollicite une confirmation supplémentaire avant toute action. L’agent ne requiert pas d’emblée un accès total et ne bombarde pas l’utilisateur de requêtes d’approbation répétées. Claire estime que la manière de demander la permission compte autant que ce que l’agent peut faire une fois l’accès accordé. Muse fournit un fil d’activité qui enregistre les appels d’outils, scripts, recherches et étapes individuelles. Claire pense que la plupart des consommateurs ignoreront ce fil, mais que les développeurs et utilisateurs avancés y trouveront une grande valeur. Lors de son test, Muse ne l’a ni exposée à un terminal, ni confrontée à des erreurs confuses, ni sollicitée au mauvais moment.

Du Slack à la fusion : Wilson enchaîne tickets Linear, QA et PR sans clavier

Zach Lloyd démontre que Warp Factories transforme une requête envoyée sur Slack en une pull request qui sera ensuite suivie, testée et fusionnée. L’usine Wilson gère l’ensemble du processus : triage, ouverture de tickets Linear, développement, génération de pull requests, vérification informatique (QA) et fusion, tout cela sans qu’aucune saisie au clavier ne soit nécessaire de la part d’un humain. Warp indique qu’une première pull request peut être disponible en 35 minutes et que ses usines traitent 2 000 pull requests chaque mois. Pour les usages domestiques, Muse a, dès la première tentative, généré le meilleur briefing familial de Claire, sous forme de PDF plus soigné et structuré, avec une section « Parler à la table » et la détection proactive des conflits d’agenda. Pour les objectifs personnels, Muse a collecté du contexte sur plusieurs échanges, créé un rappel et traité l’objectif comme un suivi continu.

Mesurer et améliorer : juge IA, rejouage de tâches et Pareto chez Warp

Warp propose de suivre les interactions humaines par pull request comme indicateur d’efficacité d’une usine, et présente l’usine comme couvrant l’ensemble du cycle de développement dans le cloud. Selon l’entreprise, le modèle de référence le plus pertinent provient des réalisations antérieures de l’organisation plutôt que des classements publics. Elle répète l’exécution de tâches d’usine réelles avec diverses configurations de modèles, les soumet à la même méthode d’évaluation utilisée en production et positionne les compromis entre coût et qualité sur un diagramme de Pareto. Warp précise également que les usines progressent lorsque leur configuration est intégrée au code : une boucle d’apprentissage rassemble les exécutions ayant échoué jusqu’à dégager un motif récurrent. Une couche de notation et un juge IA évaluent chaque exécution sur plusieurs dimensions, dont la création de tests redondants.

Design grand public de Muse et usages métiers parallèles chez Warp

Claire considère que l’originalité de Muse pour un public non technique résulte de l’expérience en design acquise chez Meta. L’agent privilégie un langage accessible et évite des termes spécialisés comme crons, outils, artefacts, plugins et connecteurs, structurant l’interface autour d’un fil, d’idées, d’objectifs et d’une bibliothèque. Elle mentionne également un avatar animé conçu pour l’IA, qui utilise un petit ordinateur pour exécuter des tâches et une sphère pour générer des médias. En entreprise, Zach Lloyd précise que l’IA apporte davantage de valeur en dehors de l’ingénierie lorsqu’elle accède à des données métiers concrètes, et il montre en temps réel trois tâches réalisées simultanément pour repérer des questions clients et des priorités concernant le site et le support commercial. Warp souligne aussi que les tâches Wilson s’effectuent dans un canal Slack partagé, ce qui permet aux collaborateurs juniors d’apprendre en observant les utilisateurs aguerris, sans avoir besoin d’un programme de formation structuré.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires