Tout développeur ayant confié des tâches à un agent d'intelligence artificielle a déjà vécu ce moment de frustration. L’assistant IA annonce fièrement que l’implémentation est achevée, que tous les tests unitaires sont au vert et que le code est prêt à être fusionné. Pourtant, en ouvrant l’application, le constat est immédiat : un bouton ne répond pas, la mise en page est décalée ou une interface s’affiche à moitié traduite. L’agent n’a pas menti, il n’a simplement jamais regardé le rendu réel de son code. C’est précisément pour combler ce fossé entre le code généré et son exécution réelle que le projet ProofRun a été conçu.

ProofRun transforme la façon dont les agents IA valident leur travail en remplaçant la supposition par la preuve concrète. Plutôt que de se limiter à l'exécution de scripts de tests classiques, l'outil incite l'agent à lancer réellement l'application dans son environnement cible, qu'il s'agisse d'un navigateur web, d'un simulateur iOS ou d'un émulateur Android.

L'agent prend en charge la navigation dans l'interface, clique, fait défiler les vues et lance des captures d'écran à chaque étape clé. Il évalue ensuite le comportement observé par rapport aux critères d'acceptation définis dans le cahier des charges. À l'issue de cette session, ProofRun compile un rapport HTML interactif complet, faisant office de véritable reçu de vérification visuel et logique.

Une philosophie assumée - L'agent est intelligent, l'outil reste simple

L'approche ici est d'inverser la complexité des outils traditionnels. Dans l'écosystème classique de tests automatisés, les frameworks doivent être ardus pour compenser la rigidité des scripts de test. ProofRun fait le pari inverse en exploitant l'intelligence multimodale déjà présente dans les modèles d'IA récents.

L'agent sait analyser une image, comprendre ce que doit afficher une interface et déterminer si un critère est validé ou non. Il n'a donc pas besoin de réinventer l'analyse d'interface ou la logique de décision. Il agit comme un coffre-fort de preuves neutre et fiable. Il gère le verrouillage des simulateurs pour éviter les conflits d'exécution, horodate les actions, compile les captures d'écran et orchestre la boucle de rétroaction avec l'humain.

Une boucle de rétroaction fluide et sans friction

Le flux de travail est intégré de manière ergonomique. Une fois la vérification terminée, ProofRun héberge en local le rapport d'exécution et ouvre la page dans votre navigateur. Chaque critère y apparaît avec son statut, les captures d'écran associées et le déroulé détaillé des étapes suivies par l'agent.

Vous n'avez plus besoin de copier-coller manuellement des retours dans la fenêtre de chat. Il peut valider, rejeter des critères ou laisser des commentaires directement dans l'interface du rapport. Dès que le retour est soumis, ProofRun en notifie l'agent localement, permettant à ce dernier de reprendre la main, de corriger les anomalies constatées et de relancer une nouvelle passe de vérification sans intervention manuelle supplémentaire.

Vers une autonomie vérifiable du code généré par IA

Inspiré notamment par des initiatives comme Showboat de Simon Willison, ProofRun illustre une évolution nécessaire dans le développement assisté par IA. À mesure que les agents gagnent en autonomie, la confiance ne peut reposer uniquement sur des affirmations textuelles dans un terminal.

En obligeant l'agent à manipuler l'application comme le ferait un utilisateur humain et à documenter visuellement ses réussites ou ses échecs, il pose les bases d'un développement plus rigoureux, où chaque modification est accompagnée de sa preuve concrète avant même la revue humaine finale.