Le SWE-bench 2026 : 72% des tâches réelles résolues
Le SWE-bench évalue les modèles sur des issues GitHub réelles et ouvertes — pas des exercices synthétiques. Mi-2026, les meilleurs agents (Claude 4 Opus + Cursor, o3-pro + Copilot Workspace) résolvent 72% des issues "hard", contre 38% début 2025. Ce n'est pas une amélioration marginale — c'est un changement de catégorie.
Les données d'entreprises : 3-4× de productivité documentée
Stripe (3,2×), Figma (2,8×), GitHub (3,5×) et Shopify (2,6×) ont tous publié des données Q2 2026 vs Q2 2025 avec des effectifs stables. La boucle agent (exécution → erreurs → correction → tests) remplace le cycle humain pour les tâches d'implémentation standard. Le développeur passe à la review et à l'architecture.
L'impact structurel sur le marché du travail
Offres junior -34% aux US (LinkedIn Economic Graph, juillet 2026). Offres "AI Engineer" +210%. YC : 3,2 ingénieurs médiane dans les batches 2026 vs 7,8 en 2022. La restructuration est en cours — plus de cerveaux pilotant des agents, moins de mains exécutant des tâches.
Ce que ça change pour les fondateurs
Une équipe de 5 seniors avec agents peut construire ce qu'il fallait 25 ingénieurs en 2023. Le capital humain reste central — mais sa forme change. L'avantage concurrentiel est désormais dans la vision produit et l'architecture, pas dans la capacité d'exécution brute.