Prestations

Conception de site web, optimisation du référencement, stratégie websociale… Quelle que soit votre problématique digitale, nous avons les experts et les garanties qu’il vous faut ! Nous consultants vous accompagnent avant, pendant et après la mise en place de votre projet pour un résultat à la hauteur de vos ambitions.

Formations

Organisme reconnu et certifié, Tous les Jeudis met en place des formations personnalisées en fonction de vos attentes. N’hésitez plus à faire appel à nos formateurs pour faire monter en compétence vos équipes sur des thématiques digitales variées.

Tous Les Jeudis

Texte, image, vidéo, développement : les meilleures IA en juillet 2026

Écouter une version audio de cet article

Les classements d’IA se multiplient, mais ils ne mesurent pas tous la même chose et ne désignent surtout pas un vainqueur universel. En juillet 2026, Anthropic domine nettement les usages liés au langage, aux documents et au développement, tandis qu’OpenAI prend l’avantage sur l’image et que Google et ByteDance se partagent la vidéo. Voici une lecture détaillée des résultats publiés par Arena.ai, avec leurs enseignements, mais aussi leurs limites.

Agent : Claude domine, mais GPT et Kimi restent proches

La catégorie Agent mesure la capacité d’une IA à mener une tâche complète en utilisant des outils, des fichiers, le Web ou un environnement informatique, et pas simplement à produire une bonne réponse textuelle. Les trois premières places du classement brut sont occupées par Claude Fable 5 High, Claude Opus 5 Max et Claude Opus 5 High : Anthropic monopolise donc le podium officiel. En regroupant les variantes, notre podium place Claude Fable 5 High en tête, GPT 5.6 Sol xHigh au deuxième rang (quatrième au classement brut) et Kimi K3 Max au troisième (cinquième au classement brut). Claude affiche un « net improvement » de 12,58 %, contre 10,02 % pour GPT et 9,91 % pour Kimi, mais les intervalles d’incertitude se chevauchent suffisamment pour éviter de parler d’une victoire définitive. Kimi se distingue notamment par son taux de réussite confirmé, tandis que GPT obtient de bons résultats dans la récupération après une commande défaillante : derrière la domination numérique de Claude, la compétition reste donc réelle.

Tous Les Jeudis

Texte : sept modèles de Claude devant tout le monde

La catégorie Text couvre la rédaction, le raisonnement, les mathématiques, le code, la créativité, le suivi d’instructions et les conversations classiques avec un modèle de langage. Claude occupe tout simplement les sept premières places du classement brut, avec différentes déclinaisons de Fable et d’Opus. Le podium par famille devient donc Claude Fable 5 avec 1 508 points, Muse Spark 1.1 de Meta avec 1 491 points, huitième modèle au classement, puis Gemini 3.1 Pro Preview avec 1 486 points (dixième modèle). La domination d’Anthropic ne repose pas uniquement sur une variante isolée : plusieurs générations et plusieurs niveaux de raisonnement de Claude se maintiennent devant leurs concurrents. Muse Spark reste toutefois signalé comme préliminaire, tandis que Kimi K3 Max, crédité du même score que Gemini mais classé juste derrière, confirme que les modèles chinois occupent désormais le haut du tableau et ne peuvent plus être traités comme des acteurs secondaires.

Tous Les Jeudis

Text-to-Image : OpenAI largement devant

La catégorie Text-to-Image concerne la création d’une image complète à partir d’un prompt, qu’il s’agisse de photographie, d’illustration, de design commercial, de portrait ou de texte intégré dans un visuel. GPT Image 2 prend la première place avec 1 385 points, devant Reve 2.1 avec 1 302 points et Muse Image de Meta avec 1 280 points. L’avance de plus de 80 points d’OpenAI sur Reve est importante et dépasse largement les marges d’incertitude affichées par Arena. Reve confirme néanmoins sa progression et parvient à devancer les modèles de Meta, Google, Microsoft, ByteDance et xAI, malgré un résultat encore considéré comme préliminaire. OpenAI est donc le leader clair de la génération d’images de ce classement, mais la deuxième place reste plus ouverte, notamment parce que Reve et Muse disposent encore de volumes de votes nettement inférieurs à GPT Image 2.

Tous Les Jeudis

Image Edit : GPT Image 2 confirme son avance

Image Edit évalue ici la modification d’une image unique : ajout ou suppression d’un élément, changement de style, transformation d’une composition, retouche ou adaptation d’un visuel existant. GPT Image 2 domine avec 1 463 points, devant Muse Image de Meta à 1 407 points et MAI Image 2.5 de Microsoft à 1 400 points. L’avance de 56 points d’OpenAI est significative et repose sur plus de 165 000 votes, ce qui rend cette première place plus solide que certains résultats observés dans des catégories plus récentes. Meta et Microsoft sont en revanche séparés par seulement sept points et leurs intervalles se chevauchent : il est plus juste de parler d’une deuxième place partagée que d’une hiérarchie bien établie. Ce classement montre également qu’un bon générateur d’images n’est pas automatiquement un bon outil de retouche, même si GPT Image 2 réussit pour l’instant à dominer les deux usages.

Tous Les Jeudis

Text-to-Video : Google prend la tête

Text-to-Video mesure la capacité d’un modèle à produire une vidéo à partir d’une description écrite, en interprétant le sujet, le mouvement, le cadrage, l’ambiance et la continuité visuelle. Gemini Omni Flash arrive en tête avec 1 527 points, devant Dreamina Seedance 2.0 de ByteDance avec 1 482 points et Muse Video de Meta avec 1 459 points. L’avance de Google est réelle dans les données actuelles, mais son modèle reste préliminaire et n’a recueilli qu’environ 5 400 votes, contre près de 42 000 pour Seedance. La deuxième place de ByteDance repose donc sur un échantillon plus solide, tandis que Muse Video conserve une position crédible malgré un résultat encore provisoire. Sora 2 Pro d’OpenAI n’apparaît qu’en cinquième position avec 1 366 points : sur la vidéo pure, OpenAI ne mène clairement pas la course actuelle.

Tous Les Jeudis

Image-to-Video : trois modèles presque à égalité

La catégorie Image-to-Video consiste à animer une image fixe en créant des mouvements de personnages, d’objets ou de caméra tout en conservant la cohérence du visuel de départ. Dreamina Seedance 2.0 occupe la première place avec 1 474 points, devant Gemini Omni Flash à 1 469 points et Grok Imagine Video 1.5 à 1 466 points. Huit points seulement séparent le premier du troisième, alors que les marges d’incertitude de chaque modèle sont supérieures à cet écart. Il n’existe donc pas, à ce stade, de véritable vainqueur statistique entre ByteDance, Google et xAI. Seedance possède néanmoins l’avantage du volume, avec plus de 81 000 votes, ce qui rend son résultat plus robuste que celui de Gemini Omni Flash, encore préliminaire et évalué sur un échantillon beaucoup plus réduit.

Tous Les Jeudis

Video Edit : ByteDance conserve l’avantage

Video Edit concerne la modification d’une séquence existante à partir d’une consigne : changement de style, transformation d’éléments, adaptation de la scène ou ajout d’effets. Dreamina Seedance 2.0 arrive en tête avec 1 377 points, devant Gemini Omni Flash avec 1 347 points et HappyHorse 1.0 d’Alibaba-ATH avec 1 308 points. Les écarts sont ici plus marqués que dans la catégorie Image-to-Video et les intervalles affichés confortent globalement cet ordre. Il faut toutefois relativiser ce classement, qui ne porte encore que sur sept modèles et environ 21 000 votes au total, dont moins de 1 000 pour Gemini Omni Flash. ByteDance dispose donc d’une avance crédible, mais Video Edit reste une catégorie jeune, avec beaucoup moins de recul que la génération ou l’édition d’images.

Tous Les Jeudis

Vision : Claude devant un classement encore instable

Vision évalue les modèles capables de comprendre une image, une photographie, un graphique, un diagramme, une capture d’écran ou du texte présent dans un visuel. Claude Fable 5 arrive en tête avec 1 318 points, devant Gemini 3.6 Flash, troisième au classement brut avec 1 301 points, puis Muse Spark, septième avec 1 295 points. Les autres places intermédiaires sont occupées par plusieurs variantes de Claude, ce qui confirme une domination globale d’Anthropic plutôt qu’un simple succès isolé de Fable 5. La deuxième position de Gemini doit toutefois être prise avec beaucoup de recul : son score est fondé sur seulement 238 votes et son intervalle d’incertitude est si large que son rang potentiel s’étend de la première à la trente-et-unième place. Claude apparaît donc comme le seul leader réellement établi, tandis que l’ordre entre Gemini, Muse, GPT et les autres concurrents reste trop mouvant pour être considéré comme définitif.

Tous Les Jeudis

Document : Anthropic occupe les six premières places

La catégorie Document mesure la compréhension de PDF et de contenus longs, l’extraction d’informations, la synthèse, la comparaison de passages et le raisonnement sur plusieurs pages. Les six premières positions du classement brut sont occupées par des variantes de Claude, avant GPT 5.5 High à la septième place. Notre podium retient donc Claude Opus 5 High avec 1 520 points, GPT 5.5 High avec 1 485 points et Muse Spark 1.1, treizième modèle au classement général de la catégorie, avec 1 472 points. Le premier modèle Claude ne dispose encore que de 1 663 votes, mais la présence de six variantes Anthropic en tête donne davantage de poids à la tendance générale. GPT constitue le premier concurrent crédible et mieux documenté en volume, tandis que la troisième place de Muse Spark reste préliminaire et trop proche de plusieurs modèles Google, xAI ou Kimi pour être considérée comme durable.

Tous Les Jeudis

Search : Claude et GPT prennent leurs distances

Search compare les modèles capables d’accéder au Web, de rechercher des informations récentes, de croiser plusieurs sources et de produire une réponse documentée. Claude Opus 4.6 Search arrive en tête avec 1 253 points, devant GPT 5.5 Search avec 1 240 points, tandis qu’Ernie 5.1 de Baidu complète notre podium à la cinquième place du classement brut avec 1 226 points. Deux autres modèles Claude occupent les troisième et quatrième positions, ce qui renforce encore la domination d’Anthropic dans cette catégorie. Les 13 points séparant Claude et GPT représentent un avantage limité mais relativement cohérent au regard de leurs marges d’incertitude et de leurs volumes respectifs de plus de 100 000 et 67 000 votes. Ernie reste plus difficile à juger, car son score est préliminaire et repose sur moins de 4 000 votes ; Gemini, septième au classement brut, demeure donc suffisamment proche pour remettre en cause cette troisième place lors d’une prochaine mise à jour.

Tous Les Jeudis

WebDev : Claude devant Kimi et GPT

WebDev évalue la capacité des modèles à construire des interfaces, des sites et des applications web, avec du code réellement exécutable et parfois plusieurs étapes de travail. Claude Opus 5 Max prend la première place avec 1 712 points, devant Kimi K3 Max avec 1 682 points, tandis que GPT 5.6 Sol xHigh arrive cinquième au classement brut et complète notre podium avec 1 623 points. Entre Kimi et GPT viennent encore deux modèles Anthropic, Claude Opus 5 High et Claude Fable 5, ce qui donne à Anthropic trois représentants parmi les quatre premiers. Les scores de Claude Opus 5 Max et de Kimi K3 Max sont encore préliminaires et reposent sur moins de votes que plusieurs modèles plus anciens : leur ordre précis doit donc être surveillé dans les prochaines éditions. Le signal reste néanmoins clair : pour créer une application web complète, Claude mène actuellement le classement, Kimi se pose en concurrent direct et GPT conserve une place solide grâce à son environnement Codex.

Tous Les Jeudis

Image-to-WebDev : un avantage très net pour Claude

Image-to-WebDev mesure la capacité à transformer une capture d’écran, une maquette ou un visuel de référence en interface web fonctionnelle. Claude occupe les sept premières positions du classement brut, avant GPT 5.5 xHigh à la huitième place et Gemini 3.6 Flash à la neuvième. Notre podium retient donc Claude Fable 5 avec 1 626 points, GPT 5.5 xHigh avec 1 527 points et Gemini 3.6 Flash avec 1 525 points. L’écart de près de 100 points entre Claude et GPT est suffisamment important pour constituer l’un des avantages les plus nets observés dans les différentes catégories. En revanche, GPT et Gemini sont pratiquement à égalité, et le score très préliminaire de Gemini, assorti d’un intervalle d’incertitude particulièrement large, ne permet pas encore de les départager sérieusement.

Tous Les Jeudis

Ce qu’il faut retenir du classement de juillet 2026

Il n’existe pas une IA qui gagne partout. Anthropic est actuellement la référence la plus régulière pour le texte, les agents, la vision, les documents, la recherche et le développement web, avec parfois plusieurs variantes de Claude placées avant le premier concurrent. OpenAI est moins présent dans le haut des classements textuels, mais domine clairement la génération et l’édition d’images avec GPT Image 2. Sur la vidéo, Google et ByteDance occupent le terrain, tandis que Meta installe progressivement ses modèles Muse dans presque toutes les modalités. Enfin, la multiplication des résultats préliminaires rappelle qu’un classement Arena est une photographie du rapport de force à un instant donné, pas une vérité définitive sur les capacités d’un modèle.

Vous souhaitez aller au-delà des classements et choisir les IA réellement adaptées à vos usages ? Nos formations IA sur mesure vous permettront de comprendre, comparer et utiliser efficacement les principaux outils d’IA générative.

Note méthodologique : Arena, anciennement LMArena, est une plateforme communautaire créée par des chercheurs issus de l’Université de Californie à Berkeley afin d’évaluer les modèles d’IA dans des situations réelles. Dans le mode Battle, deux modèles anonymes répondent à la même demande et l’utilisateur choisit sa réponse préférée ; seules les évaluations effectuées avant la révélation de leur identité alimentent les classements officiels. Les votes sont agrégés avec le modèle statistique Bradley-Terry, accompagné d’intervalles d’incertitude ; un score préliminaire ou fondé sur peu de votes doit donc être interprété avec prudence. La catégorie Agent suit une méthodologie différente, appelée « causal tracing », qui combine notamment réussite confirmée, réactions positives ou négatives, capacité à intégrer les corrections, récupération après une erreur et hallucination d’outils.

Partager cet article

Actualités

Texte, image, vidéo, développement : les meilleures IA en juillet 2026

En juillet 2026, Anthropic domine nettement les usages liés au langage, aux documents et au développement, tandis qu’OpenAI prend l’avantage sur l’image et que Google et ByteDance se partagent la…

Le 7 juillet 2026, l’Europe a posé de nouvelles règles sur vos prompts

Le 7 juillet 2026, le CEPD a publié ses lignes directrices sur la collecte de données pour l'IA générative. Quel impact pour un usage responsable ?

Dès le 2 août 2026, vos contenus IA devront porter une étiquette…

Dès le 2 août 2026, l'AI Act impose l'étiquetage des contenus générés par IA. Ce que cela change pour les équipes qui produisent texte, image, audio et vidéo.

23 septembre 2026, la date qui rebat les cartes du SEO en France

Google déploiera l'IA Overview en France avant le 23/09/26. Ce que ce chiffre change pour le SEO et comment s'y préparer ?

65% des chefs de projet utiliseraient déjà l’IA

Le Baromètre PMI France 2026 révèle que 65% des chefs de projet utilisent l'IA, mais que la réussite des projets reste avant tout une affaire humaine.

AI Act et recrutement : ce qui change au 2 août 2026

Le recrutement par IA passe en haut risque le 2 août 2026. Obligations, sanctions et ce que les entreprises doivent anticiper dès maintenant.

NEWSLETTER

Inscrivez-vous et recevez tous les jeudis, la newsletter de Tous Les Jeudis !