
Commençons par le montage, parce que c'est là que ça a dérapé. J'ai pris le prompt exact qui fait tourner notre démo Brand Voice sur la landing page, celle qui lit quelques-uns de tes posts et en écrit un nouveau dans ta voix, et je l'ai passé dans trois modèles : le Sonnet 4.6 de Claude (celui qu'on fait tourner en production), DeepSeek et GLM. Six échantillons de voix différents, chacun deux fois, chaque sortie anonymisée notée par un juge à l'aveugle. La question avait un vrai enjeu financier : un modèle moins cher pouvait-il faire ce boulot aussi bien que Sonnet, voire mieux ?
Je l'ai lancé de trois façons, et les trois passes se sont contredites si complètement que "quel modèle" s'est révélé être la mauvaise question. Manche par manche.
Manche 1 : changer juste le nom du modèle
C'est le test que la plupart des gens font vraiment. Mêmes réglages qu'en production, juste un nom de modèle différent.
| Modèle | JSON valide | Latence | Coût/génération |
|---|---|---|---|
| Sonnet 4.6 | 12/12 | 7,9 s | 0,0079 $ |
| DeepSeek | 4/12 | 22,7 s | 0,0013 $ |
| GLM | 0/12 | 26,7 s | 0,0041 $ |
GLM a produit zéro sortie utilisable. DeepSeek en a produit quatre. Pas parce que ce sont de mauvais modèles, mais parce que tous les deux raisonnent d'abord : sous le budget de tokens de production, ils réfléchissent à voix haute ("1. Analysons les posts...") et tombent à court de place avant de cracher le JSON dont la page a besoin. Le remplacement naïf ne te donne pas une démo moins bonne. Il te donne une démo cassée. Si je m'étais contenté d'un test ponctuel sur deux sorties, je l'aurais appris par les utilisateurs plutôt que par moi-même.
Manche 2 : leur laisser de la place
Mêmes modèles, mais avec le mode JSON activé et un budget de tokens plus large, pour que les modèles à raisonnement puissent aller au bout de leur réflexion.
| Modèle | JSON valide | Latence | Note du juge |
|---|---|---|---|
| Sonnet 4.6 | 12/12 | 7,7 s | 3,37 |
| DeepSeek | 11/12 | 43 s | 4,33 |
| GLM | 12/12 | 44 s | 4,73 |
Le tableau s'inverse. Une fois qu'ils ont la place de finir, les deux challengers crachent du JSON valide, et le juge note leur fidélité à la voix au niveau de Sonnet ou au-dessus. Donc les modèles eux-mêmes n'ont jamais été le problème ; c'était le premier test qui l'était. Mais regarde la latence. Plus de quarante secondes. Personne n'attend 44 secondes pour une démo de landing page. Sortie excellente, fonctionnalité inutilisable.
Manche 3 : la version que tu mettrais vraiment en prod
Mode JSON activé, raisonnement coupé, DeepSeek sur son endpoint rapide.
| Modèle | JSON valide | Latence | Coût/génération | Note du juge |
|---|---|---|---|---|
| Sonnet 4.6 | 12/12 | 8,7 s | 0,0079 $ | 3,17 |
| DeepSeek (rapide) | 12/12 | 2,8 s | 0,00019 $ | 4,10 |
| GLM (no-think) | 12/12 | 9,0 s | 0,0017 $ | 4,77 |
Avec la bonne tuyauterie, les deux deviennent vraiment viables. L'endpoint rapide de DeepSeek a répondu en 2,8 secondes, plus vite que Sonnet, à environ un cinquantième du coût, avec du JSON valide à chaque fois. GLM a égalé la vitesse de Sonnet à un cinquième du coût et a décroché la meilleure note du juge. Les échantillons ont confirmé les chiffres. GLM a parfaitement réussi la signature d'une créatrice ("currently romanticizing my overpriced matcha, and I will not be taking questions"), et les échantillons bilingues sont revenus correctement en italien sur les trois modèles.
Ce que j'ai vraiment appris
Le modèle était la variable la moins intéressante. Les trois mêmes modèles sont passés de cassés à meilleurs que l'existant sans qu'on change le modèle du tout, juste la tuyauterie autour. Le budget de tokens, le mode JSON et le fait que le raisonnement soit activé ou non comptaient plus que le labo qui avait entraîné le truc. Tout l'exercice m'a rappelé que "passe juste au modèle moins cher" est une phrase qui cache toute l'ingénierie réelle.
Une réserve, parce que le juge n'était pas parfait non plus. Il a bien repéré que Sonnet enveloppe son JSON dans des balises markdown, ce qui est réel et la raison pour laquelle la production a un nettoyeur de balises. Mais il a aussi halluciné des infractions de tirets cadratins dans des sorties qui n'en contenaient aucun. Du coup je fais plus confiance aux échantillons regardés à l'œil qu'aux scores décimaux exacts. La direction est solide ; la troisième décimale, non.
La décision pratique ? Pour cette seule démo, la dépense est minuscule, donc Sonnet reste le choix par défaut sûr et l'endpoint rapide de DeepSeek est la mise à niveau vers laquelle je me tournerais en premier. De toute façon, les vraies économies ne sont pas là. Elles sont dans les fonctionnalités à fort volume qui tournent des milliers de fois par jour, où 50 fois moins cher cesse d'être une erreur d'arrondi. C'est le test qui vaut le coup d'être lancé ensuite.
Si tu ne retiens qu'une chose : avant de changer de modèle pour économiser, fais-le passer par la tuyauterie exacte dans laquelle il va vivre. Le modèle que tu crois tester n'est pas celui que tes utilisateurs reçoivent.