Le 22 septembre 2026, OpenRouter, la plateforme d'agrégation d'API de modèles IA, a annoncé sur son blog officiel le lancement de la Batch API : on regroupe un ensemble de requêtes et on les soumet ensemble, le fournisseur planifiant l'exécution dans une fenêtre de 24 heures — en échange, le prix tombe généralement à 50 % des tarifs standard au token, et parfois moins. Plus de 70 modèles sont pris en charge dès le premier jour.
Ce que coûte la moitié du prix : la certitude
Le marché de base de la Batch API est limpide : vous renoncez au « résultat immédiat », le fournisseur gagne la liberté de planifier hors pointe. On l'appelle en envoyant en POST une liste de requêtes à api/v1/batches avec la forme d'endpoint voulue — chat completions, responses, messages et embeddings sont tous pris en charge. Après soumission, on interroge le statut du lot jusqu'à completed, failed, expired ou cancelled, les résultats revenant en ligne.
L'idée reprend celle de la Batch API d'OpenAI, avec deux différences chez OpenRouter : premièrement, le routage choisit par défaut l'« endpoint de lot le moins cher compte tenu de votre liste d'autorisation, de votre politique de données et de vos paramètres BYOK », chaque lot restant attaché à un seul fournisseur ; deuxièmement, le résultat de chaque requête revient indépendamment, quelques lignes défectueuses ne coulent jamais tout le travail. Entrées et résultats sont conservés 30 jours et peuvent être supprimés à tout moment via DELETE.
Deux semaines de bêta : plus rapide que prévu, mais l'heure compte
OpenRouter a publié les données de plus de 230 000 lots sur deux semaines de bêta : la médiane est de 7 minutes jusqu'à achèvement, 90 % terminés en moins d'une heure. Autrement dit, on n'attend presque jamais près de 24 heures.
Mais l'heure de soumission joue nettement : les lots soumis entre 5 h et midi, heure du Pacifique, sont sensiblement plus lents, le dixième le plus lent prenant de 2 à 4,5 heures ; aux autres heures, le 90e percentile tombe sous 1,1 heure, et après 18 h heure du Pacifique, sous 50 minutes. La taille du lot joue moins : les lots de plus de 1 000 requêtes se terminent avec une médiane de 12 à 21 minutes.
Quelles charges de travail conviennent, lesquelles non
Conviennent : l'étiquetage de corpus, le remplissage d'embeddings, la notation de jeux d'évaluation, le résumé d'arriérés de tickets, le même prompt appliqué à des milliers de lignes — toute charge de travail qui « peut attendre une nuit ».
Ne conviennent pas : le chat en temps réel, les tâches nécessitant de l'audio ou de la vidéo (non pris en charge en lot pour l'instant), les requêtes dépendant du plugin de recherche web d'OpenRouter (les appels de recherche sont facturés au tarif standard, et le plugin ne gère pas les lots) ; les entrées image et fichier doivent être des URL publiques.
Ce que cela change pour les structures de coûts API
La Batch API fait officiellement de la « latence » une marchandise négociable. Pour les développeurs indépendants et les petites équipes, les évaluations et le traitement de données autrefois trop chers à grande échelle disposent désormais d'un canal officiel à moitié prix fixe. Le coût est un changement de flux de travail : soumettre — interroger — collecter les résultats, au lieu d'un unique aller-retour requête-réponse. Les équipes qui acceptent cette réécriture verront leur facture d'inférence divisée par deux.