Aller au contenu principal
Retour aux integrations
Cloud

Groq

Groq est un fournisseur d’inférence dans le cloud qui exécute des modèles open source répandus (Llama, Mixtral, Gemma, Whisper et d’autres) sur son matériel LPU (Language Processing Unit). Résultat : des vitesses d’inférence souvent 10 à 100 fois supérieures à celles des fournisseurs sur GPU, idéal pour les applications sensibles à la latence.

Fonctionnalites et capacites

Vitesse d’inférence extrême
Matériel LPU
Prise en charge de Llama 3 / Mixtral / Gemma
Faible latence
API compatible OpenAI
Transcription audio (Whisper)

🎯 Idéal pour les agents à faible latence, les chatbots en temps réel et les applications où la vitesse de réponse est déterminante.

Avantages

  • Inférence la plus rapide disponible
  • Palier gratuit
  • Compatible OpenAI
  • Plusieurs modèles
  • Parfait pour le chat en temps réel

Inconvenients

  • Pas de modèles propriétaires
  • Fenêtre de contexte limitée
  • Limites de débit sur le palier gratuit
  • Dépendant de la disponibilité de Groq

💰 Tarifs

Palier gratuit généreux. Formules payantes à partir d’environ 0,05 $ par million de tokens selon le modèle. Voir groq.com.

Essayer nos agents

Parcourir les agents