ForHosting KIT · Audio et voix

Qui parle, et quand ?

La séparation des locuteurs, ou diarisation, analyse un enregistrement à plusieurs voix et attribue chaque passage à un intervenant distinct. Au lieu d’un bloc de texte anonyme, vous obtenez un dialogue balisé : qui parle, et à quel moment. Utile dès qu’une réunion, une table ronde ou un entretien croise plusieurs personnes.

● Betapar requête + par minute$0.002
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Ce que fait la diarisation

L’outil ne se contente pas de transcrire : il distingue les voix et marque les tours de parole. Le résultat ressemble à un script, avec un intervenant identifié devant chaque réplique — Intervenant 1, Intervenant 2, et ainsi de suite. Les étiquettes sont neutres : l’outil sépare les voix mais ne devine pas les identités, que vous remplacez ensuite par les vrais noms si besoin. Vous passez ainsi d’un magma de paroles à un échange lisible, attribué ligne par ligne.

Une fonction en bêta

Cette capacité est proposée en bêta. Elle donne de bons résultats sur un enregistrement clair où les intervenants se coupent peu la parole, mais peut hésiter quand deux voix se chevauchent, quand le fond est bruyant, ou quand un participant reste très en retrait du micro. Nous préférons le dire franchement : relisez l’attribution des tours de parole avant de vous appuyer dessus, surtout si le compte rendu doit servir de référence officielle.

Quand elle est le plus utile

La séparation des voix prend tout son sens sur les réunions à plusieurs, les entretiens d’embauche, les tables rondes ou les réunions de copropriété, où savoir qui a dit quoi change tout. Sur un enregistrement à une seule voix — un mémo, un cours magistral — une transcription simple suffit et coûte moins cher. Réservez la diarisation aux situations où plusieurs personnes se partagent réellement la parole autour du même micro.

Ce que le fichier accepte

Formats audio courants et piste vidéo, jusqu’à 200 Mo et 180 min. Pour une captation plus longue, découpez-la avant l’envoi, en gardant à l’esprit que chaque partie sera analysée indépendamment des autres. Les numéros d’intervenants repartent donc de zéro d’une tranche à l’autre : à vous de raccorder les identités si vous traitez un enregistrement en plusieurs morceaux, par exemple en gardant un court chevauchement entre les segments.

Réunion à plusieurs voix

Studio Lumen SAS transcrit un atelier de cinq personnes et obtient un texte où chaque prise de parole est rattachée à son auteur, prêt à devenir un relevé de décisions.

Entretien d’embauche

Un recruteur relit l’échange en distinguant nettement ses questions des réponses du candidat, sans confusion sur qui a dit quoi.

Table ronde enregistrée

Nadia Benali prépare un article à partir d’un débat à quatre voix : les répliques séparées lui permettent d’attribuer chaque citation à la bonne personne.

Réunion de copropriété

Le secrétaire de séance distingue les interventions des copropriétaires pour rédiger un procès-verbal fidèle aux échanges.

L’outil reconnaît-il l’identité réelle des intervenants ?

Non. Il sépare les voix et les nomme de façon neutre — Intervenant 1, Intervenant 2 — sans prétendre savoir qui est qui. Vous remplacez ensuite ces étiquettes par les vrais noms.

Pourquoi cette fonction est-elle en bêta ?

La séparation des voix reste délicate quand les intervenants se chevauchent ou que le son est chargé. Nous la proposons dès maintenant, mais recommandons de vérifier l’attribution des répliques plutôt que de la tenir pour acquise.

Combien de voix peut-on distinguer ?

Plusieurs intervenants sont gérés. La distinction est d’autant plus fiable que chacun parle à son tour, près du micro et dans un environnement calme.

À combien revient la séparation des voix ?

Le service coûte $0.002 par requête et $0.0055 par minute d’audio, en dollars US, calculé sur la durée réelle de l’enregistrement, sans abonnement.

Que devient mon enregistrement après la séparation des voix ?

Il est transmis de façon chiffrée, traité le temps de produire le texte, puis supprimé de nos serveurs. Aucune empreinte vocale n’est conservée.

Un compte est-il requis pour séparer les voix ?

Il n'y a pas d'offre gratuite — les paliers gratuits sont détournés et ralentissent tout le monde. L'accès fonctionne avec un solde prépayé ForHosting KIT : rechargez à partir de $10.00 (il n'expire jamais) et chaque requête est facturée à son prix publié, donc un appel sans solde renvoie HTTP 402. Pas d'abonnement, pas de jetons, pas de crédits inventés, et une tâche en échec n'est jamais facturée.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/audio/diarize

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002
par minute$0.0055

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_mb200
max_minutes180
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →