Doc Extract
Doc Extract combine une pipeline OCR haute fidélité avec des modèles de langage spécialisés pour extraire automatiquement les informations clés de vos documents. Le service prend en charge les factures (lignes, montants, TVA), les CV (compétences, expériences, formations), les pièces d'identité (nom, date de naissance, numéro) et les attestations (dates, signataires, références). Les données extraites sont retournées en JSON structuré, prêt à être intégré dans votre système d'information.
Comment ça marche
Upload du document
Envoyez votre fichier PDF, image ou DOCX via l'API REST. Le service détecte automatiquement le type de document.
OCR et pré-traitement
Le document est analysé par notre pipeline OCR qui corrige l'orientation, améliore le contraste et extrait le texte brut.
Extraction LLM
Un modèle de langage spécialisé analyse le texte extrait et identifie les champs pertinents selon le type de document détecté.
Données structurées
Les données extraites sont retournées en JSON structuré avec un score de confiance par champ, prêt pour l'intégration.
Exemple d'appel API
import httpx
response = httpx.post(
class="text-teal">"https:class="text-text-faint italicclass="text-teal">">//api.djinn.dev/v1/extract",
headers={class="text-teal">"X-API-Key": class="text-teal">"djinn_live_..."},
files={class="text-teal">"file": open(class="text-teal">"facture.pdf", class="text-teal">"rb")},
data={class="text-teal">"document_type": class="text-teal">"invoice"},
)
result = response.json()
print(fclass="text-teal">"Fournisseur: {result['vendor_name']}")
print(fclass="text-teal">"Total TTC: {result['total_ttc']} EUR")
print(fclass="text-teal">"Confiance: {result['confidence']:.0%}")
for line in result[class="text-teal">"lines"]:
print(fclass="text-teal">" - {line['description']}: {line['amount']} EUR")Spécifications techniques
Prêt à intégrer ce service ?
Testez l'API gratuitement avec 1 000 appels offerts. Intégration en quelques minutes.