Projet / Actif
Datalake souverain
Infrastructure data self-hosted pour corpus, API, crawling, qualité et exploitation contrôlée de sources publiques.
Problème
Ce que le projet traite
Les sources publiques utiles sont dispersées, changeantes et difficiles à exploiter sans traçabilité, contrôle qualité et cadre d'usage clair.
Livrable principal
Résultat attendu
Corpus, API, scripts de collecte et contrôles qualité pour sources publiques.
Approche
Méthode
- Collecter uniquement des sources publiques ou autorisées.
- Structurer les données dans une base self-hosted auditable.
- Documenter les pipelines, les limites de fraîcheur et les contrôles qualité.
Sorties
Livrables
- Schéma de données
- Scripts de collecte
- Contrôles qualité
- API ou exports exploitables
Preuves
Éléments vérifiables
Scripts de collecteLocal
Contrôles qualitéPartiel
Documentation d'architectureDisponible
Limites
Limites assumées
- La qualité dépend fortement des sources d'origine.
- Les usages commerciaux nécessitent une vérification juridique dédiée.
- Les données sensibles sont exclues du périmètre public.
Suite
Ce qui reste à renforcer
- Ajouter une fiche architecture visuelle.
- Formaliser les statuts de fraîcheur.
- Publier un exemple de corpus anonymisé.