Datalake souverain
Infrastructure data self-hosted pour corpus, API, crawling, qualité et exploitation contrôlée de sources publiques.
Problème
Ce que le projet traite
Les sources publiques utiles sont dispersées, changeantes et difficiles à exploiter sans traçabilité, contrôle qualité et cadre d'usage clair.
Livrable principal
Résultat attendu
Corpus, API, scripts de collecte et contrôles qualité pour sources publiques.
Approche
Méthode
- Collecter uniquement des sources publiques ou autorisées.
- Structurer les données dans une base self-hosted auditable.
- Documenter les pipelines, les limites de fraîcheur et les contrôles qualité.
Sorties
Livrables
- Schéma de données
- Scripts de collecte
- Contrôles qualité
- API ou exports exploitables
Preuves
Éléments vérifiables
Scripts de collecteLocal
Contrôles qualitéPartiel
Documentation d'architectureDisponible
Dépôt associé
Activité technique vérifiable
La date d'activité affichée provient du dernier commit du dépôt local associé au projet au moment du build.
Consulter le dépôt publicLimites
Limites assumées
- La qualité dépend fortement des sources d'origine.
- Les usages commerciaux nécessitent une vérification juridique dédiée.
- Les données sensibles sont exclues du périmètre public.
Suite
Ce qui reste à renforcer
- Ajouter une fiche architecture visuelle.
- Formaliser les statuts de fraîcheur.
- Publier un exemple de corpus anonymisé.