Pipelines ETL sécurisés, extraction et linéarisation SNDS, modèles de machine learning et traitement du langage naturel clinique.
Nous construisons des pipelines robustes, scalables et sécurisés pour extraire, transformer et analyser les données de santé.
Pipeline ETL propriétaire en Spark/Scala. 3 étapes : conversion SNDS en Parquet, nettoyage via WikiPipeline, extraction par entités (CCAM, CIM-10, LPP, Médicaments, Patients, Consultations, ALD, GHM). V2 médico-économique pour la valorisation des parcours.
11 jobs spécialisés en Spark/Scala : variables de parcours de soins, hospitalisations, médicaments, exposition DDD, polypharmacie, consommation de ressources, arrêts de travail et coûts. 100% de couverture de tests.
Algorithmes de classification, régression, clustering. Phénotypage automatique de pathologies complexes par deep learning.
Détection automatique d'anomalies dans les jeux de données. Validation des règles métier, cohérence temporelle et complétude des variables.
Analyse automatique de la qualité des données de registres avant traitement.
Moteur commun avec fonctions de base + fonctions spécifiques par registre. Développé en Python avec couverture de tests.
Prise en charge de fichiers Excel et fichiers de spécification. Production d'une base registre normalisée (1 ligne par patient, 1 colonne par variable brute).
Conteneurisation Docker, versionnage GitLab, intégration continue.
Notre plateforme repose sur une infrastructure certifiée HDS, avec environnements isolés et chiffrement de bout en bout.
Infrastructure conforme aux standards de sécurité des données de santé, audit annuel et certification continue.
Espaces de travail dédiés par projet, ségrégation des accès, logs d'audit complets pour traçabilité complète.
Données chiffrées en transit et au repos. Gestion des clés de chiffrement, authentification multi-facteurs pour tous les accès.
Surveillance en temps réel des pipelines, alertes sur anomalies, dashboards de performance et d'uptime.
Nous intégrons l'intelligence artificielle dans l'ensemble de nos processus pour améliorer les délais de production et la qualité de nos livrables.
Assistance IA pour la rédaction des protocoles d'étude, la revue bibliographique et la structuration des dossiers CESREES. Gain de temps significatif sur les phases préparatoires.
Génération et revue de code assistées par IA pour les pipelines ETL, les scripts d'analyse et les algorithmes de phénotypage. Réduction des erreurs et accélération du développement.
Assistance IA pour l'interprétation des résultats statistiques, la détection d'anomalies dans les jeux de données et l'identification de patterns dans les parcours patients.
Vérification automatisée de la cohérence des résultats, détection de valeurs aberrantes, validation croisée des outputs. L'IA renforce chaque étape de notre chaîne de production.
Découvrez notre infrastructure technique et nos capacités en data science.
Nous construisons des pipelines robustes et scalables pour vos données de santé.