Formats de données
Pourquoi les données de mesure ont-elles besoin de formats de données spécialisés ?
Toutes les données de notre monde ont une dimension temporelle. Un film sort à un moment donné. Un passeport a une date de délivrance et une date d'expiration. Nous ouvrons des portes, observons la météo ou menons des conversations – tout se déroule le long d'une ligne de temps. Pourtant, bien que le temps joue un rôle pour toute forme d'information, les exigences relatives à son acquisition et à son traitement diffèrent parfois considérablement – en particulier lorsqu'il s'agit d'observer des processus physiques, mécaniques ou électriques.
En métrologie, nous observons fréquemment des processus si rapides que l'être humain ne pourrait plus les percevoir à l'œil nu ou à l'oreille. En voici quelques exemples :
- La vibration d'un composant de machine avec 1 000 mesures par seconde (Hz)
- L'appel de courant d'un moteur électrique pendant la phase de mise en marche (acquis à 10 000 Hz)
- L'allumage dans un moteur à combustion avec jusqu'à 100 000 points de mesure par seconde
- La mesure de contraintes structurelles lors d'un essai de collision (plusieurs millions d'échantillons par seconde)
Ces données sont produites en continu et avec une grande densité. Elles doivent être stockées de manière fiable, reproductible et si possible sans perte. Il ne s'agit pas seulement de simples valeurs numériques comme la température ou la tension. Il existe au contraire différents types de données – par exemple des signaux discrets comme l'ouverture et la fermeture d'une porte, des grandeurs de mesure analogiques avec des unités physiques, des signaux audio, des données d'image ou des blocs de données entiers ayant chacun une signification spécifique.
Tout cela nécessite des formats de données capables de faire plus que les applications bureautiques habituelles. Des formats comme CSV, JSON ou Excel sont utiles pour l'échange de données structurées, mais ils atteignent vite leurs limites dès qu'il s'agit de :
- débits de données élevés
- différents types de données
- horodatages exacts
- streaming et robustesse face aux pannes
- extensibilité flexible.
C'est pourquoi de nombreux formats de données de mesure propriétaires se sont établis au fil du temps, notamment :
- MATLAB (.mat)
- imc (.dat)
- HBK / ASAM (.atfx)
- NI / National Instruments (.tdm / .tdms)
- Gantner Instruments (.dat au format UDBF)
- Vector / CSM (ASAM MDF 4)
- HDF5 (un format générique très répandu pour les données scientifiques)
Ces formats sont chacun bien adaptés aux exigences spécifiques de leurs fabricants et utilisateurs – mais souvent propriétaires, complexes ou peu adaptés aux applications reposant sur des systèmes ouverts et modulaires.
Pourquoi OSF ? Pourquoi encore un nouveau format de données ?
Lorsque nous avons été confrontés chez optiMEAS à la tâche de définir un format de données robuste et flexible pour nos propres appareils et plateformes, nous avons d'abord examiné de près si un format existant pouvait être intégré de manière judicieuse. Mais aucune des solutions existantes ne répondait simultanément à toutes nos exigences :
- Écriture continue et sans perte pendant la mesure (streaming)
- Robustesse face aux pannes de courant ou aux arrêts brutaux
- Prise en charge des données équidistantes et non équidistantes, horodatées
- Représentation de différents types de données – valeurs numériques, images, signaux audio ou autres blocs de données structurés
- Intégration et implémentation simples
- Faible niveau de complexité avec une extensibilité ouverte
Certains formats comme MDF4 (ASAM Measurement Data Format Version 4) se rapprochent techniquement de ces exigences. MDF4 est performant et très répandu dans l'industrie automobile. Cependant, sa spécification compte plusieurs centaines de pages, n'est pas librement accessible et n'est disponible que pour les membres de l'association ASAM ou contre paiement. L'implémentation est elle aussi très laborieuse.
HDF5 (Hierarchical Data Format) est lui aussi un format intéressant et très répandu, d'une grande flexibilité et largement pris en charge dans les sciences et la technique. Il permet de structurer efficacement de grandes quantités de données et offre un écosystème ouvert. Toutefois, HDF5 est très générique – et c'est précisément là que réside la difficulté : sans convention concrète, adaptée aux données de mesure, pour structurer et interpréter les contenus, l'implémentation reste plus laborieuse, hétérogène et potentiellement sujette aux erreurs.
C'est pourquoi nous avons – après mûre réflexion – délibérément choisi notre propre voie : le Open Streaming Format (OSF).
OSF satisfait aux mêmes exigences élevées que les formats industriels établis – tout en étant documenté ouvertement, librement utilisable, facile à comprendre et implémentable avec peu d'effort. Il a été développé spécialement pour l'usage pratique dans les systèmes de mesure où les données doivent être enregistrées en continu et de manière fiable sur des systèmes embarqués – même dans des conditions difficiles. En même temps, OSF permet un traitement et une analyse efficaces en laboratoire ou sur PC, où une puissance système plus élevée est disponible.
Nous expliquons ci-après la structure, la philosophie et les avantages pratiques d'OSF – et pourquoi il s'impose comme le choix optimal pour les systèmes de mesure modernes.
Des formats de données de mesure aux formats ouverts d'échange de données
Les formats spécialisés comme OSF sont idéaux pour acquérir des valeurs de mesure physiques de manière efficace, sans perte et structurée.
Mais les données de mesure ne sont que la première étape : la véritable valeur ajoutée apparaît lorsqu'elles sont combinées à d'autres informations.
À partir d'un certain point, les valeurs enregistrées doivent quitter le domaine de la métrologie :
- Vers des data lakes, où elles fusionnent avec de grandes quantités de données issues d'autres sources.
- Vers des systèmes de facturation et de maintenance, qui déduisent des décisions commerciales à partir des valeurs de mesure.
- Vers des plateformes d'analyse, qui détectent des tendances, trouvent des anomalies ou calculent des KPI.
Pour cet échange, nous avons besoin de formats de fichiers qui ne sont peut-être pas aussi efficaces ou robustes qu'OSF, mais qui présentent un avantage décisif : ils peuvent être lus par presque toutes les plateformes et tous les logiciels.
Des formats comme CSV, TSV, JSON ou encore Parquet jouent ici un rôle important.
- CSV / TSV : très simples, lisibles par l'humain, adaptés aux petites quantités de données.
- JSON : flexible, structuré, bien adapté au transport via API et aux petits blocs de données.
- Parquet : format compressé orienté colonnes, souvent utilisé dans les environnements big data.
Ils ne sont pas destinés au stockage durable de données de mesure à haute fréquence, mais ils constituent le lien entre le monde de la métrologie et celui de tous les autres « consommateurs » de données. Pour en savoir plus, cliquez ici
Conclusion :
OSF assure une acquisition sans perte et robuste – les formats ouverts d'échange de données rendent les données accessibles à tous les autres systèmes et conduisent finalement à ce qui compte : de la valeur ajoutée à partir de l'information.