Formati di dati
Perché i dati di misura richiedono formati di dati specializzati?
Tutti i dati nel nostro mondo hanno un riferimento temporale. Un film viene pubblicato in un determinato momento. Un passaporto ha una data di rilascio e una di scadenza. Apriamo porte, osserviamo il meteo o conversiamo — tutto avviene lungo una linea temporale. Tuttavia, sebbene il tempo abbia un ruolo in ogni forma di informazione, i requisiti per la sua acquisizione ed elaborazione differiscono talvolta in modo considerevole — in particolare quando si tratta di osservare processi fisici, meccanici o elettrici.
Nella tecnica di misura si osservano non di rado processi così rapidi che l'essere umano non sarebbe in grado di coglierli a occhio nudo o con l'udito. Ne sono esempi:
- La vibrazione di un componente di una macchina con 1.000 misurazioni al secondo (Hz)
- L'assorbimento di corrente di un motore elettrico durante la fase di accensione (acquisito a 10.000 Hz)
- L'accensione in un motore a combustione con fino a 100.000 punti di misura al secondo
- La misurazione delle tensioni strutturali durante un crash test (diversi milioni di campioni al secondo)
Tali dati si generano in modo continuo e con alta densità. Devono essere memorizzati in modo affidabile, riproducibile e, per quanto possibile, senza perdite. Non si tratta soltanto di semplici valori numerici come temperatura o tensione. Esistono piuttosto diversi tipi di dati — ad esempio segnali discreti come l'apertura e la chiusura di una porta, grandezze di misura analogiche con unità fisiche, segnali audio, dati immagine o interi blocchi di dati, ciascuno con un significato specifico.
Per tutto questo servono formati di dati che offrano più delle tipiche applicazioni da ufficio. Formati come CSV, JSON o Excel sono utili per lo scambio strutturato di dati, ma raggiungono rapidamente i propri limiti quando si tratta di:
- elevate velocità di trasmissione dei dati
- tipi di dati diversi
- timestamp esatti
- streaming e robustezza rispetto a guasti
- estendibilità flessibile.
Nel corso del tempo si sono quindi affermati molti formati proprietari per i dati di misura, tra cui:
- MATLAB (.mat)
- imc (.dat)
- HBK / ASAM (.atfx)
- NI / National Instruments (.tdm / .tdms)
- Gantner Instruments (.dat in formato UDBF)
- Vector / CSM (ASAM MDF 4)
- HDF5 (un formato generico e ampiamente diffuso per i dati scientifici)
Questi formati sono ciascuno ben adattati ai requisiti specifici dei rispettivi produttori e utenti — ma spesso sono proprietari, complessi o non ideali per applicazioni con sistemi aperti e modulari.
Perché OSF? Perché ancora un nuovo formato di dati?
Quando in optiMEAS ci siamo trovati di fronte al compito di definire un formato di dati robusto e flessibile per i nostri dispositivi e le nostre piattaforme, abbiamo innanzitutto verificato approfonditamente se un formato esistente potesse essere integrato in modo sensato. Nessuna delle soluzioni disponibili soddisfaceva tuttavia contemporaneamente tutti i nostri requisiti:
- Scrittura continua e senza perdite durante la misura (streaming)
- Robustezza rispetto a interruzioni di corrente o spegnimenti improvvisi
- Supporto per dati equidistanti e non equidistanti con timestamp
- Rappresentabilità di diversi tipi di dati – valori numerici, immagini, segnali audio o altri blocchi di dati strutturati
- Integrazione e implementazione semplici
- Basso grado di complessità con contemporanea estendibilità aperta
Alcuni formati come MDF4 (ASAM Measurement Data Format versione 4) si avvicinano tecnicamente in modo considerevole a questi requisiti. MDF4 è potente e molto diffuso nell'industria automobilistica. Tuttavia la specifica è lunga diverse centinaia di pagine, non è liberamente accessibile ed è disponibile solo per i membri dell'associazione ASAM o a pagamento. Di conseguenza anche l'implementazione è onerosa.
Anche HDF5 (Hierarchical Data Format) è un formato interessante e ampiamente diffuso, con elevata flessibilità e ampio supporto in ambito scientifico e tecnico. Può strutturare in modo efficiente grandi quantità di dati e offre un ecosistema aperto. Tuttavia HDF5 è concepito in modo molto generico — ed è proprio qui che sta la sfida: senza una convenzione concreta, tarata sui dati di misura, per la strutturazione e l'interpretazione dei contenuti, l'implementazione resta più onerosa, disomogenea e potenzialmente soggetta a errori.
Per questo, dopo un'attenta valutazione, abbiamo scelto deliberatamente una strada propria: il Open Streaming Format (OSF).
OSF soddisfa gli stessi elevati requisiti dei formati industriali consolidati — ma è documentato apertamente, liberamente utilizzabile, facile da comprendere e implementabile con poco impegno. È stato sviluppato appositamente per l'impiego pratico in sistemi di misura nei quali i dati devono essere memorizzati in modo continuo e affidabile su sistemi embedded — anche in condizioni difficili. Allo stesso tempo OSF consente un'elaborazione e analisi efficienti in laboratorio o su PC, dove è disponibile una maggiore potenza di sistema.
Di seguito illustriamo la struttura, la filosofia e i vantaggi pratici di OSF — e perché si rivela la scelta ottimale per i moderni sistemi di misura.
Dai formati per dati di misura ai formati aperti di scambio dati
I formati specializzati come OSF sono ideali per acquisire valori di
misura fisici in modo efficiente, senza perdite e strutturato.
Ma i dati di misura sono solo il primo passo: il vero valore aggiunto
nasce quando vengono combinati con altre informazioni.
A un certo punto i valori registrati devono trovare la via d'uscita dalla tecnica di misura:
- Nei data lake, dove si fondono con grandi patrimoni di dati provenienti da altre fonti.
- Nei sistemi di fatturazione e di manutenzione, che ricavano decisioni aziendali dai valori di misura.
- Nelle piattaforme di analisi, che riconoscono tendenze, individuano anomalie o calcolano KPI.
Per questo scambio servono formati di file che forse non sono altrettanto efficienti o robusti come OSF, ma che hanno un vantaggio decisivo: possono essere letti da quasi ogni piattaforma e software.
Formati come CSV, TSV, JSON o anche Parquet svolgono qui un ruolo importante.
- CSV / TSV: molto semplici, leggibili dall'uomo, adatti a piccole quantità di dati.
- JSON: flessibile, strutturato, adatto al trasporto via API e a blocchi di dati più piccoli.
- Parquet: formato orientato alle colonne e compresso, spesso utilizzato in ambienti big data.
Non sono concepiti per l'archiviazione permanente di dati di misura ad alta frequenza, ma sono l'anello di congiunzione tra il mondo della tecnica di misura e il mondo di tutti gli altri «consumatori» di dati. Per ulteriori informazioni
In sintesi:
OSF garantisce l'acquisizione senza perdite e robusta — i formati aperti di scambio rendono i dati accessibili a tutti gli altri sistemi e portano infine a ciò che conta: valore aggiunto dall'informazione.