Utilizzo dei dati sintetici per accelerare lo sviluppo di modelli di percezione dell'intelligenza artificiale per il rilevamento di oggetti
SCARICA LA VERSIONE PDF
Introduzione
Il concetto di operazioni (CONOPS) per le piattaforme aeree e i sistemi autonomi si sta evolvendo rapidamente. L'inceppamento a radiofrequenza (RF) può ora interrompere le comunicazioni e la navigazione nel sistema satellitare di navigazione globale (GNSS), aumentando la necessità di rilevamento e tracciamento di bersagli multi-classe, autonomia integrata, riconoscimento automatico dei bersagli basato sui bordi e guida ai terminali che possono operare in ambienti contestati. Per gli OEM e gli integratori di sistemi, questo cambiamento sta guidando la domanda di prodotti di percezione digitale che rilevano, classificano e tracciano oggetti rilevanti per la missione sul perimetro utilizzando termocamere (IR) ed elettro-ottiche (EO).
I rilevatori di oggetti generalizzati possono essere sufficienti per molte applicazioni di consapevolezza situazionale, ma molte applicazioni di difesa richiedono una classificazione dettagliata di bersagli, comportamenti e punti di mira. Le soluzioni di percezione dell'intelligenza artificiale adottano un'ontologia simile alla percezione umana, seguendo tre livelli di percezione: rilevamento, riconoscimento e identificazione. Ogni livello ha un pixel sulla soglia del target ed è spesso molto difficile raccogliere dati sul campo che coprono tutti i pixel sui requisiti del target per addestrare un modello ad alte prestazioni. Il fattore limitante sono i dati, poiché i dati delle immagini sono spesso suddivisi in compartimenti stagni tra organizzazioni militari, agenzie governative, istituti di ricerca e appaltatori della difesa, ciascuno con politiche di accesso e commercializzazione diverse. Allo stesso tempo, le lezioni sul soggetto continuano ad espandersi e le condizioni reali come mimetizzazione, spoofing, modalità del sensore, geometria di visualizzazione e ambiente devono essere rappresentate nei dati di addestramento. Soddisfare questi requisiti richiede la generazione di dati e l’addestramento dei modelli in pochi giorni piuttosto che settimane o mesi. Teledyne FLIR OEM ha sviluppato AIMMGen™ per affrontare questa sfida come funzionalità di generazione di dati sintetici e di addestramento dei modelli IA che supporta il più ampio portafoglio di prodotti digitali Prism™.
Conclusioni principali
- AIMMGen accelera lo sviluppo di modelli di oggetti generando grandi volumi di dati EO, IR e multispettrali sintetici etichettati per scenari ricchi di target.
- La toolchain riduce la dipendenza da set di dati del mondo reale scarsi, costosi o limitati, preservando la capacità di aumentare i dati misurati quando disponibili.
- La gestione automatizzata dei metadati, la gestione dei set di dati e l’ottimizzazione dei modelli supportano lo sviluppo ripetibile e tracciabile di modelli di percezione specifici per la missione.
- Nell’ambito dell’ecosistema di prodotti digitali Prism, AIMMGen aiuta a convertire i dati sintetici e i flussi di lavoro di formazione in funzionalità di percezione digitale implementabili per le piattaforme OEM.
- I risultati di esempio mostrano un miglioramento misurabile delle prestazioni nel rilevamento aria-terra e dimostrano l'addestramento del modello solo sintetico per la classificazione marittima MWIR a grana fine.
Perché i dati sintetici contano ora
Il valore strategico dei dati sintetici per l’addestramento dei modelli non è più limitato al colmare le lacune tra dati di addestramento e addestramento. Sta diventando un modo pratico per accelerare il rilevamento definito dal software e le capacità di percezione dell'IA adattabili sul campo. Con l'evolversi dei requisiti di missione, i clienti hanno bisogno di modelli che possano essere ampliati a nuove classi di destinazione, convalidati tra le modalità dei sensori e implementati su processori integrati senza riavviare campagne di raccolta ed etichettatura dei dati della durata di mesi.
Per Teledyne FLIR OEM, AIMMGen è la base della generazione di modelli alla base di questa strategia di prodotti digitali. Aiuta a trasformare le immagini sparse, costose o difficili da raccogliere in modelli IA convalidati che supportano le applicazioni Prism per il rilevamento, il tracciamento, il riconoscimento del bersaglio e la percezione specifica della missione.
Generazione di modelli di dati sintetici e IA
Gli sviluppatori in mercati come la guida autonoma spesso hanno accesso a grandi librerie di formazione. Al contrario, le organizzazioni che sviluppano sistemi di rilevamento militari e specifici per le missioni spesso hanno un accesso limitato ai dati rappresentativi dei bersagli. I dati reali rimangono importanti per i classificatori di precisione, ma i dati sintetici offrono un modo pratico per aumentare i set di dati misurati o sviluppare classificatori a grana fine quando i dati misurati non sono disponibili, sono limitati o sono proibitivamente costosi da raccogliere.
AIMMGen (AI Modeling and Model Generation) di Teledyne FLIR OEM combina generazione automatizzata di dati su larga scala, recupero intelligente dei dati e ottimizzazione del modello IA in un’unica pipeline per sviluppatori di algoritmi di riconoscimento automatico dei bersagli (ATR) e integratori OEM. All’interno dell’ecosistema di prodotti digitali Prism, AIMMGen funziona come una fabbrica di modelli: aiuta a creare, addestrare, testare e fornire modelli di percezione IA per applicazioni software mission-ready e moduli di percezione integrati. La toolchain genera rapidamente dati sintetici per scenari reali, tra cui tipi di oggetti target, posizioni, orientamenti, modalità del sensore, configurazioni, traiettorie e stati ambientali. Può produrre milioni di immagini etichettate in pochi giorni, piuttosto che nelle settimane o mesi tipicamente richiesti per la raccolta dei dati sul campo e l'etichettatura manuale.
AIMMGen genera automaticamente etichette per ogni immagine e memorizza i metadati di raccolta con l’insieme di immagini. Per supportare la formazione, la convalida e la distribuzione ripetibile in tutti i casi d’uso, i metadati per ogni immagine e target vengono memorizzati in un data lake per una rapida gestione e la costruzione di set di dati. Questi metadati includono parametri di raccolta, informazioni sul target e parametri di immagine. Il framework di formazione estensibile e indipendente dal modello di AIMMGen consente quindi la formazione e l’ottimizzazione su scala cloud in una vasta gamma di casi d’uso e attività. Questo flusso di lavoro tracciabile aiuta i clienti a comprendere non solo le prestazioni di un modello, ma anche quali dati, condizioni e ipotesi ne hanno plasmato lo sviluppo.
Dai dati sintetici alla percezione digitale implementabile
Il flusso di lavoro AIMMGen è particolarmente prezioso se visto come parte di una pipeline di percezione digitale end-to-end. La generazione di dati sintetici crea immagini etichettate su larga scala. La gestione dei set di dati e dei metadati rende i dati ricercabili e riutilizzabili. La formazione e l'ottimizzazione automatizzate convertono i dati curati in modelli. I test di convalida e prestazioni forniscono la prova che il modello può supportare un'applicazione sul campo. Nell'ecosistema Prism, questi output possono supportare prodotti software e moduli che eseguono rilevamento, tracciamento, classificazione, imaging computazionale e riconoscimento del bersaglio ai margini.
Per i clienti OEM, la sfida è raramente la sola formazione dei modelli. L'obiettivo più grande è ridurre il rischio di sviluppo, ridurre il tempo di sviluppo delle capacità e adattare il software di percezione al variare di bersagli, sensori, piattaforme di implementazione e requisiti di missione.
Fase 1: Processo di generazione di dati sintetici AIMMGen
La prima fase del processo AIMMGen è la generazione di dati, che inizia con le specifiche per i tipi di posizione, la risoluzione del sensore, i tipi di oggetto target, le condizioni di imaging, le configurazioni del sensore e il numero di immagini desiderato. Le combinazioni randomizzate di queste specifiche vengono create finché il numero totale di immagini non soddisfa o supera il numero desiderato. La pipeline di generazione dei dati coinvolge un motore di simulazione geo-specifico che include terreni accurati per il mondo, stabilisce le condizioni ambientali, inserisce obiettivi campionati da oltre 20.000 modelli unici e inizia a raccogliere dati. La verità di base viene generata automaticamente come metadati e archiviata insieme ai metadati di destinazione.

Figura 1. I dati di formazione sintetici vengono generati in pochi minuti e a basso costo
I metadati dell’immagine, compreso l’URI finale di ogni posizione dell’immagine e i metadati del target associati, vengono acquisiti e archiviati in un database Elasticsearch. Questi metadati vengono memorizzati in indici separati e collegati tramite identificatori univoci, consentendo agli utenti di visualizzare, filtrare e cercare tra sottoinsiemi di dati. Dopo la generazione, i dati possono essere curati attraverso strumenti di visualizzazione per supportare la progettazione di esperimenti e lo sviluppo di set di dati.
Fase 2: AIMMFormazione e ottimizzazione del modello AIMMGen
La seconda fase è l'addestramento e l'ottimizzazione automatizzati dei modelli. Gli utenti specificano set di dati, caratteristiche delle prestazioni del modello desiderate e metriche di ottimizzazione. AIMMGen orchestra un cluster di nodi di addestramento IA per addestrare, valutare e produrre modelli ottimizzati rispetto alle metriche di base e definite dall’utente. Poiché il framework di addestramento è indipendente dal modello, gli utenti possono creare pipeline di dati personalizzate e architetture di modelli all’interno di AIMMGen. I modelli di output vengono tracciati e archiviati in un database per supportare la tracciabilità, la riproducibilità e il perfezionamento futuro man mano che le missioni dei clienti o i set di obiettivi si evolvono.

Figura 2. Formazione e ottimizzazione automatiche
Metriche delle prestazioni di base per l'ottimizzazione del modello di percezione dell'intelligenza artificiale
Nello sviluppo del modello di percezione IA, la precisione, il recall e F1-score sono metriche chiave per valutare l’efficacia con cui un modello identifica e classifica oggetti o istanze.
La precisione misura l'accuratezza delle previsioni positive effettuate dal modello. È importante quando il costo dei falsi positivi è elevato. Nelle applicazioni militari, identificare erroneamente una non minaccia come minaccia potrebbe portare ad azioni non necessarie.
Precisione = Vero positivo/(Vero positivo + Falso positivo)
Il richiamo, noto anche come sensibilità o tasso di veri positivi, misura la capacità del modello di identificare tutte le istanze rilevanti. Questo è fondamentale quando la mancanza di un’istanza positiva ha gravi conseguenze, come il pericolo di non rilevare una minaccia effettiva.
Recall = Vero positivo/(Vero positivo + Falso negativo)
F1-Score fornisce una visione equilibrata delle prestazioni del modello, garantendo che siano presi in considerazione sia la precisione che il recall. Si tratta di una buona misura delle prestazioni complessive del modello quando si tratta di set di dati sbilanciati ed è essenziale per sviluppare sistemi di percezione robusti.
F1 - Punteggio = 2 x (Precisione * Rievocazione)/(Precisione + Rievocazione)
Applicazioni e risultati di esempio AIMMGen
AIMMGen è stato convalidato in più domini applicativi e sensori, tra cui il rilevamento aria-terra e la classificazione marittima a grana fine.
In un esperimento di rilevamento aria-terra, Teledyne FLIR OEM ha aggiunto i dati elettro-ottici (EO) sintetici e gli infrarossi a onde lunghe (LWIR) a un set di dati di addestramento sul rilevamento di oggetti che includeva già i dati EO e IR misurati. Con solo modifiche limitate allo schema di addestramento, i modelli con formazione AIMMGen hanno ottenuto un miglioramento misurabile del recall. Ciò è importante dal punto di vista operativo perché i mancati rilevamenti possono essere più consequenziali rispetto ai falsi positivi aggiuntivi in molti flussi di lavoro di sorveglianza, targeting e protezione della forza. Il miglioramento si riflette nell’aumento complessivo del F1-score.
Tabella 1. Modelli AIMMGen rispetto ai modelli con addestramento esclusivo
|
|
Modelli AIMMGen |
Modello esistente solo reale |
| Precisione |
0,71 ± 0,01 |
0,71 |
|
Richiamo |
0,52 ± 0,01 |
0,48 |
|
F1-Score |
0,60 ± 0,01 |
0,57 |
AIMMGen può anche supportare la generazione di modelli IA con pochi o nessun dato di addestramento reale, come dimostrato in un esempio marittimo a infrarossi a onde medie (MWIR). L'identificazione di oggetti marittimi a grana fine richiede in genere costosi set di dati MWIR con etichette dettagliate di tipo imbarcazione. Con dati reali limitati, i modelli possono distinguere solo tra categorie ampie come “piccolo vaso” e “grande vaso”. Utilizzando AIMMGen, tuttavia, un modello è stato addestrato esclusivamente sui dati sintetici ed è stato in grado di classificare specifici sottotipi di imbarcazioni. Le prestazioni sono state convalidate in più collezioni del mondo reale, tra cui ambienti con acqua dolce e litorale, dimostrando la robustezza della formazione solo sintetica e il potenziale per espandere le classi di soggetti quando le immagini reali sono scarse o difficili da raccogliere.

Figura 3: Identificazione a grana fine in MWIR di imbarcazioni marittime utilizzando modelli di IA sintetici basati sui dati
Sommario
La creazione di set di dati di addestramento grandi e diversificati per applicazioni EO, IR e multispettrali rimane un ostacolo importante all'implementazione di robusti sistemi di percezione IA. AIMMGen affronta questa barriera con immagini sintetiche, gestione automatizzata dei metadati, gestione dei set di dati e ottimizzazione dei modelli. Nell’ambito della più ampia strategia di prodotti digitali Prism di Teledyne FLIR OEM, AIMMGen è molto più di una toolchain per la generazione di dati. Fornisce una base di generazione di modelli per sviluppare, convalidare ed espandere le capacità di percezione dell'IA specifiche per la missione in applicazioni di difesa, autonomia, pronto intervento e altre applicazioni OEM.
Per ulteriori informazioni sulla famiglia di software Prism e sui prodotti digitali OEM Teledyne FLIR, consultare oem.flir.com/prism.