Press "Enter" to skip to content

GOTO 2018 • (Deep) Learning to Fly • Krzysztof Kudrynski & Blazej Kubiak


[Musica]
ok, ancora
[Applausi]
Sono la sorella kudrinsky e questo è un drone
ora è nella scatola
e la parola consiste di due gruppi di
la gente verrà dal primo gruppo
Prendi immediatamente il drone e inizia
godere di volare mentre le persone dal
il secondo gruppo verrà immediatamente scaricato
l’API ora non c’è assolutamente vergogna
far parte del primo gruppo che ho
amici reali che sarebbe in realtà fare questo
e loro sono persone simpatiche e lo sono state
Siamo orgogliosi di rappresentare l’élite
dopo oltre due anni di rapporti con
questo drone non abbiamo assolutamente idea
come far volare manualmente quella cosa in questo
progetto il drone imparerà a volare e
imparerà che l’abilità in base a ciò
vede e vedrà il mondo di a
macchina fotografica mono quindi un punto di partenza per il nostro
il progetto sarà un gioco di scacchi
bordo facendo un sacco di foto di
un’immagine così ben strutturata che puoi
trovare rapidamente un po ‘di matematica
algoritmi per correggere tutto il distruggere
distorsioni e calibrare i parametri
della fotocamera per far sembrare tutto
bello e liscio
infatti la scacchiera di calibrazione è un
progetto iniziale di quasi tutti i progetti
in computer vision e poi vai avanti
con semplici progetti come il rilevamento
scacchiera nell’immagine allora forse
tracciamento della scacchiera nel video questi
sono il ciao mondo della visione artificiale
ma se sei qui per vedere il buongiorno
applicazione del mondo potresti essere un po ‘
un po ‘ deluso, anche se non possiamo
non sono d’accordo sul fatto che il monitoraggio della scacchiera sia
ha così tante meravigliose real-life
applicazioni che vanno dal rilevamento di
freak
giocando a scacchi su una scacchiera fino a
rilevamento di persone che camminano sulla
strada con una scacchiera e la lista
non finisce qui
tuttavia il nostro progetto è ispirato a Impa
qualcosa di completamente diverso e questi
sono estratti di alcuni video di drone
corse e ho credo che possiamo sentire che
la velocità è così incredibile e quando tu
rendersi conto che in realtà erano questi droni
controllato manualmente sono sicuro che ci sia
una parola che urla nella tua testa e così
è responsabilità analizziamolo
un caso ancora una volta quello che è una parola vista da
fotocamera drone durante una gara e tu
puoi già sapere cosa puoi girare
un po ‘a sinistra e andare veloce attraverso
il tunnel c’è ancora molto tempo
ma se stai iniziando a preoccuparti ora tu
stanno facendo la cosa giusta perché
anche se ci sono ancora molti fotogrammi
per girare mi sembra che tu sappia già come è
andando a finire mentre il mondo puoi vedere
c’era così tanto tempo per reagire così tanto
tempo di reagire prima che la scilla si chiuda
così tanti fotogrammi che stavano solo implorando
per la salvezza
insieme al lavaggio ho deciso di mettere
fine a quello come utente che dovresti solo
seleziona dove vuoi volare ed è
la macchina che dovrebbe calcolare tutto
i controlli di basso livello analizzando il
immagine e oggi penseremo come noi
potremmo sviluppare questo avremo una passeggiata
per tutti i passaggi necessari per raggiungere
e ti mostreremo come funziona
sul nostro esempio ma nel nostro esempio
invece delle rovine del genere invece
della foresta e dei parcheggi mostrerà
voi i nostri test dal nostro moderno TomTom
ufficio costruito e aperto quest’anno ma se
lo guardi nella giusta prospettiva
non puoi perdere la somiglianza in modo tale
simile somiglianza non può essere una possibilità io
penso che eravamo destinati a fare questo test
in ufficio ok quindi iniziamo con
risolvere il nostro compito e per l’iniziale
ispirazione analizziamo questo caso
di nuovo e siamo tutti d’accordo che noi
gli umani sono semplicemente fantastici qui
immediatamente e senza alcuno sforzo
essere in grado di individuare il posto giusto che è
vale la pena volare a tutti qui
immediatamente e senza alcuno sforzo
essere in grado di pianificare le prossime azioni successive
e tutti qui immediatamente e
senza nessuno sforzo sarà in grado di individuare
le collisioni e le azioni emergenti
di conseguenza questo è già sorprendente ma
quello che è ancora più sorprendente è il fatto
esattamente con lo stesso identico cervello
allo stesso tempo noi umani siamo in grado di farlo
pianifica il nostro prossimo pasto ed esegui in profondità
considerazioni sulla vita e bene tali
l’intelligenza generale non è ancora oltre
la portata della scienza così oggi sarà
parla come farlo sul cuoco o
comprendere la vita, ma cercheremo di
analizzare come noi umani faremmo questo
compito particolare libero e perché il
la macchina può essere perfettamente focalizzata su di loro
solo scopriremo presto che funziona
più veloce e supererà le prestazioni umane ok così
iniziamo con alcune nozioni di base che puoi
inizia con qualsiasi attrezzatura tu voglia
finché puoi controllarlo dal tuo
il proprio software e il nostro sistema era basato su
strumento pappagallo ar.drone e c’è molto
di te puoi comunicare con esso
Wi-Fi e c’è un sacco di software in
il web che puoi scaricare abbiamo usato a
framework drone che è open source
sotto licenza Apache quindi possiamo solo
scaricalo e da migliaia di
linee di codici di Yaron ne abbiamo usato uno solo
il codice di riga in particolare sposta il comando dove
è possibile specificare l’angolo di inclinazione in entrambi
indicazioni xey il cambio di velocità
nella direzione z e nella rotazione
velocità così questo si applica solo questo e
il drone si muoverà come si desidera e
questi parametri saranno derivati ​​da
la comprensione dell’immagine che è
decodificato per noi dalla nostra fotocamera
e per questo è stato il più conveniente per
usiamo il c ++ ffmpeg per decodificare il file
flusso e quindi analizzare l’ immagine utilizzando
librerie python come la torta di luna e
OpenCV per analizzare questa immagine e infine
il centro di controllo per Orchestrator che
inizialmente avevamo pianificato di scriverlo in Java
perché l’adren era anche in Java e
tale sistema è un buon punto di partenza ma
ovviamente come andremo avanti durante questo
presentazione
evolverà le nostre idee e vedrai
che questa architettura sarà questa progettazione
cambiare gradualmente mentre parliamo
ma è un bel backbone quindi iniziamo
con la logica quindi il nostro primo livello di
l’autonomia è il tracciamento e pensiamo come
per implementare il monitoraggio sulla macchina noi
piacerebbe rintracciare questo posto mentre noi
muoviamo e perché siamo fan del
cervello umano pensiamo a come noi umani
come funziona il nostro cervello nella vita reale
situazioni in cui vogliamo farlo e
pensiamo a come è davvero bello
esempio quando andiamo al club e lì
sono molte persone e troviamo qualcosa
accattivante qualcosa che cattura i nostri occhi
per esempio sì, ma prima ci concentriamo su
il cuore immaginiamo una situazione ma
devi immaginarlo davvero difficile
invece di un cuore abbiamo una scacchiera
bene questo non succede molto spesso ma
se fosse il caso potremmo usare il nostro
scacchi di scacchiera di controllo predefinito
algoritmo di tracciamento della scheda da realizzare
il nostro compito purtroppo a volte lo fa
succede che dobbiamo tenere traccia di qualcosa
altro ed è in questo momento che questo
regione guadagna qualche descrizione potrebbe essere
la distribuzione dei colori all’interno di questo
regione possiamo seguire la forma di
il cuore stesso o semplicemente prova a seguire
il movimento dei pixel così tutto
questi approcci possono facilmente essere
implementato sulla macchina e il buono
notizia è che non c’è bisogno di farlo su
il tuo perché hai quadri per
esempio libreria OpenCV che è un c ++
libreria ma con wrapper in Python e
Java così puoi
usarlo bene e di parecchio
Al gore-ismo abbiamo provato tre dei tre di
li Minge in campagna minuti si sono solo
specificando una regione e poi lo sei
cercando di spostare e scalare questa regione così
che la distribuzione dei colori rimane
lo stesso è fatto automaticamente per te
il cambio di reddito è molto simile ma è possibile
ruota anche l’ immagine e infine un
flusso ottico verrà analizzato il
movimento di singoli pixel nel
immagine usando un bel matematico
trucchi sull’espansione di Taylor e così via
e scopriamo che nel nostro caso l’ abbiamo fatto
alcuni esperimenti e il flusso ottico hanno dato
noi risultati migliori in questo caso, quindi facciamolo
guarda come funziona in azione quello che puoi
vedi qui è la nostra interfaccia utente grafica
così puoi vedere cosa vede il drone
alcuni controlla la cosa a sinistra il
le frecce a sinistra ea destra mostrano cosa
movimento deve essere preso in modo che noi
emettere un ostacolo
allo stesso modo la freccia in basso mostra se noi
devi volare più in alto o più in basso per incontrare il
ostacolo ma all’inizio ovviamente
saranno nel primo livello di autonomia
saranno tutti zero perché tu sei
non ancora emettendo ostacoli quello che sarà
più interessante per noi è il rosso
cerchio nel mezzo il nostro cerchio di messa a fuoco
attenzione è di default nel mezzo
ma quando iniziamo a volare faremo clic
sul tavolo a sinistra e il drone
inizierà a monitorare questo posto e poi
finalmente la freccia in alto mostra cosa
la rotazione deve essere presa in modo che il
il drone è in realtà centrato
la regione cliccata quindi cominciamo a volare
e puoi vedere che abbiamo cliccato sul tavolo
e viene monitorato e puoi vedere
il forte desiderio del drone di girare
in modo che possiamo concentrarci su questo tavolo così
quando siamo nella nostra interfaccia utente grafica
quando ne premiamo uno andrà in piano
autonomia numero uno e vedrai ora
il drone sta fluttuando liberamente con
monitoraggio dell’oggetto che abbiamo che
questo è intrappolato, quindi questo è il nostro
livello di autonomia numero uno quindi se vogliamo
per aumentare il livello di autonomia due che
sta solo dando l’azione che volerà
verso questo posto è abbastanza ovvio
voleremo solo in avanti, ma nella vita reale
scenari in ufficio non è solo
sempre una buona idea per implementarlo
dritto in modo tale che abbiamo deciso di
passare rapidamente al livello tre
autonomia che evita anche ostacoli e
questo è dove inizia il divertimento perché in
per evitare rischi che è necessario
capire e identificare nello spazio 3d il
ostacoli che puoi vedere in due
immagine dimensionale e sembra
difficile
quindi la domanda che possiamo porci
di nuovo è come noi umani faremmo come
noi umani comprendiamo lo spazio intorno
noi e probabilmente la prima risposta rispondono
entra nella nostra testa è attraverso la coppia
dei nostri occhi quindi diciamo che questo è un
diagramma semplificato del nostro sistema di visione
il rettangolo blu è il posto dove
l’immagine è formata così la retina del nostro
occhio e la linea tratteggiata è il suo principale
asse ora un singolo pixel in questo piano
ti direbbe informazioni molto limitate
su ciò che vediamo nel mondo in effetti
ti dirà solo il Raggio su cui
l’immagine giace su cui giace l’ oggetto
nel mondo se non hai un altro occhio
che è abbastanza comune e nell’altro
occhio hai un pixel corrispondente a
lo stesso oggetto e poi usando alcuni
matematica semplice
puoi effettivamente trovare il posto nel
mondo in cui questo oggetto giace così è
televisione una risposta forse potremmo
basta aggiungere un sistema di visione stereo al nostro
drone invece di una fotocamera mono che
sarebbe più costoso e molto altro
più pesante probabilmente così invece prima di noi
andiamo a fare shopping , pensiamo e chiediamo
noi stessi un’altra domanda è davvero
necessario siamo noi umani senza speranza quando noi
avere solo un occhio ovviamente non in effetti
quando muoviamo i nostri occhi nutriamo il cervello
con immagini con molte immagini e
può essere può essere provato matematicamente
che se hai almeno sette pixel
pixel corrispondenti in due immagini in
qualche configurazione non critica sei
in grado di ricostruire sia il movimento
e la struttura 3d che stiamo cercando
fino al fattore di scala, ovviamente così per
esempio questo sarà un video della mia sedia
usando questi trucchi matematici e in
questa immagine in questo algoritmo in ciascuno
immagine ci saranno alcuni punti chiave
rilevato dall’algoritmo e lo faranno
essere rintracciato quindi abbiamo la corrispondenza
entro i frame successivi e infine
calcolerà l’immagine 3d al volo
che ora puoi vedere
l’approccio è noto sotto molti nomi
per lo più strutture di promozione multiple
guarda la ricostruzione o la grafica LOM lì
è un CV aperto
alcune funzioni per questo che puoi fare
con cui puoi fare un po ‘di base
ricostruzione ma ce ne sono così tante
progetti nel web o ce ne sono molti
grandi libri se si desidera
capiscilo e magari scrivi il tuo
codice migliore e se lo fai bene
funzionerà in modo sorprendente soprattutto se ti muovi
orizzontalmente contro gli oggetti che tu
stanno cercando di ricostruire perché a
ogni frame che darai molto
diverse prospettive per la tua immagine
anche per il tuo oggetto da ricostruire
tuttavia se per esempio voli solo
verso l’oggetto potresti avere un
un po ‘ un problema perché tutti
cornice che aggiungi l’immagine sarà molto
simile non ci sarà diverso
prospettiva degli oggetti che hai
specialmente quelli nel centro di
l’immagine e proiettivo LY questa volontà
fornire pochissime informazioni aggiuntive e
infatti perché c’è del rumore dentro
il sensore il resto sono tutti ancora alcuni
mancata calibrazione questo rumore potrebbe essere
più grande di quanto in realtà il proiettiva
informazioni che tu dai e poi tu
potrebbe pensare che il tuo mondo 3d sia piatto
e non è vero va bene comunque se noi
se ruotassimo, sarebbe pari
peggio perché in questo caso abbiamo solo
un punto in cui tutti i raggi si incontrano e
non c’è proiettivo aggiuntivo
informazione che è il caso peggiore e
infatti quando corriamo con la nostra
drone la maggior parte del tempo volerà in avanti
e ruotare che è il caso peggiore
scenario per questo metodo comunque
bello suona un approccio simile
ma un po ‘diverso sarebbe quello di
usa il flusso ottico stesso quindi concentriamoci
su una maniglia e un bicchiere mentre noi
si muoverà e vedrai che il vetro
che è più vicino si muove più velocemente sul
immagine della porta che è lontana
e potremmo usare queste informazioni per dire
qualcosa sullo spazio che è
più lontano in modo che potessimo in realtà tenere traccia
tutto l’ oggetto
e crea la nostra immagine 3d ma ancora qui
allo stesso modo del metodo precedente è meglio
se ci muoviamo verticalmente orizzontalmente
qualunque cosa tu sappia per cosa intendo
quello che vediamo non va bene, naturalmente
potremmo pensare a una situazione in cui noi
potrebbe infatti usare quello e avremmo a
il nostro drone aggiungerebbe deliberatamente un po ‘
mozioni alle scienze che voliamo e per
noi polacchi e i nostri amici in
La Russia aggiunge un po ‘ di ceramica
percorso sarebbe perfettamente scusato ma noi
non vincerebbe la gara in quel modo così ancora
siamo condannati a fallire assolutamente no e
ancora una volta trarremo ispirazione dal
potere del cervello umano perché noi
gli umani non hanno bisogno di due occhi per
capire lo spazio non abbiamo bisogno nemmeno di
muoviti , possiamo stare fermi in uno
posiziona con un occhio aperto e ancora ha
senza dubbio cosa c’è intorno a noi e come lo facciamo noi
lo so per esperienza di miliardi
di immagini alimentate nel nostro cervello durante il nostro
vite impariamo a capire gli oggetti
la loro prospettiva le loro dimensioni relative
le loro disposizioni e le loro ombre
con la nostra esperienza di vita di guardare
al mondo
noi umani non abbiamo assolutamente dubbi su di noi
non abbiamo bisogno di trucchi per vedere lo spazio
e per quanto possa sembrare incredibile, possiamo
passare questa esperienza alla Macchina con
i nuovi progressi di artificiale
intelligenza quindi cercheremo di allenare i nostri
drone che usa il neurale convoluzionale profondo
rete in pochi minuti dirà bojay
tu più su questo ma se qualcuno qui
è assolutamente non familiare con il
concetto di machine learning l’idea è
che invece di progettare l’insieme di
algoritmi precisi formule e regole come
facciamo in convenzionale a mano
algoritmo progettiamo un matematico
modello multistrato capace di utilizzare tutto il
anche dentro
mettere nel suo formato di riga per dare un po ‘
etichetta alimentare e per renderlo corretto
etichetta abbiamo inondato di migliaia di
esempi in modo che modificheremo il
reazioni a ciascun pixel e
combinazioni a queste reazioni e
combinazioni di combinazioni in modo che
finalmente hai il pixel in uscita come te
voglio così puoi leggere molto sull’IA
ma oggi abbiamo pre preparato qualcosa
meglio per te farai parte di un
incredibile esperimento che ti darà un
migliore sensazione di come lavoro di come al
funziona e, cosa più importante, mettendone un po ‘
luce su alcuni concerti del suo giusto
utilizzo così in questo esperimento sarai
l’IA e io ti addestreremo ad eseguire un
compito di categorizzazione semplice come ogni
rete all’inizio che hai
assolutamente nessuna idea di cosa tu voglia
vi sarà l’apprendimento e io
solo dare esempi, senza alcuna
spiegazione con etichette e dopo alcuni
esempi ti addestrerai per modellare il tuo
cervello così che alla fine quando ti do un
esempio di cui vedi il primo
tempo e non hai idea di cosa tu sia
saprai cosa rispondere sei pronto
va bene
immagine numero uno etichetta
immagine numero due
etichetta immagine numero tre
numero dell’immagine etichetta per etichetta
il tempo di allenamento è finito
ora è il momento per il test finale
per favore non sbrigarti ne hai un sacco
tempo e assicurarsi che le risposte consentite
sono sì e no quindi il test è arrivato
aspetta un secondo per favore ora alza il tuo
mani che votano per sì ok ora per favore
alza le tue mani chi vota per No
bellissimo
i risultati sono cinquemilatrenta
cinque quattro sì e uno per ora signore e
signori, signore e signori
abbiamo appena rilevato con successo un divano così
grazie mille per il tuo
contributo senza i tuoi voti questo
sarebbe impossibile farlo
esperimento abbiamo vinto siamo molto felici noi
sono milionari abbiamo vinto questo
la concorrenza però c’è qualcosa
inquietante c’è questo ragazzo che era
assolutamente accecato da altri meno
funzionalità importanti disponibili anche in
questa immagine e se avessimo più animali
gli amanti in questa stanza ci farebbero miseramente
non riescono a rilevare un brutto divano e sibili
vedi ora questa è una vera preoccupazione in AI
preparare una buona forma con precisione
set di allenamento inequivocabile è un’arte
e di solito non lo saprai ancora
esattamente ciò che l’algoritmo
avresti quindi bisogno di un grande
formazione per far sì che ciò accada e
a volte come designer, forse puoi
fare una scelta per permettersi un prezzo molto più basso
molto meno costoso un algoritmo che tu
può intuitivamente trovare qualcosa di carino
regole e formule per nel nostro caso il nostro
l’ algoritmo artigianale sarebbe un dolore
perché ciò che vogliamo è attaccare a
quarta dimensione a un’immagine che ha
solo due dimensioni, quindi diciamo una profondità
qui è codificato per colore, quindi se lo fossimo
in grado di rendere questa immagine fuori da ogni
inquadratura che otteniamo allora lo faremo
compire il nostro compito e finalmente lo faremo
basta rilevare alcune regioni nere e agire
di conseguenza per loro emettere nel nostro caso abbiamo
sarà utilizzando un convoluzionale profonda
rete neurale per raggiungere questo obiettivo
per addestrare una rete di cui abbiamo bisogno
dati di allenamento in altre parole, se vogliamo
la macchina per ottenere questa mappa di profondità
ogni frame in arrivo dobbiamo prima
mostragli 100.000 esempi di questo lavoro
fatto bene così dove prendere questi dati
da un modo per farlo sarebbe quello di prendere un
righello e per ogni pixel nell’immagine
misurare la distanza tra la nostra fotocamera
e l’oggetto in questo pixel si è ripetuto
per ogni pixel e quindi ripetere per
ogni immagine che abbiamo secondo il nostro
calcolo approssimativo il tempo necessario per
che sarebbe millesettecento
e ventinove giorni, così abbiamo deciso di farlo
utilizzare un approccio diverso se torniamo
al nostro algoritmo di promozione della struttura
può ricordare che funziona bene mentre si muove
lateralmente ma funziona un po ‘peggio
altri casi ma durante l’allenamento non lo facciamo
cura che possiamo preparare un bel scenario di
il nostro drone si sposta lateralmente verso l’altro
oggetti e poi qualche bel scenario
che si muove ad esempio da zero a quattro
metri da e per il pilastro per
esempio è per questo che lo chiamiamo il pilastro
imparando e quindi sei in grado di
effettivamente utilizzare la promozione della struttura per
produrre mappe della morte per te quali saranno
il tuo set di allenamento per la tua rete ora
questo sarà solo su scala come ho detto
tu e la bilancia galleggiamo così
cosa puoi fare di più puoi mettere a
istogramma di ogni pixel alla volta
può localizzare i pixel corrispondenti a
il pilastro e poi perché lo sai
è possibile da zero a quattro metri
normalizzalo e applicalo
normalizzazione all’immagine in modo che
ogni fotogramma ti fornisce una metrica corretta
distanza nella tua mappa della morte e questo è
come è possibile creare il set di formazione per
allenare la macchina e in effetti abbiamo
per dirti che siamo innamorati della nostra idea
tuttavia bisogna sapere che ci sono
modi molto più veloci per ottenere lo stesso risultato
soluzione e ora guarda che te lo dirò
di più su queste idee e sul profondo
reti neuronali convoluzionali ciao
ciao ciao a tutti, quindi è fantastico
migrare le cose da zero comunque
a volte è molto più saggio usare il
soluzione esistente è per questo che usiamo in profondità
rete neurale già addestrato per
stima della morte abbiamo scoperto che a sua volta
girato e ciò che è stato davvero bello non solo
nella struttura della rete ma anche il
il modello era disponibile per il download da
github
si stava evolvendo in due formati che usiamo
trasferimento dal modello è più popolare
ed è facile da usare ciò che è stato molto bello
anche gli outers della carta sono preparati
script che potremmo leggere e imparare come
per caricare il modello come adattarsi al nostro
dati personalizzati quindi dopo aver scaricato tutto il
roba noi
Dete prima prova e eravamo un po ‘ spaventati
perché la dimensione della madre era 200
il tempo di caricamento dei megabyte era di 5 minuti e
quella stima ha richiesto circa 40 secondi
quindi non era accettabile per il nostro
soluzione in tempo reale in tempo reale ma
fortunatamente abbiamo scoperto che abbiamo
macchina molto potente nel nostro TomTom
ufficio con due GTX titan x grafico
carte e con quella attrezzatura potremmo
raggiungere cento millisecondi ciò che era
davvero accettabile per il nostro sistema noi
avere tutto ciò che è necessario per
ulteriore sviluppo ma siamo ragazzi
non saprà davvero come funziona ciò che è
sotto il cofano e cercherò di spiegare
ora quindi questa recensione conoscenze
quindi la soluzione può essere descritta in
la frase profondamente convoluzionale
rete neurale con strati di upscaling
scoprire dalla rete residua 50 e
perché suona un po ‘terribile lo farò
prova a spiegarlo in parte, quindi iniziamo
con la rete neurale quindi probabilmente tutti
ha visto che questa immagine è completamente connessa
in una rete in cui ogni neurone è
collegato a ogni neurone in precedenza
strato ci sono connessioni che hanno
pesi e pesi sono regolati durante
processo di allenamento chiamato back propagation
quindi perché possiamo usare quella rete
nutrire la rete con l’immagine
catturato dalla fotocamera drone in modo da conoscerti
vedrà che l’immagine è fatta
programma cento per cento
ma anche se usiamo tale rete
abbiamo miliardi di pesi in quella rete
il che significa che ogni allenamento
durate
dovremmo aggiornare miliardi di pesi
è semplicemente impossibile convergere in
soluzione adeguata con tale rete che è
perché usiamo il neurale convoluzionale
reti e capire che abbiamo bisogno
per conoscere qualche concetto ulteriormente
convoluzione è un’operazione semplice
dove
a sinistra abbiamo l’ immagine e sul
abbiamo il kernel o il filtro
a volte a volte chiamato filtro e
cosa facciamo per ogni parte in the
frame calcoliamo la somma dei prodotti
valori tra i pixel nel kernel
e pixel in cornice così questo è
esempio di esempio kernel ha – 0 – 0 e 0
– il che significa che proverà ad esporre
bordi nell’immagine e dopo la convoluzione
vedi che i bordi sono migliori
visibile in nell’immagine secondo
concetto che è usato in conversal
i livelli nelle reti di conversione è max
messa in comune è usata per la riduzione delle dimensioni
per il campionamento ed è molto stupido
operazione che prende il massimo valore
pixel e metterlo nell’output bianco
stava funzionando perché supponiamo
che le informazioni più preziose sono memorizzate
nel valore massimo pixel nelle mappe delle caratteristiche
nella rete e in realtà lo era
verificato in esperimenti che funziona
funziona bene e può essere un’operazione così semplice
potrebbe aiutarci a ridurre le dimensioni di
la mappa caratteristica dell’emettitore è l’ultimo concetto
Sto tirando è anche abbastanza stupido
perché è abituato a campionare e noi
prendi il pixel dall’input e
mettilo nell’angolo in alto a sinistra per ciascuno
4 pixel nell’output quindi la domanda
è il motivo per cui tutti questi zeri sono in qualche modo
necessario nell’output e in realtà
non sono importanti ma usiamo sempre
su tirando strati interfogliati con
convoluzioni quindi avremo interpolazione
tra tutti questi pixel e abbiamo il
piccola uscita liscia per ulteriori
elaborazione in là nella rete
di solito nelle reti conversazionali che usano
certificato nella nostra unità come attivazione
funziona è molto semplice che funzioni
è quasi lineare ma per valori negativi
i valori negativi sono tutti impostati a zero e
possiamo pensare a questa funzione come
più semplice possibile una funzione non lineare
può essere usato per aggiungere qualcosa di non lineare
non linearità alla rete
così come la conversione di un livello è così
abbiamo l’ immagine di input o la funzione di input
mappe abbiamo una serie di filtri uguali
numero di filtri come il numero di
canali li convogliamo e sommiamo
insieme applichiamo la funzione di attivazione
e abbiamo la mappa delle caratteristiche, se vuoi
avere più mappe di caratteristiche da estrarre
molte caratteristiche diverse che dobbiamo avere
più set di filtri, quindi qual è il
differenza tra strato convenzionale in
le lettere completamente collegate che stavo citando
prima che la differenza principale sia il numero di
modi in cui abbiamo creato la mappa delle caratteristiche usando
solo 27 pesi iniziano questi filtri
quindi abbiamo tre filtri 3 per 3, quindi è così
27 pesi se si desidera avere più
mamme come cento hai
3000 pesi ma stiamo producendo
centinaia di mappe di caratteristiche così tante
caratteristiche d’altra parte in pieno
strato connesso avrà 300 milioni
pesi ma usando solo uno solo
immagine quindi cosa è importante il
lo strato di conversione è molto buono a
produzione di funzionalità per la creazione di funzionalità
e converge e strato completamente connesso
è buono per aggregare informazioni e
è usato per la classificazione che è anche
importante strato completamente connesso non lo è
colore basso in modo da considerare ogni pixel
questo è nell’input e l’ altra mano
lo strato di conversione funziona localmente perché
il campo
Filtro convoluzionale funziona localmente
può essere abbastanza grande quindi il concorso potrebbe
essere abbastanza grande ma ancora lo è
è locale quindi questa immagine tipica di
conversione di chiunque in rete quindi prima parte
è l’ estrazione di funzionalità che consiste di a
pochi strati convoluzionali e poling massimo
i giocatori una seconda parte è la classificazione
che consiste di pochi pienamente connessi
strati tuttavia in questi giorni è abbastanza
popolare per rimuovere la parte di classificazione a
tutto o completamente parte della connessione e
scambiarlo con altre convoluzioni
e max pullings per avere solo un pixel
alla fine questo è un bel trucco per pareggiare
più ridurre il numero di pesi così abbiamo
modello più leggero ma per il nostro caso di dev
la stima non è sufficiente perché per
un’immagine di input abbiamo solo un pixel
uscita ma vogliamo avere pieno
mappa di profondità di risoluzione per la nostra immagine di input
ecco perché abbiamo bisogno di upscaling dei livelli così
se aggiungiamo alcuni strati di upscaling
intercalati con le circonvoluzioni che abbiamo
piena risoluzione che mappa alla fine
è abbastanza difficile addestrare tale rete
così un po ‘di rete da zero così è
bel trucco da usare che si chiama
messa a punto quindi funziona come prendiamo il
immagine prendiamo il modello della rete
questo lo sta allenando completamente
compiti diversi come i gatti di classificazione
e cani e abbiamo tagliato alcuni strati a
Alla fine e abbiamo avuto un altro strato e noi
sono stati addestrati un modello per il nostro nuovo per il nostro
nuovo caso e può essere addestrato
aggiustando un po ‘tutti i pesi
o possiamo anche congelare il nostro congelare il
strati che il nostro faccio all’inizio
la rete perché in così grande
reti che questi primi strati producono molto
Funzionalità universali come spigolose
e cetera e gli outers del pifferaio
ha fatto esattamente queste cose
quindi hanno preso la rete di pozzi di resina 15
l’allenamento per qualche altro compito si muove molto
la parte di classificazione ha aggiunto l’ upscaling
strati e retro hanno bisogno della rete per
stima dei sordi e risultati sono abbastanza
incredibile così come vedi alcuni esempi
c’è un’immagine RGB e un grugnito di foto
al centro e quella previsione sul
giusto quindi è forse un po ‘ Smoove così
i bordi non sono così nitidi ma per il nostro caso
di evitare le collisioni è davvero
in attacco o anche più che abbastanza così
ora Chris ti dirà di più sul nostro
sistema okay , torniamo per un
mentre al nostro sistema di progettazione iniziale che
è già un po ‘complicato con
i componenti per comodità scritti
in diverse lingue ma ora quando noi
aggiungi la nostra previsione della rete neurale profonda
diventa ancora peggio perché non solo
affrontiamo il porting di tutto su un Linux
macchina ma anche con un supporto CUDA
ovviamente, ma non possiamo semplicemente chiamare
Script Python in modo indipendente ogni volta
un nuovo frame viene perché avremmo bisogno
caricare ogni volta un modello da 200 megabyte
ogni 40 millisecondi che ci ucciderebbero
è ovviamente risolvibile ci sono persone
capace di gestire tutto il possibile
pezzi e farli funzionare come un perfetto
unità per coloro che non possono la parola
porta i micro servizi naturalmente questi
non sono l’ esempio perfetto di micro
servizi ma rompendo il nostro design in
componenti client-server hanno reso la nostra vita
molto più facile
e ora il quartier generale del nostro
l’applicazione è la nostra applicazione Python
richiede immagini dalla decodifica video
servizio di decodifica
li analizza con l’aiuto di
server puter che ha inviato il frame
rispondere con la mappa della morte, quindi abbiamo
App Python che ha l’ utente grafico
interfaccia per l’utente quando puoi
decidere quale livello di autonomia si dovrà
utilizzare premendo semplicemente i tasti e poi
a seconda che sia manuale o
I comandi automatici per il drone sono
servito al cliente che comunica
direttamente al drone va bene così finalmente
avendo risolto tutti i puzzle è tempo
per la dimostrazione definitiva e lo siamo
molto felice di poterlo mostrare a voi
oggi perché durante il giorno di
registrando questa presentazione questo volo
abbiamo avuto un incendio se non sai che a
il fuoco è un fuoco è un insieme di errori che
lo sviluppatore che si rispetti dovrebbe
esperienza durante il giorno della consegna
e abbiamo avuto che non vedrai questo in
questa dimostrazione perché stiamo usando
la piattaforma di consegna più sicura
statisticamente dimostrato di essere PowerPoint
ora sul serio i pezzi funzionano perfettamente
stabile ma abbiamo avuto qualche problema con il
comunicazione è per questo che il video funziona
stiamo per mostrarti è probabilmente il
migliore di 10
ma penso che ti piacerà quindi andiamo
iniziare bene sul lato destro che puoi vedere
cosa non vola in basso a sinistra tu
può vedere il nostro cervello artificiale mostrarci
la mappa della morte e secondo se il
il colore blu emerge rispetto alla freccia
mostra che l’azione da intraprendere in realtà
emetti l’ostacolo così in alto a sinistra tu
può vedere il cerchio rosso su cui clicchiamo
l’inizio in modo che il drone volerà
autonomamente fino al corridoio
raggiunge le finestre così come puoi vedere
tutto è controllato automaticamente
la rete profonda più alcuni algoritmi
decidere come pilotare il drone fino a quando
in realtà finisce il suo volo al
finestra per dimostrare quanto sia ripetitivo
è il nostro processo che ti mostreremo lo stesso
video di nuovo ma ora puoi concentrarti sul
dettagli e guardalo davvero
quindi secondo il compito definisci bene dentro
All’inizio abbiamo un sistema alimentare
dove un utente nello show dove vogliono
volare e la Macchina spazzare il posto
e applicare
[Musica]
stesso sperimenta tutto usando mono
relazione di macchina fotografica che è la conclusione di
il nostro discorso di oggi è tutto ciò che dovevamo fare
mostraci oggi ma nelle nostre ultime parole se
abbiamo offeso qualcuno mentre proviamo ad essere
divertente per favore accetta quanto segue
le rettifiche prima di tutto sono i cani
i leader più amati di noi non sono secondariamente tutti
i giocatori di scacchi sono bizzarri quando tu
in realtà prendi il tuo vecchio buon tradizionale
scacchi a scacchi può essere un bel gioco e
infine l’irresponsabilità è divertente due
regole per ricordare la nostra prima attenzione
per le lampade nel tuo ufficio e in secondo luogo
se ti capita di registrare un video del tuo
drone, per esempio, si schianta nel
l’area di lavoro del tuo capo non l’ ha mai visto
pubblico
grazie mille
[Applausi]

Please follow and like us: