Hvordan genkender computere menneskelige ansigter?

I dette blogindlæg vil vi se på principperne og processerne bag, hvordan computere genkender menneskelige ansigter, på en enkel og ligetil måde.

 

Hvilke principper ligger til grund for ansigtsgenkendelse?

Du har sikkert spillet et spil mindst én gang som barn, hvor du skulle lave et menneskeansigt. I dette spil vælger du først en ansigtsform, derefter vælger du frisure, øjne, næse og mund én efter én og placerer dem på ansigtet. Ved at skifte mellem forskellige frisurer, øjne, næser og munde kan du skabe det ansigt, du ønsker. Den måde, computere genkender og sammenligner ansigter på, er ikke meget anderledes end dette. Computere identificerer og gemmer ansigtstræk; når et nyt billede af et ansigt indtastes, sammenligner de det med de gemte træk for at bestemme, hvem personen er.
Et nyligt eksempel på ansigtsgenkendelsesteknologi, der er let tilgængelig, er ansigtsgenkendelsesapplikationen (App). Disse apps forudtrækker og gemmer vigtige træk – såsom ansigtskonturer, øjne, næser og mund – fra fotos af berømtheder. Senere, når en persons ansigt optages via kameraet, udtrækker appen ansigtstræk på samme måde og sammenligner dem med de gemte ansigtstræk fra berømtheder for at identificere og vise den person, der matcher bedst.

 

Hvordan genkender en computer et ansigt?

Lad os nu undersøge computerens ansigtsgenkendelsesproces. Ansigtsgenkendelse består af fire hovedfaser: input, ansigtsgenkendelse, funktionsudtrækning og sammenligning.
I inputfasen overføres et enkelt billede fra et foto eller en video til computeren via en inputenhed. Generelt gælder det, at jo højere opløsningen på inputenheden er, og jo højere antallet af billeder pr. sekund (FPS) er, desto mere præcist kan ansigter genkendes. Dette princip svarer til, hvordan en person med godt syn mere præcist kan genkende ansigtet på en person, der står langt væk.
I ansigtsgenkendelsesfasen kontrollerer systemet først, om der er et ansigt på det inputfoto eller den inputvideo. For at gøre dette identificerer det ansigtets omrids og nøglefunktioner såsom øjne, næse og mund. Selvom forskellige ansigtsgenkendelsesteknikker er i brug i øjeblikket, vil vi her fokusere på den repræsentative Haar-lignende detektionsmetode.
Haar-lignende detektionsmetode anvender Haar-wavelets. En wavelet er et simpelt rektangulært mønster bestående af sorte og hvide områder. Disse sort-hvide områder bruges til at identificere områder i et billede, hvor der forekommer forskelle i lysstyrke. Ved at anvende wavelets i forskellige størrelser og former på tværs af hele inputbilledet eller videoen og derefter kun bevare de steder, hvor lysstyrkeforskellen mellem de sorte og hvide områder er betydelig, kan systemet effektivt registrere ansigtets omrids og vigtige ansigtstræk såsom øjne, næse, mund og øjenbryn. Desuden muliggør denne proces også udtrækning af positionsinformation vedrørende ansigtstræk.
For eksempel, når man udtrækker information om øjnene, placeres de sorte områder af wavelet'en, så de svarer til relativt mørke områder – såsom pupillen – mens de hvide områder svarer til lyse områder, såsom huden. Ved at udnytte disse lysstyrkeforskelle kan øjnenes position og form effektivt detekteres.

 

Hvordan udtrækkes ansigtstræk?

Når ansigtsgenkendelsesfasen er fuldført, afgør systemet, om det skal fortsætte til funktionsudtrækningsfasen.
I ansigtsudtrækningsfasen udtrækkes ansigtstræk for fuldt ud at udnytte de ansigtskomponenter, der blev identificeret under ansigtsgenkendelsesfasen. I modsætning til ansigtsgenkendelsesfasen involverer denne proces et forbehandlingstrin. Da rotationsvinklen, størrelsen og lysintensiteten af ​​ansigter varierer med hvert fotografi eller video, udføres en normaliseringsproces for at standardisere dem så meget som muligt. Derudover kan farvefotografier eller videoer konverteres til sort-hvide billeder efter behov.
For eksempel konverteres det originale foto til gråtoner, hvorefter kun ansigtsområdet beskæres og skaleres til en ensartet størrelse, og histogramudligning udføres for at korrigere lysstyrken. Ved hjælp af positionsoplysningerne for ansigtskomponenterne, der opnås under ansigtsgenkendelsesfasen, udtrækkes ansigtstræk fra de fotos eller videoer, der har gennemgået denne forbehandling.

 

Hvordan bruges de udtrukne ansigtstræk?

I sammenligningsfasen gemmes informationen om disse ekstraherede ansigtskomponenter enten i en database (DB) eller sammenlignes med eksisterende ansigtsdata for at identificere det bedste match.
Vi har nu undersøgt processen med computerbaseret ansigtsgenkendelse. For blot et par årtier siden virkede ideen om en computer, der kunne skelne mellem mennesker, som en teknologi langt fra virkeligheden. Men med den hurtige udvikling af computerhardware, software og kunstig intelligens-teknologier er ansigtsgenkendelse nu meget udbredt inden for forskellige områder – herunder smartphones og bærbare computere, samt adgangskontrol, finansielle tjenester og lufthavnssikkerhed. I dag er den teknologi, der gør det muligt for computere at genkende menneskelige ansigter, ikke længere en fremtidshistorie, men er blevet en teknologi, der er naturligt integreret i vores dagligdag.

 

Om forfatteren