En aquesta entrada del blog, analitzarem de manera senzilla i directa els principis i processos que expliquen com els ordinadors reconeixen les cares humanes.
Quins principis fonamenten el reconeixement facial?
Probablement has jugat almenys una vegada de petit on havies de completar una cara humana. En aquest joc, primer selecciones una forma de cara, després tries el pentinat, els ulls, el nas i la boca un per un i els col·loques a la cara. Canviant entre diversos pentinats, ulls, nassos i boques, pots crear la cara que vulguis. La manera com els ordinadors reconeixen i comparen cares no és gaire diferent d'aquesta. Els ordinadors identifiquen i emmagatzemen els trets facials; quan s'introdueix una nova foto d'una cara, la comparen amb els trets emmagatzemats per determinar qui és la persona.
Un exemple recent de tecnologia de reconeixement facial fàcilment accessible és l'aplicació de reconeixement facial (App). Aquestes aplicacions preextreuen i emmagatzemen característiques clau, com ara contorns facials, ulls, nas i boca, de fotos de famosos. Més tard, quan la càmera captura la cara d'una persona, l'aplicació extreu les característiques facials de la mateixa manera i les compara amb les característiques facials emmagatzemades de famosos per identificar i mostrar la persona que més s'hi assembla.
Com reconeix un ordinador una cara?
Ara, examinem el procés de reconeixement facial de l'ordinador. El reconeixement facial consta de quatre etapes principals: entrada, detecció de cares, extracció de característiques i comparació.
A la fase d'entrada, un sol fotograma d'una foto o vídeo es transmet a l'ordinador a través d'un dispositiu d'entrada. Generalment, com més alta sigui la resolució del dispositiu d'entrada i com més alts siguin els fotogrames per segon (FPS), més precisament es podran reconèixer les cares. Aquest principi és similar a com una persona amb bona vista pot reconèixer amb més precisió la cara d'algú que es troba lluny.
En la fase de detecció de cares, el sistema primer comprova si hi ha una cara present a la foto o vídeo d'entrada. Per fer-ho, identifica el contorn de la cara i les característiques clau com ara els ulls, el nas i la boca. Tot i que actualment s'utilitzen diverses tècniques de detecció de cares, aquí ens centrarem en el mètode de detecció representatiu de tipus Haar.
El mètode de detecció de tipus Haar utilitza ondetes de Haar. Una ondeta és un patró rectangular simple compost per regions en blanc i negre. Aquestes regions en blanc i negre s'utilitzen per identificar àrees d'una imatge on es produeixen diferències de brillantor. Aplicant ondetes de diverses mides i formes a tota la imatge o vídeo d'entrada, i retenint només les ubicacions on la diferència de brillantor entre les regions en blanc i negre és significativa, el sistema pot detectar eficaçment el contorn de la cara i les característiques facials clau, com ara els ulls, el nas, la boca i les celles. A més, aquest procés també permet extreure informació posicional sobre les característiques facials.
Per exemple, quan s'extreu informació sobre els ulls, les regions negres de l'ondeta es posicionen per correspondre a zones relativament fosques, com ara la pupil·la, mentre que les regions blanques corresponen a zones brillants, com ara la pell. Mitjançant aquestes diferències de brillantor, es pot detectar eficaçment la posició i la forma dels ulls.
Com s'extreuen els trets facials?
Un cop finalitzada la fase de detecció de cares, el sistema determina si procedeix a la fase d'extracció de característiques.
En l'etapa d'extracció de característiques, s'extreuen les característiques facials per utilitzar completament els components facials identificats durant l'etapa de detecció de cares. A diferència de l'etapa de detecció de cares, aquest procés implica un pas de preprocessament. Com que l'angle de rotació, la mida i la intensitat de la il·luminació de les cares varien amb cada fotografia o vídeo, es realitza un procés de normalització per estandarditzar-los tant com sigui possible. A més, les fotografies o vídeos en color es poden convertir en imatges en blanc i negre segons calgui.
Per exemple, la foto original es converteix a escala de grisos, després només es retalla la regió de la cara i es redimensiona a una mida uniforme, i es realitza una equalització de l'histograma per corregir la brillantor. Utilitzant la informació de posició dels components facials obtinguda durant la fase de detecció de cares, s'extreuen els trets facials de les fotos o vídeos que han estat sotmesos a aquest preprocessament.
Com s'utilitzen els trets facials extrets?
Durant la fase de comparació, la informació sobre aquests components facials extrets s'emmagatzema en una base de dades (DB) o es compara amb dades facials existents per identificar la millor coincidència.
Ara hem examinat el procés de reconeixement facial basat en ordinador. Fa només unes dècades, la idea d'un ordinador que distingís entre persones semblava una tecnologia molt allunyada de la realitat. Tanmateix, amb el ràpid avenç del maquinari, el programari i les tecnologies d'intel·ligència artificial, el reconeixement facial ara s'utilitza àmpliament en diversos camps, com ara telèfons intel·ligents i ordinadors portàtils, així com control d'accés, serveis financers i seguretat aeroportuària. Avui dia, la tecnologia que permet als ordinadors reconèixer cares humanes ja no és una història del futur, sinó que s'ha convertit en una tecnologia que s'integra de manera natural a la nostra vida quotidiana.