Wie erkennen Computer menschliche Gesichter?

In diesem Blogbeitrag werden wir einen einfachen und unkomplizierten Blick auf die Prinzipien und Prozesse werfen, die der Gesichtserkennung durch Computer zugrunde liegen.

 

Welche Prinzipien liegen der Gesichtserkennung zugrunde?

Wahrscheinlich hast du als Kind mindestens einmal ein Spiel gespielt, bei dem man ein menschliches Gesicht vervollständigen musste. In diesem Spiel wählt man zuerst eine Gesichtsform aus und dann nacheinander Frisur, Augen, Nase und Mund und platziert sie auf dem Gesicht. Durch das Wechseln zwischen verschiedenen Frisuren, Augen, Nasen und Mündern kann man das gewünschte Gesicht gestalten. Die Art und Weise, wie Computer Gesichter erkennen und vergleichen, ist diesem Prinzip sehr ähnlich. Computer identifizieren und speichern Gesichtsmerkmale; wenn ein neues Foto eines Gesichts hochgeladen wird, vergleichen sie es mit den gespeicherten Merkmalen, um die Person zu bestimmen.
Ein aktuelles Beispiel für leicht zugängliche Gesichtserkennungstechnologie ist die Gesichtserkennungs-App. Diese Apps extrahieren und speichern wichtige Merkmale – wie Gesichtskonturen, Augen, Nase und Mund – aus Fotos von Prominenten. Wird später das Gesicht einer Person mit der Kamera erfasst, extrahiert die App die Gesichtsmerkmale auf dieselbe Weise und vergleicht sie mit den gespeicherten Gesichtszügen von Prominenten, um die Person mit der größten Ähnlichkeit zu identifizieren und anzuzeigen.

 

Wie erkennt ein Computer ein Gesicht?

Betrachten wir nun den Gesichtserkennungsprozess des Computers. Die Gesichtserkennung besteht aus vier Hauptphasen: Eingabe, Gesichtserkennung, Merkmalsextraktion und Vergleich.
In der Eingabephase wird ein einzelnes Bild aus einem Foto oder Video über ein Eingabegerät an den Computer übertragen. Generell gilt: Je höher die Auflösung des Eingabegeräts und je höher die Bildrate (Bilder pro Sekunde, FPS), desto genauer lassen sich Gesichter erkennen. Dieses Prinzip ist vergleichbar damit, wie ein Mensch mit gutem Sehvermögen das Gesicht einer Person in der Ferne besser erkennen kann.
In der Gesichtserkennungsphase prüft das System zunächst, ob auf dem eingegebenen Foto oder Video ein Gesicht zu sehen ist. Dazu identifiziert es die Gesichtskonturen und wichtige Merkmale wie Augen, Nase und Mund. Obwohl derzeit verschiedene Gesichtserkennungsverfahren zum Einsatz kommen, konzentrieren wir uns hier auf das repräsentative Haar-ähnliche Erkennungsverfahren.
Das Haar-ähnliche Erkennungsverfahren nutzt Haar-Wavelets. Ein Wavelet ist ein einfaches Rechteckmuster aus schwarzen und weißen Bereichen. Diese Bereiche dienen dazu, Helligkeitsunterschiede in einem Bild zu identifizieren. Durch die Anwendung von Wavelets unterschiedlicher Größe und Form auf das gesamte Bild oder Video und die anschließende Berücksichtigung der Bereiche mit signifikanten Helligkeitsunterschieden kann das System Gesichtskonturen und wichtige Gesichtsmerkmale wie Augen, Nase, Mund und Augenbrauen effektiv erkennen. Darüber hinaus ermöglicht dieses Verfahren auch die Extraktion von Positionsinformationen zu den Gesichtsmerkmalen.
Bei der Extraktion von Informationen über die Augen beispielsweise werden die schwarzen Bereiche der Wavelet-Transformation so positioniert, dass sie relativ dunklen Bereichen – wie der Pupille – entsprechen, während die weißen Bereiche hellen Bereichen – wie der Haut – entsprechen. Durch die Nutzung dieser Helligkeitsunterschiede lassen sich Position und Form der Augen effektiv erfassen.

 

Wie werden Gesichtsmerkmale extrahiert?

Sobald die Gesichtserkennung abgeschlossen ist, entscheidet das System, ob mit der Merkmalsextraktion fortgefahren werden soll.
In der Merkmalsextraktionsphase werden Gesichtsmerkmale extrahiert, um die in der Gesichtserkennungsphase identifizierten Gesichtskomponenten optimal zu nutzen. Im Gegensatz zur Gesichtserkennungsphase beinhaltet dieser Prozess einen Vorverarbeitungsschritt. Da sich Drehwinkel, Größe und Lichtintensität von Gesichtern in jedem Foto oder Video unterscheiden, wird eine Normalisierung durchgeführt, um diese so weit wie möglich zu standardisieren. Zusätzlich können Farbfotos oder -videos bei Bedarf in Schwarzweißbilder umgewandelt werden.
Beispielsweise wird das Originalfoto in Graustufen umgewandelt, anschließend wird nur der Gesichtsbereich ausgeschnitten und auf eine einheitliche Größe skaliert. Abschließend wird eine Histogramm-Equalisierung durchgeführt, um die Helligkeit anzupassen. Mithilfe der Positionsinformationen der Gesichtskomponenten, die während der Gesichtserkennung ermittelt wurden, werden aus den so vorverarbeiteten Fotos oder Videos Gesichtsmerkmale extrahiert.

 

Wie werden die extrahierten Gesichtsmerkmale verwendet?

Während der Vergleichsphase werden die Informationen über diese extrahierten Gesichtskomponenten entweder in einer Datenbank (DB) gespeichert oder mit vorhandenen Gesichtsdaten verglichen, um die beste Übereinstimmung zu ermitteln.
Wir haben nun den Prozess der computergestützten Gesichtserkennung untersucht. Noch vor wenigen Jahrzehnten schien die Vorstellung, dass ein Computer Menschen unterscheiden könnte, eine völlig unrealistische Technologie. Doch dank der rasanten Fortschritte bei Computerhardware, -software und künstlicher Intelligenz ist Gesichtserkennung heute in verschiedensten Bereichen weit verbreitet – darunter Smartphones und Laptops, aber auch Zutrittskontrolle, Finanzdienstleistungen und Flughafensicherheit. Die Technologie, die es Computern ermöglicht, menschliche Gesichter zu erkennen, ist heute keine Zukunftsmusik mehr, sondern selbstverständlicher Bestandteil unseres Alltags.

 

Über die Autorin