A számítógépes látás (Computer Vision, CV) a mesterséges intelligencia azon ága, amely lehetővé teszi a gépek számára a digitális képek és videók értelmezését, elemzését és feldolgozását. Míg az emberi agy a vizuális információt ösztönösen dolgozza fel, a számítógépes rendszereknek explicit matematikai módszerekkel kell megtanulniuk ezt a folyamatot.

A mélytanulás — különösen a konvolúciós neurális hálózatok (CNN) — elterjedésével a számítógépes látás pontossága drasztikusan javult: az ImageNet benchmarkon az emberi szintű teljesítmény (kb. 5% hibaarány) először 2015-ben dőlt meg, azóta a legjobb modellek 1,5–2%-os hibaarányt érnek el.

Alapvető számítógépes látás feladatok

Képosztályozás

Egy képhez egyetlen kategóriacímke hozzárendelése. Az ImageNet verseny nyertesei évről évre javítják az emberi teljesítményt meghaladó pontosságot.

Objektumdetektálás

Több objektum egyidejű lokalizálása és osztályozása befoglalt négyszögekkel (bounding box). YOLO, Faster R-CNN és DETR vezető architektúrák.

Szegmentálás

Pixelszintű osztályozás: semantikus, instance és panoptic szegmentálás különböző pontossági igényekhez. Orvosi képdiagnosztika és autonóm járművek kulcseszköze.

Vezető Modellek és Architektúrák 2024–2025-ben

A területet az elmúlt évben a Vision Transformer (ViT) architektúra és az úgynevezett foundation modellek dominálják. Ezek a modellek hatalmas, nem-feladatspecifikus adatkészleteken előtanult modellek, amelyeket aztán kisebb adatmennyiséggel finomhangolnak konkrét feladatokra.

  • SAM (Segment Anything Model): A Meta által 2023-ban publikált modell bármilyen képen futtatható szegmentálást tesz lehetővé, egyetlen interaktív prompttal.
  • CLIP (OpenAI): Képeket és szövegeket közös reprezentációs térbe vetít, lehetővé téve a szövegalapú képkeresést és -osztályozást.
  • Grounding DINO: Nyílt szókészletű objektumdetektálás — nem csupán előre definiált, hanem tetszőleges szövegesen leírt objektumok detektálása.
  • Florence-2 (Microsoft): Egységes, többfeladatos vizuális modell, amely osztályozástól a képgenerálásig 15 különböző feladatot old meg egyetlen modellel.
Számítógépes látás objektumdetektálás illusztrációja: városi utcakép különböző tárgyak és személyek körül húzott színes befoglaló téglalapokkal és osztálycímkékkel

A valós idejű objektumdetektálás autonóm rendszerek és intelligens kamerák alapja.

Iparági alkalmazások és magyarországi vonatkozások

Gyártás és minőségellenőrzés

A hazai autóipari és elektronikai gyártósorokon a CV-alapú hibaazonosítás 10-15-szörösére gyorsítja az ellenőrzési folyamatokat és 3–5%-kal csökkenti a selejtarányt. Az Audi Győr és a Samsung SDI tatabányai üzemei már alkalmazzák ezeket a megoldásokat.

Egészségügyi képdiagnosztika

Az MRI és CT felvételek MI-alapú elemzése a radiológiai munkafolyamatok 20–30%-os felgyorsítását teszi lehetővé. A Semmelweis Egyetem pilot projektje 94,7%-os szenzitivitást ért el mellrák korai felismerésében.

Intelligens közlekedés

Budapest intelligens kamerarendszere CV-alapú forgalomszámlálást, incidensdetektálást és jogsértés-felismerést alkalmaz. A rendszer 2023-ban 1,2 millió szabálysértési eseményt rögzített automatikusan.

Kiskereskedelem

Polctérkép-elemzés, kasszamentes fizetési megoldások és vásárlói viselkedéselemzés. A hazai SPAR üzletekben tesztelt rendszer 8%-kal csökkentette a hiányáruk arányát.

Adatvédelem és Arcfelismerés — Kritikus Kérdések

A számítógépes látás egyik legkontroverzálisabb alkalmazása az arcfelismerés. Az EU AI Act I. melléklete szerint az arcfelismerés nyilvános tereken általánosan és valós időben „elfogadhatatlan kockázatúnak" minősül és tilalom alá esik — néhány szigorúan körülírt kivételtől eltekintve (büntetőeljárás, terrorveszély).

EU AI Act — Arcfelismerési Tilalom2025. február 2-től az EU-ban tilos a biometrikus kategorizálás és az érzelmek felismerése munkahelyen és oktatási intézményben. Magyarországi szervezetek számára a megfelelés kötelező — jogsértés esetén az éves globális forgalom 3%-áig terjedő bírság szabható ki.