A számítógépes látás (Computer Vision, CV) a mesterséges intelligencia azon ága, amely lehetővé teszi a gépek számára a digitális képek és videók értelmezését, elemzését és feldolgozását. Míg az emberi agy a vizuális információt ösztönösen dolgozza fel, a számítógépes rendszereknek explicit matematikai módszerekkel kell megtanulniuk ezt a folyamatot.
A mélytanulás — különösen a konvolúciós neurális hálózatok (CNN) — elterjedésével a számítógépes látás pontossága drasztikusan javult: az ImageNet benchmarkon az emberi szintű teljesítmény (kb. 5% hibaarány) először 2015-ben dőlt meg, azóta a legjobb modellek 1,5–2%-os hibaarányt érnek el.
Alapvető számítógépes látás feladatok
Egy képhez egyetlen kategóriacímke hozzárendelése. Az ImageNet verseny nyertesei évről évre javítják az emberi teljesítményt meghaladó pontosságot.
Több objektum egyidejű lokalizálása és osztályozása befoglalt négyszögekkel (bounding box). YOLO, Faster R-CNN és DETR vezető architektúrák.
Pixelszintű osztályozás: semantikus, instance és panoptic szegmentálás különböző pontossági igényekhez. Orvosi képdiagnosztika és autonóm járművek kulcseszköze.
Vezető Modellek és Architektúrák 2024–2025-ben
A területet az elmúlt évben a Vision Transformer (ViT) architektúra és az úgynevezett foundation modellek dominálják. Ezek a modellek hatalmas, nem-feladatspecifikus adatkészleteken előtanult modellek, amelyeket aztán kisebb adatmennyiséggel finomhangolnak konkrét feladatokra.
- SAM (Segment Anything Model): A Meta által 2023-ban publikált modell bármilyen képen futtatható szegmentálást tesz lehetővé, egyetlen interaktív prompttal.
- CLIP (OpenAI): Képeket és szövegeket közös reprezentációs térbe vetít, lehetővé téve a szövegalapú képkeresést és -osztályozást.
- Grounding DINO: Nyílt szókészletű objektumdetektálás — nem csupán előre definiált, hanem tetszőleges szövegesen leírt objektumok detektálása.
- Florence-2 (Microsoft): Egységes, többfeladatos vizuális modell, amely osztályozástól a képgenerálásig 15 különböző feladatot old meg egyetlen modellel.
A valós idejű objektumdetektálás autonóm rendszerek és intelligens kamerák alapja.
Iparági alkalmazások és magyarországi vonatkozások
A hazai autóipari és elektronikai gyártósorokon a CV-alapú hibaazonosítás 10-15-szörösére gyorsítja az ellenőrzési folyamatokat és 3–5%-kal csökkenti a selejtarányt. Az Audi Győr és a Samsung SDI tatabányai üzemei már alkalmazzák ezeket a megoldásokat.
Az MRI és CT felvételek MI-alapú elemzése a radiológiai munkafolyamatok 20–30%-os felgyorsítását teszi lehetővé. A Semmelweis Egyetem pilot projektje 94,7%-os szenzitivitást ért el mellrák korai felismerésében.
Budapest intelligens kamerarendszere CV-alapú forgalomszámlálást, incidensdetektálást és jogsértés-felismerést alkalmaz. A rendszer 2023-ban 1,2 millió szabálysértési eseményt rögzített automatikusan.
Polctérkép-elemzés, kasszamentes fizetési megoldások és vásárlói viselkedéselemzés. A hazai SPAR üzletekben tesztelt rendszer 8%-kal csökkentette a hiányáruk arányát.
Adatvédelem és Arcfelismerés — Kritikus Kérdések
A számítógépes látás egyik legkontroverzálisabb alkalmazása az arcfelismerés. Az EU AI Act I. melléklete szerint az arcfelismerés nyilvános tereken általánosan és valós időben „elfogadhatatlan kockázatúnak" minősül és tilalom alá esik — néhány szigorúan körülírt kivételtől eltekintve (büntetőeljárás, terrorveszély).