Segmentace objektů - Object co-segmentation

Image
Ukázkové videozáznamy a jejich anotace společné segmentace objektů (základní pravda) v datové sadě Noisy-ViDiSeg. Segmenty objektů jsou znázorněny červeným okrajem.

V počítačovém vidění , objekt co-segmentace je zvláštní případ segmentace obrazu , která je definována jako společně segmentace sémanticky podobné objekty v několika obrazů nebo video snímků.

Výzvy

Často je náročné extrahovat segmentační masky cíle / objektu z hlučné sbírky obrazů nebo video snímků, což zahrnuje objevování objektů spojené se segmentací . Hlučný kolekce vyplývá, že objekt / target je přítomen sporadicky v sadě obrázků nebo objektu / cíl zmizí přerušovaně v celém videu zájmu. První metody obvykle zahrnují reprezentace na střední úrovni, jako jsou návrhy objektů .

Metody založené na dynamických Markovových sítích

Image
Proces odvození dvou spojených dynamických Markovových sítí k získání společného zjišťování a segmentace video objektů
Image
Společný objekt pro objevování a ko-segmentační rámec založený na spojených dynamických sítích Markov.

Nedávno byla navržena metoda společného objevování objektů a ko-segmentace založená na spojených dynamických Markovových sítích , která požaduje významné zlepšení odolnosti proti irelevantním / hlučným videozáznamům.

Na rozdíl od předchozích snah, které pohodlně předpokládají konzistentní přítomnost cílových objektů v celém vstupním videu, tento spojený duální dynamický algoritmus založený na Markovově síti současně provádí jak detekční, tak segmentační úkoly se dvěma příslušnými Markovovými sítěmi společně aktualizovanými prostřednictvím šíření víry.

Konkrétně je Markovova síť zodpovědná za segmentaci inicializována superpixely a poskytuje informace o svém Markovově protějšku odpovědném za úkol detekce objektů. Naopak Markovova síť odpovědná za detekci vytváří graf návrhu objektu se vstupy včetně prostoročasových segmentačních trubek.

Metody založené na grafovém řezu

Optimalizace řezu grafu je oblíbeným nástrojem v počítačovém vidění, zejména v dřívějších aplikacích pro segmentaci obrazu . Jako rozšíření pravidelných výřezů grafů se navrhuje víceúrovňový výřez hypergrafu, který zohledňuje složitější korespondence vyššího řádu mezi skupinami videí mimo typické párové korelace.

S takovým rozšířením hypergrafu lze do výpočtu hyperedge bez problémů začlenit více modalit korespondence, včetně vzhledu na nízké úrovni, výběžku, koherentního pohybu a prvků na vysoké úrovni, jako jsou oblasti objektů. Kromě toho, jako hlavní výhodu oproti společný výskyt přístup založený, hypergraph implicitně zachovává složitější vzájemné shody mezi jeho vrcholů, s hyperedge závaží vhodně vypočtených vlastní hodnoty rozkladem z laplacián matic .

Metody založené na CNN / LSTM

Image
Přehled lokalizace časových akcí hrubé až jemné v. A) Hrubá lokalizace. Vzhledem k nezkrácenému videu nejprve generujeme videoklipy s vědomím ostražitosti pomocí posuvných oken s proměnnou délkou. Síť s návrhem rozhodne, zda videoklip obsahuje nějaké akce (takže je klip přidán do sady kandidátů) nebo čisté pozadí (takže je klip přímo zahozen). Následná klasifikační síť předpovídá konkrétní třídu akcí pro každý klip kandidáta a vydává skóre klasifikace a štítky akcí. (b) Jemná lokalizace. S klasifikačními skóre a štítky akcí z předchozí hrubé lokalizace se provede další predikce kategorie videa a získá se její počáteční a koncový rámec.
Image
Vývojový diagram časoprostorové časové lokalizace detektoru segmentu-trubice. Jako vstup obsahuje neoříznuté video více snímků akcí ( např . Všechny akce ve videu párů v krasobruslení), přičemž pouze část těchto snímků patří do příslušné kategorie ( např . DeathSpirals). Obvykle existují irelevantní předchozí a následující akce (pozadí). Detektor segmentové trubice iterativně střídá optimalizaci časové lokalizace a prostorové segmentace. Konečným výstupem je posloupnost segmentačních masek na jednotlivé snímky s přesnými počátečními / koncovými snímky označenými červeným blokem dole, zatímco pozadí je dole označeno zelenými bloky.

V aplikacích pro lokalizaci akcí je společná segmentace objektů implementována také jako časoprostorový detektor segmentových trubek . Inspirován nedávnými snahami o časoprostorovou lokalizaci akcí s tubelety (sekvence ohraničujících rámečků), Le et al. představuje nový časoprostorový akční lokalizační detektor Segment-tube, který se skládá ze sekvencí segmentačních masek po jednotlivých snímcích. Tento detektor segmentové trubice může dočasně určit počáteční / koncový rámec každé kategorie akcí v přítomnosti předcházejících / následných interferenčních akcí v nezkrácených videích. Současně detektor segmentových trubek produkuje segmentační masky na jednotlivé rámečky namísto ohraničujících rámečků, které tubetům nabízejí vynikající prostorovou přesnost. Toho je dosaženo střídáním iterativní optimalizace mezi lokalizací časové akce a segmentací prostorové akce.

Navrhovaný detektor segmentové trubice je znázorněn na vývojovém diagramu vpravo. Ukázkovým vstupem je neoříznuté video obsahující všechny snímky ve videu párového krasobruslení, přičemž pouze část těchto snímků patří do příslušné kategorie (např. DeathSpirals). Tato metoda, která byla inicializována segmentací obrazu na základě salience na jednotlivých rámcích, nejprve provede krok lokalizace časové akce s kaskádovými 3D CNN a LSTM a určí počáteční snímek a konečný snímek cílové akce strategií hrubého k jemnému. Následně detektor segmentových trubek zpřesní prostorovou segmentaci na snímek s oříznutím grafu zaměřením na relevantní snímky identifikované krokem lokalizace časové akce. Optimalizace se iterativně střídá mezi časovou lokalizací akce a segmentací prostorové akce. Po praktické konvergenci jsou konečné výsledky prostoroprostorové lokalizace akce získány ve formátu posloupnosti segmentačních masek na jednotlivé snímky (spodní řada ve vývojovém diagramu) s přesnými počátečními / koncovými snímky.

Viz také

Reference