0
Přejít na obsah

Embedding

Embedding je číselná reprezentace významu obsahu, která umožňuje porovnávat podobnost textů, obrázků nebo jiných dat.

Co je embedding

Embedding převádí význam textu, obrázku nebo jiného objektu na soubor čísel. Objekty s podobným významem se v tomto prostoru nacházejí blízko sebe. Díky tomu lze hledat podle smyslu, nikoli pouze podle přesné shody slov.

Jak funguje v praxi

Dotaz na nepromokavou tmavě modrou bundu může najít produkt popsaný jinými slovy, pokud model rozpozná podobný význam. Stejný princip se používá při doporučování, seskupování dokumentů, hledání podobných obrázků a doplňování kontextu pro asistenta AI.

Model a dělení obsahu

Model se vybírá podle jazyka, typu dat, kvality a nákladů. Dlouhý dokument se dělí na logické části, které musí zachovat význam a potřebný kontext. Příliš malé části ztrácejí souvislosti, příliš velké zhoršují přesnost a zvyšují náklady.

Index a podobnost

Vektory se ukládají do indexu společně s metadaty a oprávněními. Výsledky ovlivňuje zvolená metrika podobnosti, filtry a počet kandidátů. Přístup k dokumentu se kontroluje před vrácením výsledku, aby sémantické hledání neodhalilo cizí data.

Testování a aktualizace

Kontroluje se přesnost prvních výsledků, pokrytí důležitých dotazů, rychlost a falešná podobnost. Při změně modelu je zpravidla nutné znovu vytvořit index. Testovací sada obsahuje běžné otázky, těžké výjimky i případy, ve kterých výsledek nemá být vrácen.

Přístup PAR HOUSE Agency

Embedding nasazujeme až po definování konkrétního procesu a měřitelné kvality. Čistíme zdroje, volíme logické dělení, metadata a bezpečnostní pravidla. Výsledek porovnáváme s běžným vyhledáváním a rozšiřujeme jej pouze tehdy, když přináší prokazatelně lepší odpovědi.