Co je embedding
Embedding převádí význam textu, obrázku nebo jiného objektu na soubor čísel. Objekty s podobným významem se v tomto prostoru nacházejí blízko sebe. Díky tomu lze hledat podle smyslu, nikoli pouze podle přesné shody slov.
Jak funguje v praxi
Dotaz na nepromokavou tmavě modrou bundu může najít produkt popsaný jinými slovy, pokud model rozpozná podobný význam. Stejný princip se používá při doporučování, seskupování dokumentů, hledání podobných obrázků a doplňování kontextu pro asistenta AI.
Model a dělení obsahu
Model se vybírá podle jazyka, typu dat, kvality a nákladů. Dlouhý dokument se dělí na logické části, které musí zachovat význam a potřebný kontext. Příliš malé části ztrácejí souvislosti, příliš velké zhoršují přesnost a zvyšují náklady.
Index a podobnost
Vektory se ukládají do indexu společně s metadaty a oprávněními. Výsledky ovlivňuje zvolená metrika podobnosti, filtry a počet kandidátů. Přístup k dokumentu se kontroluje před vrácením výsledku, aby sémantické hledání neodhalilo cizí data.
Testování a aktualizace
Kontroluje se přesnost prvních výsledků, pokrytí důležitých dotazů, rychlost a falešná podobnost. Při změně modelu je zpravidla nutné znovu vytvořit index. Testovací sada obsahuje běžné otázky, těžké výjimky i případy, ve kterých výsledek nemá být vrácen.
Přístup PAR HOUSE Agency
Embedding nasazujeme až po definování konkrétního procesu a měřitelné kvality. Čistíme zdroje, volíme logické dělení, metadata a bezpečnostní pravidla. Výsledek porovnáváme s běžným vyhledáváním a rozšiřujeme jej pouze tehdy, když přináší prokazatelně lepší odpovědi.