Profese

Evaluátor AI modelů (AI/LLM evaluator, evals engineer)

Také se říká: evals inženýr, tester jazykových modelů, specialista evaluací

Nově vzniklá profese

Nově vzniklá profese — zrodila se z vývoje posledních let: nástup umělé inteligence.

Co v této práci budete opravdu dělat

Evaluátor AI modelů navrhuje testy a metriky, kterými se měří, jak je jazykový model přesný, užitečný a bezpečný — je to kontrolor kvality pro umělou inteligenci. Stavíte sady testovacích úloh, tzv. evals (evaluace), definujete, co je správná odpověď, a pak automatizovaně i ručně vyhodnocujete tisíce výstupů modelu. K tomu patří Python, statistika a nástroje na správu datových sad. Poptávka je široká — na portálech Indeed a ZipRecruiter visí stovky inzerátů „LLM Evaluator“ — a najímají jak AI laboratoře, tak běžné firmy, které si chtějí ohlídat vlastní chatboty. Den je směs psaní kódu, čtení výstupů modelu a dohadování se s kolegy, co vlastně znamená „dobrá odpověď“; právě ta nejednoznačnost je na práci nejtěžší i nejzajímavější. Skvěle se sem skáče z pozice testera softwaru, datového analytika nebo i korektora a lingvisty — pečlivost tady váží víc než diplom. Formální certifikace zatím neexistuje, čeká se portfolio a znalost práce s jazykovými modely.

Kde profese vznikla a proč: vyrostla z boomu generativní AI, kdy firmy zjistily, že model bez měření kvality je jen drahá loterie.

Popis práce se mezi zaměstnavateli zásadně rozchází, protože standard řemesla se teprve píše. Čím víc AI proniká do zdravotnictví a financí, tím víc bude potřeba lidí, kteří ji umí přeměřit.