Proces merania chybovosti v Jasná Forma prebieha v kontrolovanom API prostredí, kde sú eliminované externé vplyvy ako latencia siete. Každý testovací set pozostáva z technickej dokumentácie, finančných výkazov a marketingových briefov. Tieto rôznorodé vstupy nám umožňujú identifikovať slabiny jednotlivých LLM motorov v špecifických disciplínach. Zatiaľ čo niektoré modely excelujú v naratívnej časti, iné dominujú v presnom spracovaní tabuľkových dát.
"Automatizácia nie je o nahradení kontroly, ale o zvýšení presnosti tam, kde ľudský faktor prirodzene zlyháva kvôli únave z monotónnosti."
Dôležitým zistením našich testov je korelácia medzi dĺžkou kontextového okna a stratou informácií v strede dokumentu (tzv. "lost in the middle" fenomén). Pri dokumentoch presahujúcich 50 normostrán sme zaznamenali mierny pokles presnosti o 2.3%. Tento problém riešime fragmentáciou obsahu do menších logických blokov, ktoré sú spracovávané paralelne, čím udržujeme maximálnu pozornosť modelu na každý detail.
Faktory ovplyvňujúce stabilitu systému
Stabilita generovania je priamo závislá od kvality tokenizácie. Modely, ktoré používajú efektívnejšie tokenizéry, dokážu spracovať zložitejšiu terminológiu bez straty sémantického významu. V našich reportoch podrobne dokumentujeme každý pád API volania alebo nesprávne uzavretú zátvorku v syntaxi, čo nám umožňuje neustále ladiť validátory, ktoré stoja medzi AI a finálnym súborom používateľa.
- Token Latency (TL):
- Čas potrebný na vygenerovanie jedného textového znaku. Ovplyvňuje celkovú rýchlosť odozvy rozhrania.
- Semantic Drift (SD):
- Miera odchýlky od pôvodného tónu hlasu definovaného v systémovom prompte.
- JSON Integrity (JI):
- Schopnosť modelu dodržať prísnu dátovú štruktúru pre automatizovaný import.