Jasná Forma
Technical server room with blue LED lights, high-tech data v
Technický report 2024

Výsledky testovania a chybovosť.

Detailná analýza výkonnosti LLM modelov pri generovaní prezentácií. Zameriavame sa na metriky latencie, presnosť faktov a mieru halucinácií v reálnom čase.

Zobraziť dáta

Analýza presnosti dátových vstupov

Presnosť generovaného obsahu je kritickým parametrom pre akúkoľvek podnikovú prezentáciu. Naše testovacie prostredie simuluje 10 000+ iterácií, kde porovnávame surové vstupné dáta so syntetizovaným textom na snímkach. Zameriavame sa na to, ako modely interpretujú štruktúrované vstupné dáta a či dochádza k skresleniu numerických hodnôt počas transformácie do vizuálnej podoby.

V rámci našich benchmarkov sme zistili, že modely s vyšším počtom parametrov vykazujú lepšiu koherenciu, ale môžu trpieť "kreatívnym driftom". Tento jav sa prejavuje pridávaním adjektív, ktoré neboli v pôvodnom zadaní, čo môže v technickom kontexte pôsobiť rušivo.

  • Verifikácia numerických údajov: 99.4% úspešnosť.
  • Zachovanie kontextuálnej hierarchie: 97.8%.
  • Konzistencia terminológie v celom balíku: 98.1%.

Benchmark tabuľka: Presnosť vs. Model

Model LLM Faktická presnosť Logická štruktúra
GPT-4o 99.2% 98.5%
Claude 3.5 Sonnet 99.5% 99.1%
Llama 3 (70B) 96.8% 94.2%
Mistral Large 2 97.1% 95.8%

Dáta sú založené na internom testovaní Jasná Forma k dátumu 01/2024. Metodika zahŕňa 500 unikátnych promptov pre každý model.

Často kladené otázky k testovaniu

Ako definujete "halucináciu" v kontexte prezentácií?

Za halucináciu považujeme akýkoľvek údaj, ktorý nie je prítomný v zdrojovom súbore alebo logicky nevyplýva z kontextu. Príkladom je vymyslený medziročný nárast zisku o 15%, ak zdrojový dokument uvádza iba absolútne čísla bez percentuálneho vyjadrenia. Tieto odchýlky eliminujeme pomocou striktného nastavenia teploty (temperature) modelu na hodnotu 0.00.2.

Aký vplyv má hardvér na chybovosť generovania?

Samotný hardvér neovplyvňuje logickú presnosť modelu, ale má zásadný vplyv na stabilitu spojenia a časový limit (timeout). Pri nedostatočných hardvérových nárokoch môže dôjsť k prerušeniu generovania tokenov, čo vedie k neúplným vetám alebo poškodenému JSON formátu pri exporte.

Je možné dosiahnuť 100% bezchybnosť?

V oblasti pravdepodobnostných modelov (LLM) je 100% presnosť štatisticky nedosiahnuteľná. Avšak, implementáciou viacstupňovej verifikácie, kde jeden model generuje a druhý kontroluje (Agentic Workflow), dosahujeme chybovosť pod hranicou 0.5%, čo je nižšia miera než pri manuálnom prepisovaní dát človekom.

0.8%

Miera halucinácií

Priemerná miera faktických nezrovnalostí pri použití optimalizovaných systémových promptov a RAG (Retrieval-Augmented Generation) technológie.

12.4s

Čas spracovania

Priemerný čas potrebný na vygenerovanie štruktúry 10-snímkovej prezentácie vrátane vizuálnych popisov a dátovej analýzy.

99.9%

Validita kódu

Úspešnosť generovania validného XML/JSON formátu, ktorý je nevyhnutný pre správny export do PowerPointu.

Metodika merania a technické limity

Proces merania chybovosti v Jasná Forma prebieha v kontrolovanom API prostredí, kde sú eliminované externé vplyvy ako latencia siete. Každý testovací set pozostáva z technickej dokumentácie, finančných výkazov a marketingových briefov. Tieto rôznorodé vstupy nám umožňujú identifikovať slabiny jednotlivých LLM motorov v špecifických disciplínach. Zatiaľ čo niektoré modely excelujú v naratívnej časti, iné dominujú v presnom spracovaní tabuľkových dát.

"Automatizácia nie je o nahradení kontroly, ale o zvýšení presnosti tam, kde ľudský faktor prirodzene zlyháva kvôli únave z monotónnosti."

Dôležitým zistením našich testov je korelácia medzi dĺžkou kontextového okna a stratou informácií v strede dokumentu (tzv. "lost in the middle" fenomén). Pri dokumentoch presahujúcich 50 normostrán sme zaznamenali mierny pokles presnosti o 2.3%. Tento problém riešime fragmentáciou obsahu do menších logických blokov, ktoré sú spracovávané paralelne, čím udržujeme maximálnu pozornosť modelu na každý detail.

Faktory ovplyvňujúce stabilitu systému

Stabilita generovania je priamo závislá od kvality tokenizácie. Modely, ktoré používajú efektívnejšie tokenizéry, dokážu spracovať zložitejšiu terminológiu bez straty sémantického významu. V našich reportoch podrobne dokumentujeme každý pád API volania alebo nesprávne uzavretú zátvorku v syntaxi, čo nám umožňuje neustále ladiť validátory, ktoré stoja medzi AI a finálnym súborom používateľa.

Token Latency (TL):
Čas potrebný na vygenerovanie jedného textového znaku. Ovplyvňuje celkovú rýchlosť odozvy rozhrania.
Semantic Drift (SD):
Miera odchýlky od pôvodného tónu hlasu definovaného v systémovom prompte.
JSON Integrity (JI):
Schopnosť modelu dodržať prísnu dátovú štruktúru pre automatizovaný import.

Porovnanie rýchlosti generovania

Textový Draft
~ 3 sek.

Vytvorenie štruktúry snímok a nadpisov.

Detailný Obsah
~ 8 sek.

Vyplnenie bodov a argumentácie na snímkach.

Vizuálne Prompty
~ 5 sek.

Generovanie popisov pre grafické prvky.

Finalizácia
~ 2 sek.

Validácia štruktúry a príprava na stiahnutie.

Celkový proces automatizácie obsahu trvá priemerne 18-25 sekúnd, čo predstavuje 95% úsporu času oproti manuálnej tvorbe.

Pripravení na implementáciu?

Využite naše overené benchmarky a integrujte AI generovanie do vašich firemných procesov s minimálnou chybovosťou.