Mapa kvality základních škol postavená na veřejně dostupných dokumentech.
Rodič zvolí své priority — od konstruktivistické matematiky po školního psychologa — a mapa ukáže školy, které je splňují.
Výchozí potřeba: porovnat školy v okolí.
Neexistuje způsob, jak školy rozumně porovnat, ani jak o nich zjistit konkrétní informace.
Provizorní řešení: ručně dohledat ŠVP a vložit celé PDF do Gemini chatu.
Předpoklad: každá škola publikuje ŠVP v PDF.
První iterace: headless LibreOffice a konverze do PDF. Výsledná PDF ale přes Gemini zpracovat nejdou.
Druhá iterace: konverze do markdownu přes PyMuPDF4LLM. Funkční.
Řetězec DOCX → PDF → MD je ale zbytečně dlouhý a ztrácí kontext.
Chunking dokumentů: Chonkie, několik iterací s různými algoritmy.
Docling: robustní, ale nevhodný pro větší objemy.
Finální volba: Kreuzberg — all-in-one document intelligence. Na vstupu libovolný dokument, na výstupu kvalitní chunky.
První verze: výběr chunků přes cosine distance a jeden velký prompt pro extrakci strukturovaných dat.
Funkční, ale drahé a náročné na tokeny.
Řešení: více menších promptů podle tematických skupin kritérií — příbuzná témata se potkávají ve stejných chuncích.
Recall@5: podíl testovacích dotazů, u kterých se relevantní chunk dostal do top 5 výsledků.
Lemmatizace pro češtinu, ColBERT ani late interaction nepřinesly dostatečnou kvalitu za rozumnou cenu.
Hybrid retrieval ale vrací výrazně více kandidátů, než kolik jde poslat do promptu.
Srovnání: Gemini Flash vs Flash Lite.
Flash Lite na první pohled neobstojí: spotřebuje tolik thinking tokenů, že smaže úsporu z nižší ceny za token.
Zjištění: pro extrakci strukturovaných dat velmi dobře použitelný — vyžaduje ale správně postavené prompty a prakticky vypnutý thinking.
Řada škol ŠVP nezveřejňuje nebo jen v nepoužitelném formátu.
Některá kritéria navíc v ŠVP nejsou — školy je ale prezentují na svém webu.
Rozdíl 24 bodů podle pokrytí. Nad ~20 kritérii se trend zastaví — index přestává sledovat pokrytí a začíná sledovat obsah.
A1 chronologie · A2 preprocessing · A3 benchmarky · A4 schemas · A5 harvester · A6 databáze · A7 feedback · A8 costs · A9–A10 stack
score = průměr contribution ∈ [−1, +1]; boolean ±1, scale = value / 10, NULL (bez dat) do průměru nevstupuje.
Kritérií na školu: min 1 · medián 20 · max 29 · floor n ≥ 20.
Rozptyl pokrytí, ne žebříček krajů. Kraj z adresy v registru škol.
Procenta z hodnocených škol kritéria, ne ze 4 369.