Přeskočit na obsah
Čísla 3 min čtení

Bez jasného pokynu modely při doučování matematiky příliš napovídají, ukázal test Ai2

Institut Ai2 zveřejnil TutorMoments, měřítko postavené na 462 přepisech skutečného doučování matematiky. Sedmi jazykovým modelům dal roli doučovatele: bez bližšího pokynu většinou napovídaly za žáka a jen zřídka ho tlačily k vlastní úvaze. Pokyn, který ten rozdíl popsal, výsledky zvedl, ale mezeru k člověku nezavřel.

Institut Ai2 (Allen Institute for AI) zveřejnil 7. srpna náhled měřítka TutorMoments. Ptá se na jednu z nejtěžších věcí ve výuce: kdy má doučovatel zabrat a pomoct a kdy naopak ustoupit a nechat žáka počítat samotného. Test běží na přepisech skutečného doučování matematiky a sleduje, jak se v téže situaci zachová jazykový model, když ho posadíte na místo doučovatele.

Tabule s matematickými vzorci v učebně
Tabule s matematickými vzorci v učebně Cornellovy univerzity. Snímek je ilustrační, nepochází ze studie. Foto: LBM1948, Wikimedia Commons (CC BY-SA 4.0)

Hlavní zjištění zní: model, kterému řeknete jen „dobře doučuj“, většinou napoví za žáka a málokdy ho pošťouchne k vlastní úvaze. Když se do zadání ten rozdíl vypíše, výsledky se zvednou – ale k člověku, který se do situace trefí pokaždé, je nezavřou.

Jak se doučovatel testuje

TutorMoments nepracuje s umělými úlohami. Zkušení učitelé matematiky projdou přepis skutečné hodiny a označí klíčový okamžik – místo, kde se doučovatel musel rozhodnout mezi tím, že žákovi látku zpřístupní (opora, anglicky scaffolding), a tím, že na něj přitlačí a nechá ho myslet (tlak na náročnost).

Test pak přepis v tom bodě zastaví, předá ho modelu a ten pokračuje jako doučovatel po pět tahů (tři jeho, dva žákovy). Žáka přitom hraje jiný model, Claude Opus 4.6, kterému dají popis, jak se původní žák choval. Co doučovatel udělal, ohodnotí další model podle měřítek ověřených proti úsudku učitelů: dal oporu, když bylo potřeba? přitlačil, když byl žák připravený? a nepřehnal to s oporou? Sedm modelů takhle prošlo 520 okamžiků, rozdělených napůl mezi ty, kde se hodí opora, a ty, kde se hodí tlak.

Co je v přepisech

Zveřejněná sada TutorMoments-Preview obsahuje 462 anonymizovaných přepisů individuálního doučování matematiky s americkými žáky od druhé do sedmé třídy. Pochází z programu intenzivního doučování, jehož žáci většinou chodí do škol pro sociálně slabší; provozovatel je uvolnil pod výzkumnou doložkou, se kterou souhlasili rodiče. Osobní údaje z nich smazal nejdřív provozovatel a pak ještě druhý průchod uzpůsobený matematice, aby při čištění nesmazal čísla v příkladech.

Anotace dodalo 27 amerických učitelů, každý s praxí přes tři roky. Ve 122 přepisech označili 1 536 klíčových okamžiků, každý v průměru tři a půl krát. Vhodných na oporu je 738, na tlak 260 – tlak je vzácnější a hůř se rozpoznává, což je vidět i na výsledcích.

Bez pokynu se napovídá

Každé číslo v tabulce je podíl mezi 0 a 1: kolik z vhodných okamžiků model trefil. Nejvýmluvnější je tlak na náročnost; s prostým zadáním na něj modely skoro nesáhly, se zadáním, které rozdíl popisuje, výrazně přidaly.

ModelBez pokynuS pokynem
Claude Opus 4.80,2080,831
Claude Sonnet 4.60,0850,792
DeepSeek V4 Pro0,0880,492
Gemini 2.5 Pro0,2230,712
Gemini 3.5 Flash0,1580,646
GPT 5.50,0460,531
GPT 5.4 mini0,0230,404
Lidští doučovatelé0,182 (referenční)

Čísla platí pro tlak na náročnost ve vhodných okamžicích. GPT 5.5 s prostým zadáním přitlačil jen v 0,046 z nich, tedy ani ne v pěti ze sta. Lidští doučovatelé mají v téže sadě 0,182 – i to je nízké číslo, protože učitelé schválně vybírali okamžiky, kde doučování vázlo; nejde tedy o vzor ideální praxe, ale o přirozené srovnání.

Náš výpočet z tabulky: průměr přes všech sedm modelů je u tlaku na náročnost 0,12 s prostým zadáním a 0,63 se zadáním, které rozdíl popisuje. Prosté zadání tedy vyšlo hůř než lidská referenční hodnota; teprve pokyn ji překonal. Zvedly se všechny tři míry u všech sedmi modelů – rozhoduje tedy formulace zadání, ne jen volba modelu.

Co test neměří

Ai2 sadu označuje za náhled a sama vypisuje meze. Skóre popisuje, jak se model zachová v rozhodovacím bodě, ne jestli se žák něco naučil – žáka hraje model, ne dítě. Hodnotí ho navíc další jazykový model, byť ověřený proti učitelům, takže čísla jsou měřením jednoho nástroje, ne absolutní pravdou. Sada je taky úzká: americká, hlavně matematika prvního a druhého stupně, jeden okruh učitelů. A nejlepší modely, Gemini 2.5 Pro a Claude Opus 4.8, odpovídaly v průměru přes deset sekund na tah, což se do živé hodiny nehodí.

Celý postup i výsledky jsou v technické zprávě a kód k přehrávání hodin je na GitHubu. Ai2 chystá větší a vícejazyčnou verzi; náhled vyšel proto, aby k němu obor stihl dát připomínky dřív, než sada doroste.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    DFlash v hlavní větvi Ollamy zrychlil Lagunu-S při úpravách o 59 %, u prózy ji zpomalil

    Ollama přidala 8. srpna do hlavní vývojové větve blokové spekulativní dekódování DFlash pro modely Laguna. V jejím měření na M5 Max vzrostla rychlost Laguny-S při…

  2. Čísla

    OpenAI snížila ceny modelů GPT-5.6 Luna a Terra, aniž vydala nový model

    Od 30. července stojí GPT-5.6 Luna o 80 procent méně a Terra o 20 procent méně než dřív; OpenAI to zdůvodňuje úsporami v provozu, ne novým modelem. Čínský DeepSeek…

  3. Čísla

    LongCat-Flash-Lite-Sparse má pod MIT 138 GB vah a plné okno přidá dalších 16 GB

    Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Má 69 miliard parametrů, licenci MIT bez jakýchkoli prahů a kontextové okno 983 040…

  4. Čísla

    Po záměně průměru za nejslabší výsledek se první pětka HELM Lite vymění celá

    Pořadí modelů v žebříčku závisí na tom, jak se dílčí výsledky slijí do jednoho čísla. Práce ze sborníku workshopu GEM přepočítala dva veřejné žebříčky HELM podle…