Pull to refresh

Comments 2

Обе цифры, 0.671 и 0.675, получены на одном seed, и разница объявлена шумом без замера самого шума. Я бы прогнала оба варианта на пяти сплитах: разброс macro-F1 вполне может оказаться больше 0.004, и тогда вывод «вровень» звучит сильнее, а не слабее. Еще весь спор упирается в класс «нейтрально» с F1 около 0.30 — его толком не решает никто, а метка из тройки в рейтинге сама по себе прокси сомнительного качества. Считали macro-F1 по двум классам, без нейтрали: паритет с бейзлайном там сохраняется?

спасибо, замечание точное. прогнали оба варианта на пяти сплитах (разный seed - своя подвыборка 60k и свое разбиение) плюс отдельно бинарный вариант без нейтрали

разброс на 3 класса (macro-F1):
• TF-IDF 1-2-gram: 0.668 ± 0.005
• rubert-tiny2 взвешенный: 0.682 ± 0.009
• парная разница по сплитам: +0.015 ± 0.010, положительная на всех пяти ([+0.003, +0.009, +0.021, +0.027, +0.013])

Вы правы. собственный разброс каждой модели уже больше тех 0.004 из статьи, так что на одном seed объявлять разницу шумом было, с моей стороны, некорректно. при этом попарно на одном сплите трансформер стабильно впереди, но немного, около полутора пунктов macro-F1. так что конечно не «вровень», а «маленький, но устойчивый перевес». формулировку в тексте поправлю

без нейтрали (бинарно негатив/позитив, seed 42): TF-IDF 0.869, rubert-tiny2 0.904, разница +0.035. паритет не держится, трансформер отрывается заметнее. похоже, нейтраль стягивала числа вместе, а не создавала разницу

что не поменялось - цена: даже +0.035 стоят ~170× по времени обучения и ~40× по инференсу на CPU. поэтому вывод немного переформулирую. замер разброса добавлю в статью отдельным апдейтом, спасибо за дельный разбор!

Sign up to leave a comment.

Articles