Обновить

LLM уверенно называет шахматные ходы, которых на доске нет. Как я проверяю каждый ее ответ кодом

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.4K
Всего голосов 1: ↑1 и ↓0+2
Комментарии10

Комментарии 10

На последний вопрос ответ - "никак". Девиз вайбкодера - слабоумие и отвага!

Спасибо, гляну

Они же не умеют играть в шахматы, как они должны объяснять ходы? Вообще, задача интересная - зафайнтюнить экспертную модель, чтобы играла хотя бы не хуже гроссмейстера и могла объяснять логику ходов человечьим языком. Шахматные данные стокфиш нагенерит.

Кажется любая современная модель без проблем объяснить должна. Это простая же совсем задача для сетки.

Тут проблема в том что те модели/программы которые хорошо умеют играть в шахматы, объяснять ничего не умеют. И наоборот, те которые умеют общаться, играют в шахматы в лучшем случае на уровне начинающего любителя. Поэтому при попытках объяснять, они наверняка начнут галлюцинировать, придумывать что-то правдоподобное.

Поэтому и интересно - если взять LLM-ку, которая уже умеет говорить и обладает знаниями об окружающем мире, и научить её неплохо играть в шахматы. Сможет ли она логично объяснять свои ходы, если конкретно этой задаче - объяснению ходов - её отдельно не обучали?

Ну как сказать. Вон какой-то лидерборд показывает вполне достойный ELO.

Играть на уровне гроссмейстера не сможет, но объяснить вполне. Такого ELO должно хватить чтобы понять ходы.

У них же там турниры исключительно между LLM-ками проводятся. ELO в данном случае не эквивалентен FIDE или Lichess рейтингу, а просто показывает что какие-то модельки играют лучше других.

Внизу страницы дисклеймер:

Elo is always relative to the player pool it's measured in. lichess rating ≠ chess.com rating ≠ fide rating ≠ engine rating ≠ llm rating ≠ perceived rating

На всякий случай спросил у DeepSeek об этом - он тоже говорит что "Modern LLMs are remarkably poor at actually playing chess". Постоянно галлюцинируют и делают невозможные ходы.

Буквально следующий абзац там же

~1200 Continuation-rated models matched ~1400 rated Lichess bots, while ~1850 Elo in this leaderboard (best reasoners) correlated roughly to Lv16 Expert 2000 chess.com bots.

Нормально они играют.

Хороший вопрос, проверенного ответа у меня нет. Из того, что вижу на практике: даже когда ход выбрал Stockfish и модели его просто передали, она все равно объясняет его ходами, которых в позиции нет. Так что играть и честно объяснять, похоже, разные навыки.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации