Артём Дворянцев@Imperius14
Программмист и исследователь. Отец хейтеров
Информация
- В рейтинге
- 1 552-й
- Дата рождения
- Зарегистрирован
- Активность
Специализация
Инженер встраиваемых систем, ML разработчик
Средний
Git
Python
Golang
C
C++
Lazarus
Deep Learning
Короче, по справочнику физики он исправлять свою каку начал, но лимиты кончились в какой-то момент. Я обновлю в посте что справочники по схемотехнике и физике это пока что макеты из-за "лени" Codex, но планирую этот факап исправить на этой или следующей неделе.
мужик буквально сделал МАКЕТ СПРАВОЧНИКА а не сам справочник, по крайне мере у схемотехники и физики так, у матеши вроде нормально все, там инфа есть (но опять же с той поправкой что это нейрослоп, аудит по фактологии и работе интерактива проводился, но такими же агентами)
Вот честно, Opus так откровенно не наебывал никогда, хоть и не всегда делал именно то что просят. Короче, доверие к новой линейке моделей от OpenAI сильно упало, еще раз спасибо большое за фидбек, плюсик в карму
Скрин из физики. Меня вот это очень смущает, и это общая штука для справочника по физике и схемотехнике. Агент перечислили какие то темы которые вообще не кликабельны, непонятно что с ними делать. Короче, щас попробую разобраться, дело не быстрое, если что выяснится то отпишу сюда.
По математике вроде нормально все, я ее еще до этого смотрел, а схемотехника откровенно косячная. Ща еще физику посмотрю более детально
Пурупупу, согласен, какая-то херня полная, моя вина что хотя бы быстро не пробежался по сделанным карточкам, будем исправлять. Правда у меня недельные лимиты почти выжраны, но если что после 7го числа.
Буквально в самом посте сказано что это нейрослоп... Но за фидбек спасибо, щас посмотрю что в вашей цитате имеется ввиду.
Дык в самой статье есть разгадка. У этой модели кибер-этичность была ослаблена (только как понимаю не через файнтюн, а через содержание промта и выключенные классификаторы), это во первых, а во вторых, на уровне тех же весов у модели было выучено поведение "нужно выполнить задачу любой ценой".
Столкнувшись с задачей, которую невозможно решить легально, они и начали решать ее обходными путями. LLM постоянно работает с противоречащими друг другу стимулами, и на ее поведение будет сильно влиять и системный промт, и поведение заложенное в самих весах.
В первую очередь для себя делал, возникла идея сделать справочник по 9-11 классам, ибо там уже затрагиваются основы высшей математики, что для меня было бы полезно, но решил заодно сделать справочник и по более ранним примитивам на всякий. Еще раз спасибо за фидбек
Стоп, там есть и визуализация и сложение/вычитание, сразу после введения. Но небольшой косяк есть, глава называется "сложение дробей", хотя там и про сложение и вычитание, щас подправлю.
Ну дык нейрослоп и есть, сразу так сказал. У меня пока нет времени нормально по материалу пробежаться, хотя хочу этим заняться через недельку другую. За обратную связь спасибо большое, сохраню и щас исправлю наверное.
Поправка насчет токенов. На самом деле токенайзер может превращать в токены и целые слова, и отдельные буквы (например в русском есть союзы "и", "к", "а" и тд, в английском тоже есть), и ты можешь написать r a s b b e r r y и модель это поймет, но для нее это будут разные слова, хоть и с одинаковым смыслом.
Пример с rasberry это отличный пример, что люди не понимают, как LLM устроены. LLM не читает по буквам ВООБЩЕ, единственное что они воспринимают это кусочки слов, которые еще называются токенами. Для нее rasberry это не 'r' 'a' 's' 'b' 'e' 'r' 'r' 'y', а, например, 'rasb' 'erry', я понимаю что для человека это представить сложно, но для llm это нетривиальная задача именно поэтому.
Но Opus, например, в начале года вполне считал правильно даже без включенного размышления, хотя он на ходу решал перепроверить после правильного ответа, т.е он понимает что задача для него не самая простая.
А ваш пример с вазой странный. Вы буквально у отваленного днища у вазы что-то заклеиваете с другой стороны, даже если это твердая поверхность то конструкция будет ненадежной.
Надо переформулировать как с оригинальным вопросом с кружкой
Я сейчас проверил на том же DeepSeek. Expert даже без включенного Thinking ответил правильно. Instant без включенного Thinking почему-то решил что ваза теперь с двух сторон закрыта, но с включенным тоже логически довел до того, что вазу можно перевернуть, хоть и отметил что из-за ассиметрии верхней и нижней части вазы, она может ненадежно стоять.
Вот цитата DeepSeek Expert
А вот что ответил ChatGPT в Instant режиме на ваш оригинальный вопрос
У LLM все нормально с абстрактным мышлением, просто она текст вообще не видит как и мы, впрочем тупить они тут тоже могут, но американский фронтир (chapgt, gemini, opus и etc.) по идее решать такое должен без проблем
Но если мы эту границу пройдем и LLM можно будет использовать в энтепрайзе как мы щас используем их для наших проектов, то это будет означать что LLM потенциально сможет полностью заменить интеллектуального работника N. А там недалеко до запуска технологической сингулярности. Ну а мы пока находимся у подножия графика (или же на плато, все же это тех инновации, их появление невозможно предсказывать)
Попробуйте какими-нибудь агентами попользоваться, я не знаю. С начале 26 года сфера прошла прям фазовый переход.
Не знаю, LLM особенно фронтирные уже решают практически все интеллектуальные задачи на уровне спеца, допускает ошибки - да, но как будто человек их не совершает, просто у нас тут двойные стандарты. Единственный препон - это долгосрочное целеполагание, т.е щелкать одну и ту же задачу на протяжений недель и месяцев, вот там пока LLM реально плохи, это же ограничивает нормальное использование в энтепрайзе в автономно-агентном варианте без помощи человека.
Честно говоря, я нормально отношусь к ии-тексту, для меня это такой же результат интеллектуального труда, просто произведенный не-человеческой сущностью. Но при этом я согласен что нужно стремиться к его уменьшению, если текст не требует никаких усилий со стороны человека, то статьей и подобного контента станет очень много, а человеческое внимание штука есть ограниченная. При этом частично прибегать к ии-редактуре, особенно по части фактологии, я ничего плохого не вижу, в части своих статей я так и делал, при этом стремлюсь даже используя ии, перерабатывать его текст, потому что LLM не всегда выражается доступно, особенно если рассматриваемый предмет сложный и комплексный.
Завидно что я над чем то подобным не работал. Спасибо большое за статью
DeepSeek Flash через браузерный чат выглядел довольно шустрым, хотя Qwen-3.8-Max быстрее (но там вообще скорость бешеная, другие фронтиры и рядом не стоят)
Знаю про эту работу, но не знал что она на хабре есть, спасибо добавлю в закладки