к моменту публикации уже может частично устареть, или утечь
А как сделать не устаревающий и не утекающий бенч (принципиально)? *Со звёздочкой задача - сохранив при этом воспроизводимость (на уровне отдельных прошлых прогонов). Не публиковать месяцами закрытую часть проверочных данных (только доступ по API) - так себе выход - есть что получше?
берём минимальный чек-лист действий
Все 6 пунктов не страхуют от “бенчмаксинга”. Как застраховать?
Менее процента это не стерильность - сразу смертельной заболеть риск тот же. Суперинфекция возникнет не в быту, а в больничках или сельхоз (антибиотики для набора веса).
Выезды на природу это от энцефалита прививаться надо, не городские инфекции. Другие страны - отдельные прививки, не пересекаются с экономикой заявленных этим фондом 5%.
около 5% жизни человек проводит больным простудой или гриппом
До 2% снизить можно банальным запретом рукопожатий (традиция вредная, из времён варваров).
до 1%, если еще масочки все распространители надевать привыкнут в местах скопления (как в дисциплинированом Китае).
Останется процент по причине скоплений в детсадах и школах, но только в семьях тех, кто вынужден сдавать туда деток ради работы (вместо домашнего обучения и няни). Удалёнщикам - менее процента.
По магазинам и рынкам бродить - тоже нездоровый древний обычай. Здоровая альтернатива -доставка курьерами до двери.
Установку УФ-фильтров в лифтах могу только приветствовать. Ценнее чем бачки для слива в общественных туалетах )
Самое горькое всплыло в расследовании Time: часть уволенных — технические писатели и инженеры, которых в прошлом году просили документировать рабочие процессы для обучения внутренних ИИ-моделей Oracle. Они помогали учить тот самый ИИ, который затем стал поводом их сократить.
Почему же горькое? Если твоя работа может быть автоматизирована, то туда ей и дорога. Идеально!
Qwen3.5-27B был выбран среди других генераторов с открытым исходным кодом по результатам обучения на тестовом наборе данных, охватывающем все типы вопросов...
Как выбор происходил? Среди каких моделек выбирали?
Дистилляция китайцев по сути этот корпус 3,25 млн пар «вопрос-ответ», поскольку судья тоже Qwen 4-миллиардный. Наследует предвзятость выбора данных корпорацией Алибаба. Не прозрачно, ведь они не поделились своими датасетами.
Как Вы думаете, отсекает какие возможности такой однобокий выбор модели генератора? Пробовали ли оценить метриками отсечённые возможности (bias)?
https://huggingface.co/onnx-community/Pleias-RAG-350M-ONNX Fully supported languages include English, French, Spanish, German, Italian, Dutch, Latin and Portuguese. Язык - Количество Токенов: Английский 808 Б Французский 266 Б Немецкий 112 Б Испанский 46 Б Латинский 34 Б Голландский 29 Б Итальянская 24 Б Польский 11 Б Греческий 11 Б Португальский 9 Б
>Семь из 18 диагнозов оказались, по сути, переоткрытиями: опасный вариант уже значился в открытых базах данных, но не попал в ту карту пациента, которую изучала команда. Это показывает, что дело часто не в нехватке знаний, а в том, что данные о больном разбросаны по разным базам с несовместимыми форматами, и собрать их вместе вручную тяжело даже специалисту.
То есть генеративный ИИ не нужен по сути, а достаточно бардак в данных упорядочить (алгоритмически + традиционной инфраструктурой, без ИИ). Только как дополнительный эшелон помог, избыточность.
>предположила, что в этом месте генома не хватает целого фрагмента, — состояние, известное как синдром ДиДжорджи. Догадку подтвердило повторное прочтение
Не всякая семья заплатит за повторное секвенирование. Часто обрывается диагностический поиск на нежелании пациентов доп анализы проводить. Хотя уже на финишной прямой, только подтвердить находку, сделанную ин-силико.
>вариантом, его признавали болезнетворным
"патогенным" переводить на русский лучше, устоявшийся термин в классификациях. Болезнетворный это по бытовому (+ коннотации с инфекциями)
>o3 заметила цепочку плохо прочитанных участков на 22-й
а человек почему не заметил? Человеческий фактор - ошибка специалиста в рутинном контроле качества? Нет ничего прорывного, никаких открытий не сделала нейросеть, просто лишний глаз по рутинному чеклисту. Не тянет на "раскрыть" в смысле научного открытия.
>Чем больше будет выявлено и исправлено дыр в датасете - тем лучше она будет генерить код.
Пайплайн верификации автоматом не пробовали развернуть? Алгоритмический, детерминированными инструментами желательно, а не вероятностными.
Тогда есть шанс расширить датасет с 3500 до миллиона или сколько есть компьюта на верификацию. Верификатор бутылочным горлышком станет, а не человек, курирующий датасет.
возможно здесь найдутся люди, которые дадут хорошие советы по реализации моих идей.
14B-модель. При контексте max_seq_length = 4096 (необходимо для длинных скриптов) я столкнулся с OOM
Заменить токенизатор не пробовали?
Нужен меньшего размера словарь в токенизаторе (выкинуть иероглифы, оставить минимал рус, англ и все идиомы этого специфического языка). Такой словарь с идиомами языка позволит полностью покрыть весь доменно специфический язык. Вместо max_seq_length = 4096 использовать seq_length = 512 покрывая длинные конструкции языка.
>На саму тренировку: написание скриптов, создание среды, выставление настроек и выбор модели у меня ушла пара дней. На составление датасета - 2 мес
Освободить от рутины - говорили они.. )
Рутины как раз прибавилось с появлением ЛЛМ, творческие(ака требующие фантазии, немножко галлюцинаций высокотемпературных) задачи берут на себя, а людям оставляют рутину. Терпеливая кропотливая вычистка данных для дообучения.
Так же, как селекционеры получают организмы лучшего лучшего качества для сельского хозяйства из имеющихся менее качественных. Из яблони-дичок с мелкими кислыми яблоками получают обильное плодоношение сладкими.
Ученик может превосходить учителя, были исследования на эту тему - как отсеивает некачественное из обучающих данных, на основе выученных закономерностей в бигдате.
2) Не только на основе кода программистов обучены ЛЛМ, но и на основе огромного % синтетики, проверенной запусками на тысячах виртуалок.
>между строк у многих читается мнение, что в целом кодить уметь не нужно,
Не между строк, а прямым текстом - не нужно. Уже не нужно. Было нужно 2 года назад. теперь не нужно.
>также как и считать в уме, т.к. это все равно умеют делать ИИ/калькуляторы.
Тоже бесполезный навык счёта в уме.
>Тогда навстречу логичный вопрос - а что должны уметь делать программисты, если не программировать?
Программисты-кодеры не нужны. Только как хобби - типа пробежек по утрам в парке. Или рыбалки на поплавочную удочку. Никак не переносимые навыки на промышленный лов рыбы сейнерами.
>И как эти навыки получить, если вы не программировали ни дня и по сути смотрите на код как на...
Смотреть на код больше не нужно. Вы не сможете отсматривать такие объёмы кода, которые отсматривает языковая модель с огромными скоростями, сравнивая с лучшими практиками и сравнивая с миллионами ошибок похожих на ту, что закралась в код сейчас.
Вопрос преподавателю. Как Вы думаете, какой процент учеников срежет Ваш запрет использовать калькуляторы/LLM/web-search/другой полезный инструмент(костыль/протез)?
Попробуйте нарисовать график потери мотивации ученика, когда он натыкается на мелкие банальные препятствия. Мотивация изначально высокая. Желание решить задачу огромное, интерес к теме, прямо горит!
Дискалькулия не мешает успешному решению задач в жизни, если постоянно доступен протез (дешевый калькулятор). Внешняя память (веб-поиск раньше, сжатые веса моделей+RAG сейчас).
Как Вы относитесь к дискриминации инвалидов (учеников с ограниченными возможностями)? Паролимпиады показывают, что возможности отнюдь не так ограничены, как кажется.
>Честно говоря, звучит так, как будто обсуждается ЧатГПТ.
Современно выглядит вся статья почему-то. Даже гугловская модель ошибочно упустила, что речь о 19 веке, study24.ai/chat/gemini3_flash
Что же до Вашей просьбы о переводе на правописание до 1918 года: означенное мною изложенiе гласитъ такъ:
Сiя статья посвящена совремѐннымъ методамъ взаимодѣйствiя съ искусственнымъ интеллектомъ, въ частности, использованiю различныхъ алгоритмовъ обработки естественнаго языка. Авторъ разсматриваетъ эволюцiю нейросетей, подчеркивая ихъ возросшую способность къ контекстуальному пониманiю запросовъ пользователя. Также удѣляется вниманiе вопросамъ оптимизацiи отвѣтовъ и повышенiю качества генерацiи текста для прикладныхъ задачъ.
А как сделать не устаревающий и не утекающий бенч (принципиально)? *Со звёздочкой задача - сохранив при этом воспроизводимость (на уровне отдельных прошлых прогонов). Не публиковать месяцами закрытую часть проверочных данных (только доступ по API) - так себе выход - есть что получше?
Все 6 пунктов не страхуют от “бенчмаксинга”. Как застраховать?
Менее процента это не стерильность - сразу смертельной заболеть риск тот же. Суперинфекция возникнет не в быту, а в больничках или сельхоз (антибиотики для набора веса).
Выезды на природу это от энцефалита прививаться надо, не городские инфекции. Другие страны - отдельные прививки, не пересекаются с экономикой заявленных этим фондом 5%.
До 2% снизить можно банальным запретом рукопожатий (традиция вредная, из времён варваров).
до 1%, если еще масочки все распространители надевать привыкнут в местах скопления (как в дисциплинированом Китае).
Останется процент по причине скоплений в детсадах и школах, но только в семьях тех, кто вынужден сдавать туда деток ради работы (вместо домашнего обучения и няни). Удалёнщикам - менее процента.
По магазинам и рынкам бродить - тоже нездоровый древний обычай. Здоровая альтернатива -доставка курьерами до двери.
Установку УФ-фильтров в лифтах могу только приветствовать. Ценнее чем бачки для слива в общественных туалетах )
Почему время не сократилось? Приятно наблюдать как течет вода, горит огонь, работает женщина и ИИ! Растягивают удовольствие, смакуют )
Почему же горькое? Если твоя работа может быть автоматизирована, то туда ей и дорога. Идеально!
Как выбор происходил? Среди каких моделек выбирали?
Дистилляция китайцев по сути этот корпус 3,25 млн пар «вопрос-ответ», поскольку судья тоже Qwen 4-миллиардный. Наследует предвзятость выбора данных корпорацией Алибаба. Не прозрачно, ведь они не поделились своими датасетами.
Как Вы думаете, отсекает какие возможности такой однобокий выбор модели генератора? Пробовали ли оценить метриками отсечённые возможности (bias)?
>Семь из 18 диагнозов оказались, по сути, переоткрытиями: опасный вариант уже значился в открытых базах данных, но не попал в ту карту пациента, которую изучала команда. Это показывает, что дело часто не в нехватке знаний, а в том, что данные о больном разбросаны по разным базам с несовместимыми форматами, и собрать их вместе вручную тяжело даже специалисту.
То есть генеративный ИИ не нужен по сути, а достаточно бардак в данных упорядочить (алгоритмически + традиционной инфраструктурой, без ИИ). Только как дополнительный эшелон помог, избыточность.
>предположила, что в этом месте генома не хватает целого фрагмента, — состояние, известное как синдром ДиДжорджи. Догадку подтвердило повторное прочтение
Не всякая семья заплатит за повторное секвенирование. Часто обрывается диагностический поиск на нежелании пациентов доп анализы проводить. Хотя уже на финишной прямой, только подтвердить находку, сделанную ин-силико.
>вариантом, его признавали болезнетворным
"патогенным" переводить на русский лучше, устоявшийся термин в классификациях. Болезнетворный это по бытовому (+ коннотации с инфекциями)
>o3 заметила цепочку плохо прочитанных участков на 22-й
а человек почему не заметил? Человеческий фактор - ошибка специалиста в рутинном контроле качества? Нет ничего прорывного, никаких открытий не сделала нейросеть, просто лишний глаз по рутинному чеклисту. Не тянет на "раскрыть" в смысле научного открытия.
>Чем больше будет выявлено и исправлено дыр в датасете - тем лучше она будет генерить код.
Пайплайн верификации автоматом не пробовали развернуть? Алгоритмический, детерминированными инструментами желательно, а не вероятностными.
Тогда есть шанс расширить датасет с 3500 до миллиона или сколько есть компьюта на верификацию. Верификатор бутылочным горлышком станет, а не человек, курирующий датасет.
возможно здесь найдутся люди, которые дадут хорошие советы по реализации моих идей.
14B-модель. При контексте max_seq_length = 4096 (необходимо для длинных скриптов) я столкнулся с OOM
Заменить токенизатор не пробовали?
Нужен меньшего размера словарь в токенизаторе (выкинуть иероглифы, оставить минимал рус, англ и все идиомы этого специфического языка). Такой словарь с идиомами языка позволит полностью покрыть весь доменно специфический язык. Вместо max_seq_length = 4096 использовать seq_length = 512 покрывая длинные конструкции языка.
>На саму тренировку: написание скриптов, создание среды, выставление настроек и выбор модели у меня ушла пара дней. На составление датасета - 2 мес
Освободить от рутины - говорили они.. )
Рутины как раз прибавилось с появлением ЛЛМ, творческие(ака требующие фантазии, немножко галлюцинаций высокотемпературных) задачи берут на себя, а людям оставляют рутину. Терпеливая кропотливая вычистка данных для дообучения.
"как ни странно, выбор файлов из репозиториев с более чем 5 тысячами звезд на GitHub значительно снижает производительность"
https://arxiv.org/abs/2301.03988
Так же, как селекционеры получают организмы лучшего лучшего качества для сельского хозяйства из имеющихся менее качественных. Из яблони-дичок с мелкими кислыми яблоками получают обильное плодоношение сладкими.
Ученик может превосходить учителя, были исследования на эту тему - как отсеивает некачественное из обучающих данных, на основе выученных закономерностей в бигдате.
2) Не только на основе кода программистов обучены ЛЛМ, но и на основе огромного % синтетики, проверенной запусками на тысячах виртуалок.
>между строк у многих читается мнение, что в целом кодить уметь не нужно,
Не между строк, а прямым текстом - не нужно. Уже не нужно. Было нужно 2 года назад. теперь не нужно.
>также как и считать в уме, т.к. это все равно умеют делать ИИ/калькуляторы.
Тоже бесполезный навык счёта в уме.
>Тогда навстречу логичный вопрос - а что должны уметь делать программисты, если не программировать?
Программисты-кодеры не нужны. Только как хобби - типа пробежек по утрам в парке. Или рыбалки на поплавочную удочку. Никак не переносимые навыки на промышленный лов рыбы сейнерами.
>И как эти навыки получить, если вы не программировали ни дня и по сути смотрите на код как на...
Смотреть на код больше не нужно. Вы не сможете отсматривать такие объёмы кода, которые отсматривает языковая модель с огромными скоростями, сравнивая с лучшими практиками и сравнивая с миллионами ошибок похожих на ту, что закралась в код сейчас.
А если вайбкодер с опытом чтения спек? Типа архитектора. Или с опытом тестирования нагрузки или безопасности? Но не кодинга
>готовности отвечать за продукт в долго
Но это же... долго
Вопрос преподавателю. Как Вы думаете, какой процент учеников срежет Ваш запрет использовать калькуляторы/LLM/web-search/другой полезный инструмент(костыль/протез)?
Попробуйте нарисовать график потери мотивации ученика, когда он натыкается на мелкие банальные препятствия. Мотивация изначально высокая. Желание решить задачу огромное, интерес к теме, прямо горит!
Дискалькулия не мешает успешному решению задач в жизни, если постоянно доступен протез (дешевый калькулятор). Внешняя память (веб-поиск раньше, сжатые веса моделей+RAG сейчас).
Как Вы относитесь к дискриминации инвалидов (учеников с ограниченными возможностями)? Паролимпиады показывают, что возможности отнюдь не так ограничены, как кажется.
Локальные ЛЛМ обычно в медтехе подразумеваются. Или есть противопоказания к скармливанию данных о пациентах даже self-hosted LLM?
>Честно говоря, звучит так, как будто обсуждается ЧатГПТ.
Современно выглядит вся статья почему-то. Даже гугловская модель ошибочно упустила, что речь о 19 веке, study24.ai/chat/gemini3_flash
Что же до Вашей просьбы о переводе на правописание до 1918 года: означенное мною изложенiе гласитъ такъ:
Сiя статья посвящена совремѐннымъ методамъ взаимодѣйствiя съ искусственнымъ интеллектомъ, въ частности, использованiю различныхъ алгоритмовъ обработки естественнаго языка. Авторъ разсматриваетъ эволюцiю нейросетей, подчеркивая ихъ возросшую способность къ контекстуальному пониманiю запросовъ пользователя. Также удѣляется вниманiе вопросамъ оптимизацiи отвѣтовъ и повышенiю качества генерацiи текста для прикладныхъ задачъ.