Спасибо за вопрос ) Если речь именно о параметрах самой модели, то да — в основном это обученные веса, и их действительно могут быть миллиарды. При полном fine-tuning эти параметры изменяются автоматически в процессе обучения. Знаю, что есть и более лёгкие способы адаптации — например LoRA, когда базовые веса модели остаются неизменными, а обучается сравнительно небольшой набор дополнительных параметров. Но в своей практике я пока не сталкивался с задачей, где мне понадобилось бы дообучать LLM таким способом.
Для задач обработки документов я бы вообще не торопился погружаться в дообучение LLM. Если проблему можно решить изменением промпта, правил, постобработки или специализированной моделью для конкретной задачи, это может оказаться проще и дешевле. И это как раз перекликается с главной мыслью статьи: не пытаться любую задачу решать настройкой одной большой универсальной модели, а подбирать инструменты исходя из самой задачи и ожидаемого эффекта.
Не очень понял вопрос, но сам по себе OCR ни под что не заточен. Его надо настраивать под конкретный поток документов(шаблонов). Он дает повторяемый результат, но при изменении шаблона или появлении нового может полностью перестать работать. "VLM(LLM) лучше адаптируется" - не зря дисклеймер писал в начале статьи о том, что грань там все тоньше и зависит от конкретной модели. В целом да - адаптируется лучше, хотя прямо всеядностью не обладает. Плюсы в основном раскрываются, когда нет шаблонов и надо понять весь документ. Лучше смотреть на конкретных примерах.
Спасибо за вопрос )
Если речь именно о параметрах самой модели, то да — в основном это обученные веса, и их действительно могут быть миллиарды. При полном fine-tuning эти параметры изменяются автоматически в процессе обучения. Знаю, что есть и более лёгкие способы адаптации — например LoRA, когда базовые веса модели остаются неизменными, а обучается сравнительно небольшой набор дополнительных параметров. Но в своей практике я пока не сталкивался с задачей, где мне понадобилось бы дообучать LLM таким способом.
Для задач обработки документов я бы вообще не торопился погружаться в дообучение LLM. Если проблему можно решить изменением промпта, правил, постобработки или специализированной моделью для конкретной задачи, это может оказаться проще и дешевле. И это как раз перекликается с главной мыслью статьи: не пытаться любую задачу решать настройкой одной большой универсальной модели, а подбирать инструменты исходя из самой задачи и ожидаемого эффекта.
Не очень понял вопрос, но сам по себе OCR ни под что не заточен. Его надо настраивать под конкретный поток документов(шаблонов). Он дает повторяемый результат, но при изменении шаблона или появлении нового может полностью перестать работать. "VLM(LLM) лучше адаптируется" - не зря дисклеймер писал в начале статьи о том, что грань там все тоньше и зависит от конкретной модели. В целом да - адаптируется лучше, хотя прямо всеядностью не обладает. Плюсы в основном раскрываются, когда нет шаблонов и надо понять весь документ. Лучше смотреть на конкретных примерах.