Pull to refresh
21
Андрей Канивец@Avlakan

Аналитик

20
Subscribers
Send message

Спасибо, что читаете!

Когда экспериментировал, как-то не думал, что потом напишу статью, поэтому промежуточные результаты не сохранил — порадовать цифрами не получится. Помимо Qwen3, действительно пробовал DeepSeek V3 и GLM 4.5 Air через OpenRouter, субъективно разница была.

Что касается галлюцинаций, данные привести не могу. А вот по ошибкам извлечения картина есть: анализ обработанных записей показывает, что в ~90% случаев в тексте есть "разорванные" слова вида специ\nфикой и прочие артефакты PDF-парсинга. Думаю, что это особенность работы ноды n8n.

К слову, в апреле вышла статья коллег из Честного знака — «Как мы оценивали OCR на русских документах», вот там приводятся некоторые результаты с цифрами.

Всем спасибо за замечания. Сделал дополнение к статье, постарался все учесть.

Пожалуйста. Думаю, что есть у него своя ниша, по этой причине и не канул в Лету.

О чем хотите прочитать в продолжении?

Обычно разрабатываю всякие мелкие утилиты. В статье сделал просто пример на основе эскиза трансформатора тока.

Information

Rating
Does not participate
Location
Россия
Works in
Date of birth
Registered
Activity

Specialization

Системный аналитик, Продуктовый аналитик
Ведущий