В 2025 году на главной мировой конференции по машинному обучению (ICML) была опубликована программная статья с однозначным выводом: чтобы ИИ-агенты по-настоящему могли улучшаться сами, без человеческого надзора, им нужна метакогниция как встроенный компонент
Не могли бы вы дасть ссылку на эту статью? Или хотя бы ее название?
Но в некоторый момент одна из них — та, чьё содержание прямо сейчас наиболее значимо — «выигрывает право» транслировать свой текущий результат в главный поток сознания.
Как выигрывается это право? Что в мозге человека является тем самым арбитром, который это определяет?
Канеман не был первым, кто заметил это разделение — у него были предшественники, Стэнович и Уэст в 1990-х. Но именно его формулировка стала языком, на котором всё человечество стало обсуждать собственное мышление
Стэнович и Уэст тоже были далеко не первыми. Первыми "Систему 1" (Манас) и "Ситему 2" (Буддхи) описали древнеиндийские философы (Вьяса, Патанджали, Шанкара) примерно за 2,5 тыс. лет до Стэновича, Уэста и Канемана. Если ты украл у кого-то идею, заменил термины и выдал за свою - это называют "плагиатом". Но если идеи 2,5 тыс лет и ее авторы давно умерли - то тогда это не плагиат, тогда можно ))
Если я добавлю в ИТ-ландшафт новую систему Х и укажу что это изменение так-то повлияет на такие-то показатели процессов - система пересчитает мне АВТОМАТИЧЕСКИ показатели в слое мотивация (включая самую верхнюю цель - капитализацию)? Я могу в ней настроить функциональные зависимости так, чтобы нарисованные у вас "+20% капитализации" считались автоматически? Можно сделать так, чтобы изменения показателей нижних слоев астоматически влияло на показатели верхних слоев? Так, как работояют модели у фин.аналитиков - меняешь стоимость привлечения кредита и у тебя пересчитывается все-все-все в том числе и стоимость компании.
Бизнес-слой характеризуется показателями. Например вообще без ИТ-систем для обработки 100 платежек в день нужно два бухгалтера и при этом они совершать 3 ошибки. А если внедрить систему "Х" то потребуется один бухгалтер и будет всего 1 ошибка. В этом смысле бизнес-слой ЗАВИСИТ от реализации. а) если я ничего не буду внедрять - показатели процессов будут такие-то - показатели целей в слое "мотивация" будут такие-то - капитализация будет такая-то. б) если я внедрю ситему А - все измениться так-то в) а если я внедрю системы А,Б и В - тогда все измениться так-то. Именно это я хочу получить от системы моделирования архитектуры предприятия. Как разные опции ИТ-ландшафта будут влиять на процесы, затем на показатели целей на разных уровнях в слое "мотивация" и в конце-концов на главную цель - стоимость компании. ArchiMate может это делать?
Наверное мы вкладываем в термин "моделирование" разный смысл. Я хотел бы иметь возможно менять варианты, например, ИТ-ландшафта и видеть как это влияет на мой бизнес-слой (показатели процессов) и на мой слой мотивации (достижение заданных целей) Например, я хочу иметь возможность заменить в ИТ-ланндшафте опцию "Best-of-breed" (когда каждая капабилитиз использует лучший ИТ-продукт именно в этой области) на опцию "all-in-one" (напимер по максимуму все реализуется в SAP) и тут же увидеть как это повлияет на процессы и цели. Пока я не нашел инструментов которые могли бы это делать ((( Как в ArchiMate можно задать функциональные зависимости KPI (слой мотивация) от показателей процессов (скорость, ресурсоемкость, стабильность), и зависимость показателей процессов от различных элементов ИТ-ландшафта?
"...Проектирование архитектуры в нотации ArchiMate ..." (с) Проектирование архитектуры ЧЕГО? Архимейт задумывался как инструмент проектирования архитектуры предприятия, а не ИТ-стстемы. И с этой задачей он справляется мягко говоря "не очень". Допустим корпоративный архитектор очень красиво нарисовал слой мотивации. Во главе всего - "норз стар" - капитализация компании. Потом он декомпозировал эту цель на цели более низких уровней. Потом связал эти цели с "капабилитиз", "капабилитиз" с процессами и ресурсами. Затем нарисоавл слой данных, Ит-ланшафт, инфраструктуру. Причем сделал все это в двух экземлпярах - "as it is" и "as it should be". Нарисовал роад-мэп перехода из "as it is" в "as it should be". Все вышло очень красиво! Может быть даже правдоподобно! Довольный собой он презентует все это Совету Директоров. И тут его спрашивают "ну хорошо. ну внедрим мы твои SAP-ы, RAG-и и AI-агентов, поставим сервера с кучей карточек nVidea. Насколько это поднимет нашу капитализацию"? (пример реальный, из жизни). Картинки в Archimate ответить на этот вопрос не могут. Archimate визиализирует а не моделирует. Может потому картинки Archimate сразу после презентации руководство кладет в папку и больше на них не смотрит?
"Semantic - По абзацам/заголовкам " - не правильно объяснили. Это структурный чанкинг. Семантический чанкинг - это когда текст разбивается на чанки по их семантическом отличию (т.е. выделяються атомарные мысли\идеи). Семантические чанки могут не совпадать с "абзацами\заголовками". Перед нарезкой можно дать текст LLM и попросить расставить разделительные знаки там, где по ее мнению заканчивается одна мысль и начинается другая. Затратно, но может дать прирост в качестве (но не обязательно).
Obsidian + RAGFlow (можно заменить на Dify или Kotaemon) + n8n в докер-контейнерах на домашнем сервере. Все бесплатно и намного больше инструментов и интеграций. У вас хорошая задумка, но платить за это деньги будет только тот, кому лень скачать и настроить три yaml-файла.
Было ограничение на использование только локальных парсеров? Если нет - попробуйте LlamaParse или MistralOCR. Late Chanking - сохранение (подмешивание) глобальный контекст документа в эмбеддингах каждого отдельного чанка. Технологию предложила и активно продвигает Jina AI. Voyage AI тоже умеет так делать, но называет это "Contextualized Embeddings". Cohere Embed так не умеет т.к. у нее маленькое контекстное окно. (Чтобы "пропитать" эмбединг каждого чанка содержанием всего документа нужно большое контекстное окно), ИМХО: сейчас самый качественный (и самый дорогой ))) - Agentic Chunking. Вы просите сильную модель прочитать текст и расставить метки там, где, по её мнению, заканчивается одна мысль и начинается другая. А потом можно еще поверх заполировать Лейт-чанкингом, т.е. домешать немного глобального контекста в эмбединг каждого чанка.
У вас не описан самый первый шаг - парсинг. Сперва нужно определить формат и сложность документа а потом выбрать правильный инструмент для парсинга. Для pdf-сканов - это один инструмент, для сложных pdf (колонки, таблицы, сноски и пр.) с текстовым слоем - другой, для простых pdf - третий, для doc - четвертый и т.д. Я бы приводил все к одному формату - например к маркдауну. Правильный парсинг - залог успеха чанкинга )) По чанкингу - вы пробовали использовать Late Chuncking? В юридических документах часто определения терминов часто даются в начале а конкретные условия следуют в конце. Late Chuncking позволяет поисковому движку находить нужный параграф, даже если в нем самом не упоминаются ключевые субъекты договора, но они были упомянуты раньше. SOTA-векторайзеры умеют это делать. Не знаю применимо ли это к данному соревнованию, но в энтерпрайз-РАГах можно улучшить результат за счет предобработки квери пользователя. Пользователи очень часто криво строят вопросы. Препроцессинг запроса позволяет сделать несколько перефразов оригинального запроса и подать их все вместе в квери-векторизатор.
Спасибо! А есть планы сделать полноценный бекэнд?
Сохранение каждой встречи в БД (база данных) с датой, типом, заголовком
История встреч (список всех прошлых сессий)
Поиск по встречам (найти встречу с конкретным стейкхолдером двухнедельной давности)
Экспорт в Markdown / PDF
Общий доступ для команды BA
Интеграцию с Confluence / Jira не планируете делать?
Не могли бы вы дасть ссылку на эту статью? Или хотя бы ее название?
Как выигрывается это право? Что в мозге человека является тем самым арбитром, который это определяет?
Стэнович и Уэст тоже были далеко не первыми.
Первыми "Систему 1" (Манас) и "Ситему 2" (Буддхи) описали древнеиндийские философы (Вьяса, Патанджали, Шанкара) примерно за 2,5 тыс. лет до Стэновича, Уэста и Канемана.
Если ты украл у кого-то идею, заменил термины и выдал за свою - это называют "плагиатом". Но если идеи 2,5 тыс лет и ее авторы давно умерли - то тогда это не плагиат, тогда можно ))
А как же Visual Paradigm Community Edition? Хоть и не open-source но free.
VLA.если используйте аббревиатуру - было бы неплохоть где-то дать ее расшифровку.
Если я добавлю в ИТ-ландшафт новую систему Х и укажу что это изменение так-то повлияет на такие-то показатели процессов - система пересчитает мне АВТОМАТИЧЕСКИ показатели в слое мотивация (включая самую верхнюю цель - капитализацию)? Я могу в ней настроить функциональные зависимости так, чтобы нарисованные у вас "+20% капитализации" считались автоматически? Можно сделать так, чтобы изменения показателей нижних слоев астоматически влияло на показатели верхних слоев? Так, как работояют модели у фин.аналитиков - меняешь стоимость привлечения кредита и у тебя пересчитывается все-все-все в том числе и стоимость компании.
Бизнес-слой характеризуется показателями. Например вообще без ИТ-систем для обработки 100 платежек в день нужно два бухгалтера и при этом они совершать 3 ошибки. А если внедрить систему "Х" то потребуется один бухгалтер и будет всего 1 ошибка.
В этом смысле бизнес-слой ЗАВИСИТ от реализации.
а) если я ничего не буду внедрять - показатели процессов будут такие-то - показатели целей в слое "мотивация" будут такие-то - капитализация будет такая-то.
б) если я внедрю ситему А - все измениться так-то
в) а если я внедрю системы А,Б и В - тогда все измениться так-то.
Именно это я хочу получить от системы моделирования архитектуры предприятия. Как разные опции ИТ-ландшафта будут влиять на процесы, затем на показатели целей на разных уровнях в слое "мотивация" и в конце-концов на главную цель - стоимость компании. ArchiMate может это делать?
посоветуйте, пожалуйста, 2-3 варианты "best-of-breed"
Наверное мы вкладываем в термин "моделирование" разный смысл.
Я хотел бы иметь возможно менять варианты, например, ИТ-ландшафта и видеть как это влияет на мой бизнес-слой (показатели процессов) и на мой слой мотивации (достижение заданных целей)
Например, я хочу иметь возможность заменить в ИТ-ланндшафте опцию "Best-of-breed" (когда каждая капабилитиз использует лучший ИТ-продукт именно в этой области) на опцию "all-in-one" (напимер по максимуму все реализуется в SAP) и тут же увидеть как это повлияет на процессы и цели. Пока я не нашел инструментов которые могли бы это делать ((( Как в ArchiMate можно задать функциональные зависимости KPI (слой мотивация) от показателей процессов (скорость, ресурсоемкость, стабильность), и зависимость показателей процессов от различных элементов ИТ-ландшафта?
"...Проектирование архитектуры в нотации ArchiMate ..." (с)
Проектирование архитектуры ЧЕГО? Архимейт задумывался как инструмент проектирования архитектуры предприятия, а не ИТ-стстемы. И с этой задачей он справляется мягко говоря "не очень".
Допустим корпоративный архитектор очень красиво нарисовал слой мотивации. Во главе всего - "норз стар" - капитализация компании. Потом он декомпозировал эту цель на цели более низких уровней. Потом связал эти цели с "капабилитиз", "капабилитиз" с процессами и ресурсами. Затем нарисоавл слой данных, Ит-ланшафт, инфраструктуру. Причем сделал все это в двух экземлпярах - "as it is" и "as it should be". Нарисовал роад-мэп перехода из "as it is" в "as it should be". Все вышло очень красиво! Может быть даже правдоподобно! Довольный собой он презентует все это Совету Директоров. И тут его спрашивают "ну хорошо. ну внедрим мы твои SAP-ы, RAG-и и AI-агентов, поставим сервера с кучей карточек nVidea. Насколько это поднимет нашу капитализацию"? (пример реальный, из жизни). Картинки в Archimate ответить на этот вопрос не могут. Archimate визиализирует а не моделирует. Может потому картинки Archimate сразу после презентации руководство кладет в папку и больше на них не смотрит?
"Semantic - По абзацам/заголовкам " - не правильно объяснили. Это структурный чанкинг.
Семантический чанкинг - это когда текст разбивается на чанки по их семантическом отличию (т.е. выделяються атомарные мысли\идеи). Семантические чанки могут не совпадать с "абзацами\заголовками". Перед нарезкой можно дать текст LLM и попросить расставить разделительные знаки там, где по ее мнению заканчивается одна мысль и начинается другая. Затратно, но может дать прирост в качестве (но не обязательно).
Почему выбрали Docling, а не DeepseekOCR, MinerU, Marker, PaddleOCR?
Obsidian + RAGFlow (можно заменить на Dify или Kotaemon) + n8n в докер-контейнерах на домашнем сервере. Все бесплатно и намного больше инструментов и интеграций. У вас хорошая задумка, но платить за это деньги будет только тот, кому лень скачать и настроить три yaml-файла.
Зачем изобретать велисипед если уже есть Cherry Studio?
Было ограничение на использование только локальных парсеров? Если нет - попробуйте LlamaParse или MistralOCR.
Late Chanking - сохранение (подмешивание) глобальный контекст документа в эмбеддингах каждого отдельного чанка. Технологию предложила и активно продвигает Jina AI. Voyage AI тоже умеет так делать, но называет это "Contextualized Embeddings". Cohere Embed так не умеет т.к. у нее маленькое контекстное окно. (Чтобы "пропитать" эмбединг каждого чанка содержанием всего документа нужно большое контекстное окно),
ИМХО: сейчас самый качественный (и самый дорогой ))) - Agentic Chunking. Вы просите сильную модель прочитать текст и расставить метки там, где, по её мнению, заканчивается одна мысль и начинается другая. А потом можно еще поверх заполировать Лейт-чанкингом, т.е. домешать немного глобального контекста в эмбединг каждого чанка.
У вас не описан самый первый шаг - парсинг.
Сперва нужно определить формат и сложность документа а потом выбрать правильный инструмент для парсинга. Для pdf-сканов - это один инструмент, для сложных pdf (колонки, таблицы, сноски и пр.) с текстовым слоем - другой, для простых pdf - третий, для doc - четвертый и т.д. Я бы приводил все к одному формату - например к маркдауну.
Правильный парсинг - залог успеха чанкинга ))
По чанкингу - вы пробовали использовать Late Chuncking?
В юридических документах часто определения терминов часто даются в начале а конкретные условия следуют в конце. Late Chuncking позволяет поисковому движку находить нужный параграф, даже если в нем самом не упоминаются ключевые субъекты договора, но они были упомянуты раньше. SOTA-векторайзеры умеют это делать.
Не знаю применимо ли это к данному соревнованию, но в энтерпрайз-РАГах можно улучшить результат за счет предобработки квери пользователя. Пользователи очень часто криво строят вопросы. Препроцессинг запроса позволяет сделать несколько перефразов оригинального запроса и подать их все вместе в квери-векторизатор.
LLamaPasre или MistralOCR или olmOCR парсять сложные pdf хуже Docling?
Почему такой выбор парсера?
Ведь есть же: MistralOCR, LlamaParse, olmOCR 2, Unstructured, NetMind ParsePro.