Обновить
1024K+

Искусственный интеллект

AI, ANN и иные формы искусственного разума

2 115,29
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Я собрал 33 ИИ-агента на одном движке. Показываю, как устроены пять из них

Уровень сложностиСредний
Время на прочтение28 мин
Охват и читатели469

За последний год я собрал 33 ИИ-агента. Шахматный тренер для ребёнка, помощник по учёбе, ассистент для жены, тьюторы образовательных программ, боты для металлургического холдинга и энергетической компании, внутренние агенты отдела продаж и CRM.

Все они работают на одном движке. Один и тот же Docker-образ, одна и та же кодовая база. Форков ядра — ноль.

Различаются они ровно одним: где у каждого проходит граница между тем, что считает код, и тем, что говорит модель. Это и есть содержание всей работы. Не промпт-инжиниринг, не выбор модели, не RAG. Граница.

Ниже — разбор шести агентов с двух полюсов этой границы, реальный код, замеры и грабли, включая те, где я сам эту границу провёл неправильно.

TL;DR

Читать далее

Новости

Получение shell и root shell на свитче Huawei S6330 с прошивкой V200R021

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели925

В прошлой статье было рассказано как “в три промпта” был получен shell для свитча SNR-2990X-24FQ (OEM DCN), в этой статье будет рассказано о более сложном реверс-инжиниринге свитча одного из топ-вендоров в мире сетевого оборудования.

Читать далее

3. Bonsai-27B на рекурсивном форке llama.cpp: полный запуск и реальный бенчмарк на RTX 3050

Уровень сложностиСложный
Время на прочтение4 мин
Охват и читатели4.5K

В этой статье я расскажу, как запустить Bonsai-27B на обычной видеокарте и как мой форк llama.cpp делает модель умнее прямо на инференсе. Показываю реальный тест: на одной и той же задаче базовая модель зависла и не смогла решить, а рекуррентная довела до ответа. Объясняю, что происходит внутри, сколько это стоит по скорости, и даю команды, чтобы повторить всё у себя на железе.

Ну давай посомтрим

AudioToText: управление требованиями через записи встреч

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели6K

Как превратить записи встреч в рабочий материал для согласования требований: текущая версия проекта AudioToText. В статье показываю, как собрать сервис транскрибации на базе MLX Whisper и Django, чтобы автоматически получать структурированные протоколы созвонов, а не просто длинные текстовые файлы. Разбираю сценарий работы, ключевые элементы веб‑интерфейса, review‑контур и планы развития проекта в сторону NER и поиска противоречий по summary.

Как запись встречи становится рабочим арте

Как рассказ на литконкурс превратил меня в исследователя копирования сознания

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели5.8K

Началось всё беззаботно. Я участвовала в локальном писательском конкурсе, где рассказ надо писать по выпавшему жанру, и мне выпала антиутопия, а я выпала в осадочек.

Что я знала про антиутопию? Ну, читала «1984» когда-то давно, ещё в той жизни, где у меня было время читать что-то кроме логов. Помнила, что это когда мир вокруг тебя хреновый, но старательно притворяется хорошим, а главный герой, сколько бы ни бился, всё равно проигрывает. Плюс бонусы: кодовые имена и лозунги на плакатах. Негусто, короче.

И тут мне в голову пришла идея, (старая как мир): злой мир, где людей вместо казни или после смерти просто копируют. Не убивают, а «продолжают». Загружают весь твой цифровой след, обучают модель, а потом навешивают на тебя датчики, и ты неделю ходишь, живёшь, а система за эту неделю учится думать за тебя. Ты мёртв, твоё копия машет с экрана, все счастливы. Красиво же? Жутко. По-антиутопически. Я довольная села писать.

Приз я не получила, зато получила вопрос, который потом не отпускал меня всю неделю: а что я, собственно, написала? Антиутопию aka выдумку? Или научную фантастику aka научпоп, а может вообще прогноз будущего?

Сразу дисклеймер, чтобы вы не пришли меня бить: я не эксперт в LLM-архитектуре и вообще не нейробиолог. Я пришла сюда не с ноги «смотрите какая я умная», а с ноги «мне стало интересно, я пошла гуглить и офигела, насколько случайно попала и не попала». Это разбор моей наивной идеи, сначала написанной на вдохновении как просто писака, а потом уже отрефлексированной после публикации. Погнали по кускам: ровно в том порядке, в каком я сама во всё это проваливалась.

Читать далее

ИИ за полтора часа взял задачу, над которой статистики бились 20 лет

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.5K

Эдгар Добрибан, статистик из Уортонской школы Пенсильванского университета, сел за разговор с GPT-5.6 Pro. Модели он дал только математическое определение процедуры Бенджамини-Хохберга и вопрос: доказать или опровергнуть. Примерно через полтора часа рассуждений она выдала доказательство, конкретный контрпример и код численного сертификата к нему.

Читать далее

Агентный RAG, бенчмарк TRuST и при чём здесь Нафаня?

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.8K

Тестирование агентного RAG на многошаговых задачах бенчмарка TRuST: эволюция архитектуры, сравнение моделей и правила работы с промптами для сложных поисковых задач.

Читать далее

Я попросил ИИ самостоятельно опубликовать мое приложение в App Store и ушел сочинять лампу

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели6.4K

К началу июля я выгорел. Первую версию я дебажил несколько недель и в какой‑то момент понял, что в 47 раз запускать симулятор я не готов. Наклепал скриншотов, сложил в папочку, показал Клоду и сказал: «Шурши и не булькай». Сам собирать вайбовую лампу дачную лампу из того что нашел в гараже.

Вернулся через 2 часа. В браузере полностью заполненная форма App Store Connect и синенькая кнопка «Отправить на проверку». Нажал. Все сработало — первая версия приложения ушла на проверку в эпл.

Сколько бы мне потребовалось времени, чтобы на работе организовать отправку приложения в стор? Я сидел и честно говоря был «поражен». ИИ управлял браузером, разобрался интерфейсе сайта, и нормально заполнил поля, о существовании которых я даже не думал.

Через неделю я загружал следующую версию и решил сравнить, сколько времени на это уходит у меня самого. Не вышло вообще. Apple сыпала ошибками и душила всем чем могла: скриншоты определенного размера и формата, какие‑то подпункты, поля, про которые я не знал. Я считаю, что терпение это моя сильная сторона и его хватило на +‑ на 24 минуты. Потом я позвал Клода, у него весь процесс занял 10 минут.

Вот после этого мне и захотелось рассказать историю целиком.

Читать далее

Вторая половина мира

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели6.9K

Ставка на будущее

«Наука должна начинаться с мифов и с критики мифов». — Карл Поппер

Что отличает физическую теорию от «Гарри Поттера»?

Не логическая непротиворечивость. При желании можно построить вполне стройный мир с волшебниками, дементорами и Министерством магии. Не красота: вымышленный мир легко может оказаться красивее реального. И даже не способность объяснять уже случившееся. Прошлое лежит перед нами, и при достаточной гибкости для него почти всегда найдётся убедительная история.

Разница возникает там, где описание вынуждено поставить что-то на кон.

Если при условиях A теория заранее ожидает результат B, а мы получаем C, между теорией и миром начинается конфликт. «Гарри Поттера» можно спасти новым заклинанием, стиранием памяти или ещё одной тайной магического сообщества. Физическую теорию тоже иногда спасают дополнительными гипотезами, но каждая такая операция чего-то ей стоит.

Предсказание не доказывает, что мир устроен именно так, как говорит теория. Зато оно показывает: теория зацепила какую-то устойчивость, которая не была целиком вложена в неё рукой автора.

Между тем, что удаётся свернуть в правило, и тем, что не удаётся, как будто стоит стекло. К нему мы ещё вернёмся.

Читать далее

Как мы отдали искусственный интеллект в «рабство» бухгалтерии и что из этого вышло

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.9K

Всем привет! Меня зовут Александра Царева, я старший специалист машинного обучения в компании «Инфосистемы Джет».

Сначала я хотела рассказать историю о впечатляющей ИИ-архитектуре или тонкостях дообучения больших языковых моделей. Но, пока в нашей дата-сайентистской башне из слоновой кости достраивается очередной этаж, коллеги из бухгалтерии пришли с более приземленной задачей – научить искусственный интеллект разбирать счета.

В проект мы вписались сразу. Во-первых, работать с прикладными сценариями всегда интересно. Во-вторых, бизнес обеспечивает нас крутыми железками для запуска LLM-ок, и помочь бизнесу избавиться от части рутины – достойный ответный жест.

Хотя, признаюсь, на этапе «посмотрите, что искусственный интеллект может сделать» отнеслась к идее скептически. Мне казалось, что бухгалтерские документы давно формируют одни и те же программы, примерно в одних и тех же форматах. Даже если между компаниями не настроен прямой документооборот, проблем передать файл от контрагента заказчику быть не должно, правда?

А они есть.

В статье расскажу, почему цифровая бухгалтерия часто не такая уж цифровая, и как мы из on-prem LLM и OCR собрали решение для обработки платежных документов, которое передает структурированные данные в 1С. Что из этого получилось – под катом.

Читать далее

Кто на самом деле лидирует в агентной разработке (и это не тот, о ком вы подумали)

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели5K

В предыдущей статье я описал трёхуровневый Governance-стек, который делает автономных агентов безопасными, и закончил вопросом: сколько это стоит? 80 000 токенов политик, навыков и ревью-промптов загружаются при каждом вызове агента. Это не бесплатно. Так можно ли позволить себе полноценный Governance, или экономика толкает команды к минимально жизнеспособному CLAUDE.md?

Эта статья отвечает на вопрос реальными данными. Две недели продакшен-разработки. Один разработчик. 30 993 запроса к агентам. 8,8 миллиарда токенов. Ни одной строчки кода, написанной вручную. Ответ нас удивил. А причина, по которой всё сложилось именно так — одна архитектурная ставка одной компании — значит больше, чем миллиарды долларов, вложенные в железо.

Читать далее

Почему слабым местом кредитного конвейера может оказаться не только ставка, но и плохой OCR

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели4.9K

Привет, Хабр! Кредиты и все, что с ними связано – тема для многих весьма чувствительная. Мы в Smart Engines выступаем за то, чтобы сделать самые раздражающие процессы удобными и быстрыми. И в этом смысле распознавание документов – это редкий пример технологии, где интересы банка (сократить издержки), сотрудника (меньше рутины) и клиента (не ждать решение неделями) действительно совпадают. Под катом рассказываем, как автоматическое распознавание документов может трансформировать процесс кредитования в банках и как такие технологии становятся ключевым звеном кредитного конвейера.

Читать далее

Kazry — новая кусочно‑заданная активация

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели5.2K

Привет, Хабр, в этой статье я хочу представить новую функцию активации для нейронных сетей под названием Kazry, которая по результатам тестов обошла SiLU.

Читать далее

Ближайшие события

Я научил Obsidian искать по смыслу. Как устроен локальный семантический индекс без отдельной векторной БД

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели4.6K

В комментариях к прошлой статье мне написали примерно следующее: граф связей выглядит красиво, но хороший поиск по заметкам полезнее.

Спорить было трудно. Я сам регулярно открывал Obsidian, помнил, что где-то писал нужную мысль, но не помнил ни заголовок, ни точную формулировку. Обычный поиск в такой ситуации помогал примерно как человек, который на вопрос «где мои ключи?» отвечает «там, где ты их оставил».

Например, в заметке могло быть написано:

Читать далее

Как мигрировать 1 млн строк кода с одного языка на другой за 2 недели

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели6.2K

До недавнего времени миграции кода, при которых рабочую кодовую базу переносят на новый язык, занимали несколько лет.

За последний месяц отдельные разработчики Anthropic с помощью Claude Fable 5, Claude Opus 4.8 и dynamic workflows перенесли десять проектов объемом от десятков до сотен тысяч строк кода. В этой статье мы разберем два примера и лучшие практики, сформировавшиеся в ходе этих проектов.

Джарред Самнер, сооснователь Bun и технический специалист Anthropic, использовал Claude Code, чтобы перенести Bun с Zig на Rust. Менее чем за две недели было создано миллион строк кода. До слияния ветки 100% существующих тестов Bun проходили в CI. После слияния обнаружилось 19 регрессий, все они уже исправлены. В июне версия на Rust вошла в состав Claude Code.

Майк Кригер, один из руководителей Anthropic Labs, за выходные перенес кодовую базу на Python в 165 000 строк TypeScript. В процессе работали сотни агентов, использовались восемь контрольных этапов, три раунда состязательного ревью и финальная проверка, которая сравнивала вывод каждой команды с результатом оригинальной версии на Python.

Новые возможности Claude Code меняют экономику давно откладываемых проектов. Ниже описан процесс из шести шагов, который мы теперь используем, он основан на выводах из этих миграций.

Читать далее

Нейросетевая архитектура формирования автоматических навыков. Часть 1

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели5K

Идея предлагаемой архитектуры возникла из наблюдения за тем, как человеческий мозг осваивает новые действия и превращает их в привычки.

Когда человек впервые сталкивается с незнакомой задачей, её решение требует сознательного внимания. Необходимо сосредоточиться, попробовать один или несколько вариантов, получить обратную связь и скорректировать поведение. Однако после многократного успешного повторения действие постепенно становится автоматическим и выполняется практически без участия сознания.

В общем случае наш мозг работает по принципу «стимул-желание-реакция-подкрепление». Этот принцип хорошо описывается в книге Джеймса Клира «Атомные привычки», что и вдохновило меня на создание подобной архитектуры.

Хороший пример — обучение вождению. Начинающий водитель отдельно контролирует положение педалей, переключение передач, поворот руля и дорожную обстановку. По мере накопления опыта значительная часть этих операций превращается в привычку и начинает выполняться автоматически.

Прямо во время написания статьи я сдаю на водительские права, так что мне везёт воочию наблюдать как обучается моя собственная «нейронка».

Предлагаемая архитектура переносит этот принцип в систему из нескольких простых нейронных сетей. Незнакомые входные данные сначала обрабатываются «сознательной» сетью. После получения правильного ответа и положительного подкрепления генеративная сеть создаёт множество похожих примеров. На них дообучается «подсознательная» сеть, после чего сходные ситуации начинают обрабатываться быстро и автоматически.

Читать далее

Лень, Modbus и ИИ: как я сделал инструмент, которого мне не хватало на пусконаладке

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели4.6K

Когда я работал инженером АСУ ТП, мне часто приходилось проверять связь с устройствами по Modbus. Существующие утилиты помогали, но почти в каждой чего-то не хватало. Спустя несколько лет я вернулся к старой идее и с помощью ИИ-инструментов разработал ProtoLink — простой локальный клиент для Modbus TCP и RTU. Рассказываю, как появился проект, что он уже умеет и в какую сторону будет развиваться дальше.

Читать далее

MCP без облака

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели4.9K

У меня возникла такая задача: есть куча файлов, на которые хорошо бы натравить нейросеть, чтобы она искала ответы прямо по ним, а не выдумывала. Файлы разнородные, среди них тяжелые PDF. Закинуть их в модель целиком не выйдет: контекстное окно забьется раньше, чем она доберется до сути. Нужен способ скармливать модели не весь архив разом, а только нужный кусок. Так мне пришла идея применить MCP «с другой стороны» — не для агента, а для аккуратного доступа к большому архиву локальных документов.

Читать далее

ИИ-агенты в трейдинге: от рекомендаций к автономному управлению. Разбор тренда, рисков и архитектурных решений

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели4.7K

Представьте, что вы сообщаете ИИ-агенту, на какой риск готовы пойти, какие у вас цели по накоплениям на пенсию и когда ваши дети поступят в колледж, а затем позволяете ему управлять вашим инвестиционным портфелем и спокойно спите по ночам.

Читать далее

MarathonMemBench — бенчмарк нового типа для тестирования памяти вашего LLM-агента

Уровень сложностиСредний
Время на прочтение35 мин
Охват и читатели4.8K

Эта статья — про долговременную память AI-агентов и про то, как её измерить. Я сделал MarathonMemBench — платформу, где LLM-персона часами беседует с тестируемым агентом: рассказывает факты о своей жизни, меняет решения, путается и поправляется, а под конец — когда начало разговора давно вытеснено из контекста — устраивает экзамен на всё сказанное. Подключить можно любого агента, у которого есть чат, — больше от него ничего не требуется. Дальше будут: обзор существующих бенчмарков памяти и почему каждый из них требует дорабатывать агента под себя, устройство платформы, результаты open-source-агентов — неожиданно сильные — и вскрытие их памяти после прогонов.

Читать далее
1
23 ...