Обновить
1024K+

Искусственный интеллект

AI, ANN и иные формы искусственного разума

2 277,19
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Ищем скрытые возможности прошивки и бэкдоры коммутатора за 3 промпта

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели2.5K

Некоторые производители поставляют свои прошивки в незашифрованном виде, без защиты от реверс-инжиниринга и даже с debug-символами. Еще 5 лет назад, для того чтобы раскопать что-то в такой прошивке приходилось копаться с binwalk, делать свои скрипты и просматривать множество файлов вручную на предмет чего-нибудь интересного.

Читать далее

Новости

Как стать лучшим AI-Builder, или Топ худших ошибок с AI и как их преодолеть

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.1K

Все поинты ниже применяются при общении, промптинге и ежедневной работе с AI - и во многом они пересекаются с тем, как общаются люди между собой.

«Нельзя ошибаться» → Ошибаться это нормально. Спрашивайте проанализировать и исправить их, создавайте культуру инструментов и регрессионного тестирования, чтобы отлавливать и разбирать ошибки (то есть занимайтесь развитием engineering stewardship).

Угрозы / Неэтичная лексика → Относитесь к общению с AI так же, как к общению с любым человеком. Поощряйте сотрудничество, креативность, ответственность и чувство собственности (ownership). Делегируйте и …

Читать далее

Как превратить свободный текст игрока в исполняемый граф

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели4.3K

Игрок пишет: «Пока орк отвлечён, я тихо выхватываю меч и прыгаю в окно». Для человека за столом это один ход. Для бота — разбор фразы на атомы, зависимости и броски, иначе «выхватываю» случится после «прыгаю» и всё запутается. Ниже — как ИИ превращает такую реплику в исполняемый граф действий.

Эта статья — разбор архитектурного пайплайна для детерминированной обработки свободного текста. В качестве кейса — ДнД‑бот, где вместо надежды на «умную LLM» я использую атомизацию, граф зависимостей и специализированных агентов. Будет полезно всем, кто проектирует сложные LLM‑системы обработки запросов и пытается победить галлюцинации и высокую стоимость токенов.

Однако я постарался использовать максимально простой язык, чтобы рассказать не связанным с разработкой игрокам, как ДнД‑бот из их запроса создаёт логичный и лаконичный ответ мастера.

Итак, поехали!

Читать далее

Как устроена Kimi K3: 2,8 трлн параметров, линейное внимание и агенты на миллион токенов

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели5.6K

Moonshot AI выпустила веса Kimi K3 — мультимодальной MoE‑модели с 2,8 трлн параметров, из которых на каждом токене активируются 104 млрд. В отдельных тестах программирования и работы с инструментами K3 обходит Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol или Claude Fable 5. Однако сводить релиз к таблице результатов было бы ошибкой: сама Moonshot признаёт в техническом отчёте, что в среднем модель уступает Fable 5 и GPT-5.6 Sol.

Как следует из технического блога Moonshot, все решения K3 проектировались совместно: гибрид Kimi Delta Attention и глобального MLA, Attention Residuals, MoE на 896 экспертов, обучение длинных агентных траекторий и отдельная система кеширования. Разберём, какие задачи решает каждый компонент, что подтверждено опубликованными материалами и где отчёту Moonshot пока приходится верить на слово.

Читать далее

Автоматизация реверс‑инжиниринга через локальную LLM

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.8K

Облачные LLM сливают IOC в общие базы и цензурят описание опасных модулей. Реализуем анализатор вредоносного программного обеспечения с помощью локальной LLM, Ghidra и Neo4j.

Читать далее

Почему идеальная LLM всё равно не сделает агентные системы предсказуемыми

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.1K

Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот же ответ — символ в символ. Можно ли тогда наконец относиться к LLM‑системе как к обычному коду — как к фиксированному, предсказуемому алгоритму?

Скорее нет, чем да.

И дело тут не в качестве модели. Предсказуемость отдельного компонента не гарантирует предсказуемость системы, собранной из таких компонентов. Даже если завтра появится LLM с нулевым уровнем галлюцинаций, многоагентный пайплайн, построенный на её основе, всё равно может вести себя непредсказуемо. Просто источник непредсказуемости смещается — с вероятностной природы самой модели на архитектуру взаимодействия агентов. И я хочу вам это доказать на простом примере.

По моим наблюдениям последние года два‑три вендоры потратили на то, чтобы сделать LLM предсказуемее. Тут вам и RAG и fine‑tuning, верификация выходов, низкая температура, жёсткие промпт‑шаблоны. Более того, в узких доменах это работает — уровень галлюцинаций становится совсем незначимым.

Именно это позволило перейти от единичных запросов к многоагентным архитектурам. Вместо одной универсальной модели, мега чат‑бота теперь у нас цепочка специализированных агентов. Каждый из них решает свою маленькую подзадачу и передаёт результат дальше — все в лучших традициях дедушки Форда.

Логика на первый взгляд простая: если каждое звено надёжно, надёжна и вся цепочка. Но, к сожалению, это не всегда так. И на простейшем демонстрационном проете я попытаюсь показать суть явления.

Читать далее

Claude Opus 5 — новый лидер в FoodTruck Bench. Рассказываю, как у него это получилось

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели5.3K

Claude Opus 5 закончил 30-й день в FoodTruck Bench с итоговым капиталом $75 264. Это лучший результат за всю историю бенчмарка: на 13,6% выше лучшего результата любой другой модели.

Коротко: итоговый капитал $75 264 · ROI +3 663% · прибыль $71 876 · 8 434 порции · расход на API $26,88 · уровень рассуждений xhigh. Обошёл лучший прогон GPT-5.5 на 13,6%, а GPT-5.6 Sol — сразу на 41,4%. Да-да, Sol оказался слабее GPT-5.5…

Дисклеймер. Это первый материал о FoodTruck Bench на русском: до сих пор все обновления и разборы выходили только на сайте проекта и Reddit. Тот же разбор, но уже с интерактивными графиками, лежит на сайте бенчмарка.

Читать далее

Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки

Уровень сложностиСложный
Время на прочтение18 мин
Охват и читатели6.4K

Mechanistic claims в interpretability для бедных, но бравых. Шучу, конечно. Просто когда дело дошло до задачи "придумать название" — вспомнила шутки моей коллеги.

В одном из приближений можно сказать, что AI-модели обрабатывают входы послойно. На каждом слое модель выдаёт вектор h \in \mathbb{R}^D, который можно читать как точку, центроид, область и так далее. Все эти точки, центроиды, области, направления кажутся абстракциями, но как только мы структурируем их — мы видим тонну прекрасного. Например, мы можем геометрически понимать и находить концепты, упакованные в многообразия.

Что называется концептом, а что многообразием? Какие структуры образуют циклические компоненты и как откопать это в модели? Почему теория существует и находится эмпирически, но пока не машстабируется? На эти вопросы мы и покопаем ответы в данной статье.

Читать далее

Архитектурный паттерн «LangGraph, гибридный RAG + Сигнатурный движок»: универсальный граф для потоковых данных

Уровень сложностиСложный
Время на прочтение12 мин
Охват и читатели6.8K

Мы попытались автоматизировать первую линию SOC. Захотелось объединить гибкость ЛЛМ и надежность сигнатурных движков. Поместилось все это в один асинхронный граф.

Под капотом гибридный RAG (Vector + BM25), zero‑cost фича для экономии токенов и параллельный сигнатурный анализ.

Статья об архитектуре, а не готовом решении.
Мы тестировали пайплайн на логах кибербезопасности, но концепция получилась модульной и универсальной. Логи лишь выступают как пример для демонстрации. Представленный граф можно адаптировать под разбор отзывов, фильтрацию спама или модерацию внутренних документов компании.

Читать далее

Нужен ли человек ИИ‑агентам в продажах

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели5.5K

Рынок корпоративного ИИ раскалывается: сужу по профильным конференциям и разговорам с руководителями. С одной стороны — лагерь прагматиков (часто из традиционного B2B-сектора) саботирует тему ИИ-агентов, аргументируя «и без того отлаженными процессами». С другой — жертвы вендорского маркетинга уверены, что у топ-менеджера в штате должна числиться пара десятков виртуальных сотрудников на все случаи жизни.

Между этими двумя полюсами расположились те, кто внедряет технологии методично. Впрочем, и им непросто: рынок меняется быстрее, чем успеваешь протестировать гипотезу. А конкурируют не только покупатели агентов, но и продавцы.

Вопрос «нужен ли человек ИИ-агентам» звучит перевернуто — обычно спрашивают наоборот. Однако громкие анонсы нарисовали картину будущего, где в продажах остаются только боты, а роль человека минимальна.

На самом деле людей рано списывать. По данным UserGems, каждого второго автономного AI-продажника отключают в течение года. Компании, заменившие живой отдел продаж агентами, в большинстве случаев отступали в течение полугода: снова нанимали людей и переходили на гибридную модель. План «сократить штат и снизить расходы» оборачивался обратным: сначала увольнение, потом — новый наем, плюс оплата подписки на агента никуда не делась.

Когда же агенту нужен человек, а когда нет?

Читать далее

Занимаются ли разработчики ИИ‑моделей пеликанмаксингом?

Уровень сложностиСредний
Время на прочтение54 мин
Охват и читатели6.3K

Последние несколько лет Саймон Уиллисон тестировал каждый крупный релиз LLM одним и тем же промптом: «Сгенерируй SVG с пеликаном, сидящим на велосипеде».

Эта забавная проверка постепенно стала одним из самых известных неформальных бенчмарков ИИ. Сгенерированные Саймоном картинки пеликанов на велосипедах часто становятся одними из самых популярных комментариев в постах Hacker News о новых релизах ИИ-лабораторий.

Сегодня бенчмарк стал причиной серьёзных обсуждений его полезности, а также того, занимаются ли ИИ-лаборатории его бенчмаксингом [практикой оптимизации ИИ-моделей для получения высоких оценок в популярных бенчмарках]. Когда на кону миллиарды или даже триллионы долларов, а качественный результат может склонить пользователей на твою сторону, не возникает ли искушения добавить модели немного пеликанмаксинга?

Мне захотелось это проверить, поэтому я организовал небольшой эксперимент: сгенерировал 1008 SVG в семи передовых моделях, оценил их при помощи LLM-судьи и проанализировал результаты Claude Fable 5.

В этой статье я расскажу о результатах. Весь код доступен на Github.

Читать далее

Армия в терминале

Уровень сложностиСредний
Время на прочтение23 мин
Охват и читатели6.1K

Как coding agents превратили разработчика в диспетчера машин — и запустили гонку оркестраторов, песочниц и ИИ‑фабрик.

Ещё недавно программист открывал один терминал и разговаривал с одним агентом. Затем терминалов стало пять, веток — семь, а главным дефицитом оказался уже не код, а человеческое внимание.

Читать далее

Мы провели 35 контролируемых экспериментов с «экзотическими алгебрами» в нейросетях

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5.3K

Кватернионные, октонионные и Clifford-слои обещают parameter efficiency и «особую выразительность». Мы проверили честно: 35 контролируемых экспериментов, param-matched real-контроли, pre-registered kill-критерии. Преимущество испарилось во всех 35 случаях — включая наш собственный headline-результат. Рассказываем, какое единственное исключение выжило (и почему это optimization basin, а не магия), и какие потолки невозможности с точными константами закрывают вопрос.

Читать далее

Ближайшие события

Инженерия вокруг агента: 10 идей AI Engineer

Уровень сложностиСредний
Время на прочтение29 мин
Охват и читатели4.5K

10 идей конференции AI Engineer о том, как меняется разработка, когда код пишут агенты.

В начале 2026 года небольшая команда OpenAI рассказала о необычном эксперименте.

Три инженера за пять месяцев создали внутренний продукт объёмом около миллиона строк кода и провели через репозиторий примерно 1500 pull request’ов. Продуктом пользовались сотни сотрудников. При этом люди не написали вручную ни одной строки: прикладной код, тесты, CI‑конфигурацию, документацию, observability и внутренние инструменты генерировал Codex.

По оценке команды, разработка заняла примерно десятую часть времени, которое потребовалось бы при традиционном подходе.

Но наиболее интересным результатом эксперимента оказался не миллион строк кода. Им стало открытие нового узкого места.

Когда код можно производить практически непрерывно, ограничением становится не скорость печати и даже не интеллект модели. Ограничением становится способность людей объяснить, что именно следует построить, организовать работу автономных исполнителей, проверить результат и не позволить автоматизации разрушить систему быстрее, чем команда успеет это заметить.

Именно этот сдвиг лучше всего описывают выступления AI Engineer 2026 — весенней конференции Europe в Лондоне и летней World's Fair в Сан‑Франциско.

Доклады посвящены разным темам: контексту, памяти, длительным циклам, командной координации, верификации и безопасности. При этом важно не сводить их к одной заранее выбранной теории. Каждый спикер предлагает собственную модель AI‑first разработки, основанную на своём опыте и профессиональной перспективе.

Читать далее

Цифровой двойник будущего меняет главные жизненные решения человека

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.8K

Исследователи из Массачусетского технологического института и Стэнфорда создали систему искусственного интеллекта, способную моделировать личность человека спустя 30 лет. Данная технология доказала, что диалог с собственным состаренным аватаром помогает преодолеть когнитивные тупики, снижает страх перед неизвестностью и заставляет полностью пересмотреть привычные жизненные планы.

Читать далее

Продвижение в нейросетях: что на самом деле нужно заказчику

Время на прочтение7 мин
Охват и читатели6.1K

Всем привет. Меня зовут Владимир Назаров, я основатель агентства поискового маркетинга Head Promo.

На рынке сейчас много разговоров о GEO‑продвижении, то есть продвижении компаний в ответах нейросетей. При этом, за одним термином часто скрываются две совершенно разные задачи.

Из‑за этого заказчик приходит за одним результатом, а агентство несколько месяцев работает над другим. Формально все занимаются GEO, но компания так и не появляется там, где её ожидает увидеть клиент.

Давайте разберёмся, что именно бизнес хочет получить от продвижения в нейросетях и почему сайт компании, часто, вообще остается не у дел.

Читать далее

Я плачу за коллегу, которого придумал сам. И половину его реплик додумываю тоже сам

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели6.5K

И тут очень удачно на Хабре разобрали ELIZA, программу из шестидесятых, с тезисом «она была сложнее, чем вы думали, там не просто регулярка». Хороший текст. Я читал его и думал про другое. Неважно, насколько хитрая машинка была внутри. Фокус никогда не был в ней.

Читать далее

Языковая Модель без магии: Крошечная Language Model на чистом Node.js

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели6.8K

Мы создаем крошечную языковую модель с нуля на чистом Node.js без использования TensorFlow или PyTorch, реализуя нейроны, автоград, эмбеддинги, механизм самовнимания (self-attention), полносвязную сеть (FFN), обратное распространение ошибки и SFT, одновременно наблюдая за тем, как отдельные веса и целые матрицы изменяются в процессе обучения

Это не новая GPT и не прод ML...

502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели5.7K

Я делаю внутреннего read-only LLM-агента для инфраструктурных расследований. Инженер задаёт вопрос обычным языком, а агент собирает доказательства из Kubernetes, метрик, логов, GitLab, Grafana и других эксплуатационных источников.

Один реальный кейс показал, почему «умного промпта» недостаточно: edge вернул 502, хотя приложение для того же request_id записало успешный редирект 302. Чтобы найти причину и не придумать удобное объяснение, агенту пришлось научиться связывать источники, удерживать время и scope, различать факты, гипотезы и отсутствующие данные.

В статье разбираю архитектуру агента на Go, DeepSeek, Qwen и MCP: планирование по evidence, контракты tools, память треда, подключение командных skills через n8n и evaluation на реальных сценариях. В последнем полном прогоне прошли 44 из 45 сценариев, включая все 29 обязательных.

Читать далее

Как QA я все равно пишу документацию, но с ИИ трачу на нее часы, а не дни

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели5.7K

В статье я расскажу, как решал проблемы погружения в проект сначала вручную, а потом с помощью ИИ-инструментов и как мне удалось сократить путь от дней и недель до нескольких часов. Мой опыт пригодится QA-инженерам, которым приходится разбираться в новых проектах, систематизировать знания о продукте и поддерживать документацию в актуальном состоянии.

Читать далее
1
23 ...