Обновить
1024K+

Искусственный интеллект

AI, ANN и иные формы искусственного разума

2 464,84
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели4.6K

В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B.

Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

Читать далее

Новости

Что в маркетинге и PR можно удешевить с помощью ИИ, а что трогать не стоит

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели4.7K

ИИ меняет экономику маркетинга. Работа, на которую уходили рабочие часы команды и подрядчиков, теперь делается за часы. Отсюда возникает соблазн: смотреть на маркетинг как на список затрат и резать, резать, резать … людей, инструменты, исследования, контент.

Но маркетинг это связанная система. Что-то в ней можно убрать без последствий, а что-то кажется лишним ровно до того момента, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос это не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?».

Читать далее

Спросил у девяти нейросетей, где лечить зубы в Москве: 4941 ответ и очень странная механика

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.4K

Ассистент на вопрос «где в Москве вылечить зуб» отвечает не ссылкой на поиск, а готовым списком клиник с адресами и ценами. Я прогнал 549 бытовых запросов через девять моделей, получил 4941 ответ и разметил в них 94 клиники. Конкретная клиника названа в 91,7% ответов. Имя бренда даёт лишь 8,7% упоминаний, всё остальное приносят страницы: одна клиника попала в ответы 1694 раза и ни разу не была названа по имени. Половина моделей в интернет вообще не заглядывает. Внутри разбор механики, таблицы по моделям и источникам и глава про то, где мой метод врёт.

Читать далее

Три месяца с Claude: хороший ассистент, плохой программист

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели11K

LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.

В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.

Узнать подробнее

Семантического поиска оказалось мало. Как я научил Obsidian находить похожие заметки

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели9.5K

В прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь:

GitHub: https://github.com/zinverno/obsidian-ai-hub

С тех пор semantic-слой заметно вырос. Появились автоматическая синхронизация индекса, Similar Notes и поиск потенциальных дублей. В какой-то момент стало понятно, что сам по себе семантический поиск решает только половину задачи.

Базовая схема у меня была такой:

Читать далее

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

Время на прочтение10 мин
Охват и читатели8.1K

6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.

В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.

1,9 из 6

Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

Я это измерил. На публичном бенчмарке RAGTruth комитет из шести моделей несёт — по design‑effect приближению — примерно столько же независимой информации, сколько 1,9 независимого судьи из шести. Средняя попарная корреляция их ошибок ρ̄ ≈ 0,42.

Это не «1,9 судьи» в буквальном смысле — это эффективный размер: сколько независимых голосов реально стоит за шестью коррелированными. Разнообразие провайдеров не покупает независимость ошибок.

И вот вывод, который держится вообще без спора о точной цифре: ошибки шести судей скоррелированы достаточно, чтобы гарантии независимого голосования выродились. Теорема Кондорсе для коррелированных голосов не отменяется (Ладха, Боланд) — но её границы становятся куда слабее: шесть таких голосов работают как эффективные ~два. «1,9» лишь оценивает масштаб этого вырождения.

Весь метод, данные и пересчёт одной командой — в репозитории: https://github.com/itsjustmarsel/llm-judge-independence. Скрипт analyze.py пересчитывает ρ̄ и n_eff прямо из сохранённых вердиктов, без единого обращения к API.

Читать далее

ИИ пишет тест-кейсы и автотесты за тебя: как их генерировать и не получить ложное покрытие

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели8.3K

Генерация тест-кейсов — один из первых сценариев, с которых компании внедряют ИИ в тестирование. Отдаёшь модели требования или код — через несколько секунд получаешь готовый список проверок. Кажется, что рутину тест-дизайна можно закрыть промптом, а ручных тестировщиков — сократить.

Но тест-кейс — не синоним тестирования. Модель работает только с тем контекстом, что ей передали: не знает незафиксированные правила и может принять баг в коде за норму. Кейсов становится больше, а контроля качества — нет.

Разбираем, что ИИ реально снимает с QA, где создаёт лишь видимость покрытия и почему сгенерированный набор всё равно приходится проектировать и проверять человеку.

Где прячется ложное покрытие →

Ни строчки руками: как я вайбкодил AI-мастера D&D и что показали два месяца открытой беты

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.2K

За полгода я не написал руками ни одной строчки кода. При этом в проде — почти тысяча пользователей и первые 50 тысяч рублей. Днём я геймдизайнер в мобильной игре, вечером сажусь оперировать фермой агентов, которые пишут код вместо меня — и сами же его ревьюят и тестируют. Под катом честные цифры двух месяцев открытой беты: воронка, глубина сессий, деньги и пара мест, где агенты меня знатно подставили. А вы уж сами решите, вайбкодинг — это новая разработка или преступление против профессии.

Мне есть, что сказать...

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5K

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?

Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В этой статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.

Читать далее

ГигаАгент от Сбера. Первый блин слопом

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.9K

12 августа Сбер выпустил своего первого универсального ИИ-агента. Новость эта стала федерального уровня, т.к. про неё написал ТАСС! Более того, было заявлено, что это “первый в России автономный универсальный ИИ-агент”. Как основатель компании, которая запустила ИИ-агентов в феврале этого года на своем ядре, мне конечно же стало интересно протестировать решение от Сбера. Более того, в апреле этого года мы получили Грант от Яндекса на миллион рублей на токены моделей ИИ, и с этого месяца мы сделали поддержку моделей Alisa Ai LLM и Yandex GPT Pro, но это тема для отдельного поста.

 Итак, приступаем. Тестировать я начал 14 августа. У меня на счету cloud.ru лежало 293 рубля еще с проекта, который я делал в прошлом году. Я решил начать с подсказки “Расскажи, что ты умеешь” и просто кликнул на неё. Прошло почти 5 минут и чего-то ИИ-агент задумался. Я устал ждать и отошёл от компа. Скриншот прилагаю:

Читать далее

Train и eval в ARC-AGI-2 — это разные распределения

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.1K

Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.

Дальше идёт распределительное сравнение обоих публичных наборов ARC-AGI-2, отпечатки файлов, на которых оно сделано, и подмножество из train, подобранное под eval по структуре. CSV со списком задач в конце.

Сразу оговорка, к которой я вернусь отдельным разделом: всё это про структуру, а не про сложность для человека. Свой же индекс я проверил против человеческих решений, и он проверку не прошёл.

Что показали измерения

Зрелость внедрения ИИ и зрелость информационной безопасности ИИ

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели6K

Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора.

В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами.

Читать далее

Кто будет учить джунов, если нейросети забрали всю рутину

Время на прочтение5 мин
Охват и читатели5.9K

Раньше инженера растили на задачах, которые сейчас называют «рутиной»: написать автотесты, собрать первичную аналитику, разметить датасет или составить документацию. Эта черновая работа была естественным тренировочным полем. Пробираясь через нее, новичок совершал контролируемые ошибки, проходил код-ревью и формировал профессиональное суждение (engineering judgment) — интуитивное понимание того, как система ведет себя в реальности. 

В классической инженерии этот этап называют «накоплением насмотренности»: нельзя спроектировать надежный мост, не изучив сотни типовых узлов и чужих ошибок. Похожий принцип десятилетиями поддерживал живучесть ядра Linux: Линус Торвальдс и команда топ-мейнтенеров годами заставляли новичков вручную переписывать патчи, чтобы те ментально «проросли» в архитектуру подсистем и переняли культуру инженерных решений.

Генериративный ИИ автоматизировал рутинные задачи — написание тестов, разметку данных, — которые раньше служили тренировочным полем для развития инженерного суждения. По мнению исследователей Microsoft, этот сдвиг к 2026 году остановил традиционный конвейер передачи опыта, создавая риск «кадрового дефолта» в IT. В исследовании Microsoft говорится, что AI Drag (эффект торможения) становится главным вызовом, требующим перестройки обучения специалистов.

Разберем, почему экономия на начинающих специалистах ведет к кадровому дефолту отрасли и как перестроить обучение, когда рутина больше не учит.

Читать далее

Ближайшие события

Игра в имитацию

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.6K

И снова про ИИ, точнее, про большие языковые модели, LLM, которые сейчас считаются панацеей для всего и уже разрушили всё, куда были внедрены: найм, разработку, маркетинг и т.д. Почему так происходит? Отличная штука же, ты ему пишешь, что тебе надо, он делает. Ну да, иногда делает не очень хорошо, но ведь новые модели выходят постоянно! И каждая лучше, чем предыдущая, вон, результаты тестов не дадут соврать.

Или дадут?

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели8.7K

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа.

Читать далее

Не в 12,1 раз, а 2,3–2,9: сколько стоит новый тариф DeepSeek V4 и почему все решают 3 часа с 10:00 до 13:00 МСК

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.1K

Цифру «+1100%» я увидел в чужом пересказе, и это ровно тот жанр новости, после которого приходят спрашивать, что будет со сметой. Часть нашей нагрузки на DeepSeek пакетная, ее можно двигать по времени суток, так что вопрос был прикладной: насколько сильно двигать и куда.

Я открыл прайс, взял профиль своей нагрузки, перемножил. Получилось 2,3. Перепроверил на других профилях, получилось от 2,3 до 2,9. Роста в 11 раз не вышло нигде.

Дальше выяснилось, что 12,1 существует, живет ровно в одной клетке прайса из шести и весит в счете меньше 10%. А по дороге я наткнулся на вещь поинтереснее: пиковые окна DeepSeek объявил в UTC, и в московском времени они ложатся так, что из рабочего дня дорогим оказывается ровно промежуток с 10:00 до 13:00, после чего до 04:00 следующих суток все идет по дешевому тарифу.

Ниже разбор прайса, реверс-инжиниринг пиковых окон, таблица «найдите свой часовой пояс», калькулятор на 40 строк и фрагмент crontab, который сдвигает батч за 13:05.

Читать далее

Как я собрал 10+ ИИ-агентов на Claude Code и Kaiten и почти вышел из операционки

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели11K

Меня зовут Игорь Кузнецов, я ИТ-директор компании «Эрегион». Мы развиваем ИИ-продукты и консультируем бизнес по внедрению ИИ в рабочие процессы.

Недавно в качестве эксперимента я решил проверить, можно ли полностью передать продуктовые и ИТ-задачи ИИ-агентам. В итоге собрал систему из 13 агентов, которые сами разбирают задачи, распределяют работу, проверяют друг друга и фиксируют результаты.

Первые внедрения этой системы мы сделали в процессах «Кабель.РФ». В статье расскажу, как все устроено, зачем агентам понадобился таск-трекер и что из этого получилось.

Читать далее

Как беспилотный трактор видит препятствия, ориентируется без GPS и толкает корм в коровнике

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели10K

После прошлой статьи про железо нашего беспилотного трактора от Когнитив в комментариях набралось много конкретных вопросов: как он вообще «видит» мир, как едет там, где нет спутников, и что происходит, когда перед ним внезапно оказывается корова. Отвечаю на них здесь, и заодно рассказываю, как устроена работа в коровниках, потому что это одна из основных текущих задач для платформы.

Читать далее

Мы мигрировали сотню страниц документации через MCP-сервер, а не скриптами

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6K

У каждого опубликованного сайта GitBook уже есть MCP-сервер. Мы узнали об этом случайно и вместо конвертеров просто дали агенту ходить в документацию напрямую — сотня страниц переехала на Diplodoc за четыре дня. Что агент сделал сам, где проходит граница его возможностей и какие десять вещей пришлось доделывать руками.

Читать далее

Context7: свежайшая документация оказалась… устаревшей?

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5.7K

Или, как один простой вопрос неожиданно превратился в микро-расследование.

Опуская неинтересную предысторию, нынешнее утро застало меня на сайте Context7 — MCP-сервера, обещающего всегда актуальную документацию для огромного количества фреймворков, языков и библиотек.

Читать далее
1
23 ...