Обновить
Сначала показывать
Порог рейтинга
Уровень сложности

Как нейросети редактируют фотографии: большой разбор inpainting, image-to-image и диффузии. Часть 2

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели4.3K

Что ж, продолжим погружаться в теорию нейросетевой обработки фотографий. В первой части мы разобрали общий принцип работы диффузионных нейросетей и начали объяснять, почему для обработки фото этот принцип часто больше вредит, чем помогает. В этой статье мы продолжим разбор.

Читать далее

Новости

Как нейросети редактируют фотографии: большой разбор inpainting, image-to-image и диффузии. Часть 1

Время на прочтение17 мин
Охват и читатели6.3K

Двадцать лет назад убрать мусорный бак из кадра — это была целая история, требующая виртуозно владеть фотошопом. Чем дальше шло развитие «умных» инструментов, тем проще решалась эта задача, но поведение всё же не было до конца предсказуемым.

И вот мы пришли к полноценному ИИ, который нам этот бак уберёт одним щелчком, не обязательно даже его полностью выделять. Так и хочется сказать: «Будущее!» А потом заметить, что заодно перерисовался бордюр в другом конце кадра. Который вообще не надо было трогать.

В этом небольшом цикле статей мы поговорим об обработке настоящих, реальных фотографий с помощью ИИ. И нет, это не будет сборник типа «десять нейросетей для фотографа». Мы с вами полезем куда глубже, в самые основы, чтобы понять, как именно нейронка (а точнее, диффузионка) видит и обрабатывает фото.

Разговор пойдёт по нарастающей. Сначала пройдёмся по методам ретуши. Потом погрузимся в то, как диффузионка вообще работает с картинкой — целиком, от промпта до пикселей. Потом — как из такой генерации сделали редактор. Дальше — что модель несёт с собой из обучения, что ломается на стыке с фотографическим рабочим процессом, что до сих пор быстрее делать по-старому. И под конец — вопрос про то, чему теперь вообще верить, мы его затронем по касательной.

Предупреждаю сразу: примерно две трети текста — это про ограничения. Про достоинства вам и без меня расскажут в любом рекламном ролике, а вот про то, где именно эта штука спотыкается, обычно молчат.

Читать далее

Может ли ИИ выучить физику, просто наблюдая за миром?

Время на прочтение13 мин
Охват и читатели10K

О когнитивных способностях человека есть много исследований. Одно из самых известных это исследование за авторством Элизабет Спелке. Оно о том как у человека появляется самое первое, базовое понимание мира и физических законов. Её работа ставит под сомнение традиционные взгляды на то, что всё человеческое знание приобретается исключительно через опыт, и выдвигает гипотезу о наличии врожденных когнитивных систем.

На основе когнитивных экспериментов Спелке доказывает, что фундаментальные представления о мире начинают проявляться в самых ранних месяцах жизни и являются частью врожденного аппарата человека.

Итак, если Спелке показывает, что человеку для этого нужно врожденное ядро знаний, то как с этим справляются ИИ? 
Способна ли нейросеть самостоятельно выделить объекты из огромного числа пикселей, построить внутренний физический движок и предсказать, куда упадет брошенный мяч, не зная формулы F = ma

Рассмотрим как современные ИИ-системы пытаются понять физический мир через наблюдение. Где у них это действительно получается, и почему хорошая визуальная экстраполяция всё еще не означает истинного понимания природы вещей.

Читать далее

Сравниваем LLM, 12 тестов для китайских флагманов: Kimi K3, GLM-5.2, DeepSeek V4 Pro и Qwen 3.8 Max

Уровень сложностиСредний
Время на прочтение95 мин
Охват и читатели14K

В первой статье цикла мы гоняли по 11 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro, в третьей спустились в средний класс и столкнули три поколения Sonnet с GigaChat 2 MAX и YandexGPT Pro 5.1. Закончили мы прошлый материал прямым вопросом: хотите ли увидеть в следующей части DeepSeek и Qwen? Запрос в комментариях мы услышали, так что сегодня на ринге Китай.

Читать далее

О среднестатистическом разработчике в 2026‑м: почему и кого (не)убьет AI

Время на прочтение7 мин
Охват и читатели14K

В 2024 году мы боялись, что ChatGPT заменит нас, и мы не будем больше перекрашивать кнопки и писать очередной CRUD. Но оказалось всё прозаичнее — ChatGPT, увы, не заменил нас, но постепенно нужда в разработчиках как в «крудошлёпах» стала ниже.

И так получилось, что среднестатистические разработчики — уже звери редкие. ИИ-агенты пишут код быстрее, дешевле (или примерно столько, но зато без страховых отчислений). Но работу теряет не инженеры, а исполнители. В итоге, как в эталонном капитализме, вверху пирамиды останутся управленцы — те, кто понимает архитектуру, управляет контекстом и берёт на себя ответственность, что напакостила машина в кодовой базе.

В этой статье мы наконец поставим точку (или длинное тире) в разговорах про ИИ и замену разработчиков на основе новостей и известных движений в мире IT.

Читать далее

Дешево сгенерировать, дорого доказать

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.8K

Первое время нейросеть вызывала восторг, вот это помощник! Пока модель собирает источники, ты открываешь вторую задачу, пока пишет черновик, занимаешься третьей. Через час уже у тебя лежит объем работы, на который раньше ушел бы день. Ключевое слово — лежит.

Нейросеть старательна, но в одной ее ссылке пересказ, в другой описание смежного рынка. Два правдивых факта модель соединила причинной связью, которой в источниках не было. 

И в этом есть занятная асимметрия: ИИ резко снизил стоимость подготовки черновиков и ответов, но не снял вопрос, почему им можно доверять. Хорошо, когда ответ проверяет человек, иногда тест или программа, а если нет? 

Читать далее

ИИ-ревьюверы твоего кода: как нейросети позволяют упрощать анализ PR

Время на прочтение9 мин
Охват и читатели7.6K

С развитием ИИ себестоимость кода стремительно падает. Его становится все больше, а команды не растут пропорционально количеству. AI-инструменты генерации кода (Copilot, Cursor, Codex, Claude Code) увеличивают скорость написания, но не скорость проверки кода.

Узким горлышком становится сам PR, они могут висеть днями в вашей компании или opensource-проекте, контекст может теряться, на его оценку тратится время, и иногда впустую.

В среднем, команда на ревью тратит ~20% рабочего времени, особенно если это большой PR, или PR от новичка.

Но как же решить эту проблему? Ведь беда не в том, что ревьюверы плохие, или что им нужно давать больше работы, а в том, что объем кода растет быстрее возможности осмысленно его проверить.

В этой статье я расскажу о том, как помочь вашему корпоративному или опенсорс-проекту, если он тонет в код-ревью, и расскажу о существующих решениях — devin ai, context7, deepwiki, rabbit code review и других.

Читать далее

Сколько токенов в одном скриншоте, или как GPT, Claude и Gemini считают изображения

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

В личном чате стоимость скриншота для тарифа погоды не делает. А вот в корпоративном сервисе сотрудники могут загружать в нейросеть ворох документов и снимков экрана, которые займут контекст и бюджет. Тогда это уже часть расходов компании, у команды есть лимит или оплата API.

Возьмем тестовый скриншот 1920×1080 и посчитаем объем визуального входа по открытым правилам разработчиков для GPT‑5.5, Claude Opus 4.8 и Gemini 3.1. Все три модели доступны на BotHub. Заодно разберемся, что именно нейросеть получает после загрузки изображения и почему большое разрешение еще не гарантирует, что она прочитает мелкий текст без ошибок.

Формулы взяли из документации разработчиков, а цены — из тарифов BotHub на момент публикации статьи.

Читать далее

Лопнет ли пузырь на рынке ИИ? Разбираем потери, долги и производительность

Время на прочтение6 мин
Охват и читатели67K

Нынешняя экономика искусственного интеллекта — это история о потерях, доходах, смене стиля жизни и интернет-среды, а также о разрыве между ожиданиями и реальностью. Инвесторы пока имеют деньги и терпение, чтобы вкладываться в ИИ-компании Anthropic, OpenAI и другие, а те, в свою очередь, демпингуют рынок и уже смотрят на IPO. На микроуровне (отдельный ИИ-агент) мы видим неэффективность и потери, а на рынке мы видим огромные долги, которые не подкреплены реальной производительностью. А между молотом и наковальней — люди, пытающиеся увеличить продуктивность, получая лишь «2x», а не обещанные «10x».

Но ИИ кардинально поменял нашу жизнь, и многие из нас пользуются им каждый день, повышая свою продуктивность или уменьшая свою когнитивную нагрузку.

Так лопнет ли пузырь? Или он уже лопнул, а мы и не заметили?

В этой статье мы разберем потери из-за ИИ, перегрев долгового рынка и правда ли, что продуктивность увеличивается в 10 раз, если купить подписку на Claude или ChatGPT?

Читать далее

Как и зачем ускоряют LLM

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели11K

Мы знаем, что сегодняшние большие языковые модели основаны на архитектуре transformer, а самое важное понятие в трансформере это механизм attention.

Вычисление attention происходит путем многократного произведения матриц. Но как модели с миллиардами параметров вычисляют эти матрицы? Почему генерация происходит так быстро? Как можно вычислить следующий токен, без многомиллионного перемножения?

Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache.

Мне нужны ответы!

Я вам пишу: пять инструментов для авторов с подключением внешней модели

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели13K

Авторы и нейросеть — это гений и злодейство современного интернета. С 2023 года вокруг темы стоит вой на болотах: одни в панике, потому что теперь авторы якобы никому не нужны, другие требуют полностью игнорировать ИИ. Очень громко спорят те, кто работает с текстом: редакторы, копирайтеры, блогеры, журналисты и писатели.

Как редактор, я выбираю золотую середину. Нейросети нужно применять, но с умом. Чтобы ИИ на самом деле облегчал творческую рутину, надо научиться с ним работать и встроить его в свои процессы. Выбрала пять инструментов, которые передают модели рабочий контекст из источника, документа или рукописи: Zotero с плагином AIdea, Obsidian с Copilot, Cherry Studio, ONLYOFFICE с AI-плагином и SillyTavern. 

Читать далее

ИИ и контроль: токены Пентагона, агенты-хакеры на PyPI и научный слоп

Время на прочтение8 мин
Охват и читатели5.9K

Ни для кого не секрет, что люди часто халатно относятся к ИИ и доверяют ему излишне.

Представьте: вы покупаете камеру видеонаблюдения, а в её прошивке находится административный токен доступа к сотням репозиториев GitHub производителя. Или вы решаете сделать проект или написать статью по академической работе, а эта работа оказывается нейрослопом.

Люди пытаются бороться с этим — кое-где закрывают баг-баунти-программы, где-то PR, сгенерированные ИИ, не принимают.

В этой статье я хочу рассказать о ситуациях, связанных с халатностью разработчиков, атаками агентов и кризисом доверия. А также попробуем выяснить: это отдельные ошибки или уже системный сбой?

Читать далее

Где LLM хранит факты, или как перенести Эйфелеву башню из Парижа в Рим

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели11K

Помните, как в «Матрице» Нео загрузили боевые навыки прямо в мозг? Раз, и человек, который раньше не умел драться, говорит: «Я знаю кунг-фу».

Попробуем повторить этот трюк с языковой моделью. Но так как мы далеки от единоборств, возьмем простой факт: Эйфелева башня находится в Париже. Попробуем заменить в GPT-2 XL Париж на Рим без полного переобучения модели.

Для этого используем ROME, метод точечного редактирования весов. После правки зададим модели тот же вопрос в нескольких формулировках, проверим другие факты об Эйфелевой башне, а потом вернем исходные веса.

Читать далее

Ближайшие события

BotHub за первое полугодие 2026: 72,4 млн ₽ выручки и переход к своим AI-продуктам

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.2K

Для нас первая половина 2026 года стала не просто периодом роста, а моментом, когда бизнес вышел на устойчивую прибыль, а продуктовая стратегия сместилась от агрегатора моделей к собственным AI-сервисам.

Мы — BotHub, платформа на базе больших языковых моделей (LLM). Это не просто прямой доступ к нейросетям: помимо работы с моделями, у нас есть собственный набор инструментов, которые закрывают задачи, недоступные в обычных чатах, — анализ ссылок и видео с YouTube, суммаризация длинных диалогов, правовой поиск по системе «Гарант», поиск научных статей, генерация изображений и создание документов. При этом всё доступно в одном месте: выбор из более чем 240 моделей от 49 вендоров через единый интерфейс и без VPN. Мы работаем не по подписке, а по пакетной модели — вы покупаете пакет и расходуете его по мере использования, а когда он заканчивается, берёте новый. Внутренняя валюта (капсы) при этом не сгорает со временем. BotHub работает на рынке уже более трёх лет.

Читать далее

Как думает LLM

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели14K

Почему ChatGPT иногда может ответить мгновенно, а иногда заставляет смотреть на надпись Thinking почти минуту?

Неужели модель..думает. А раз уж она думает может модель обрела… самосознание? На самом деле этот процесс сегодня называют Reasoning, и он в свое время стал настоящим прорывом в сфере ИИ. Теперь каждый новый флагман от ИИ лабораторий поддерживает режим размышлений.

Как один психолог случайно спроектировал думающую LLM? Сильно ли Reasoning повлиял на точность моделей? И как LLM стали испытывать «Горе от ума»?

Читать далее

Хороший, плохой, заблокированный: как работает модерация промтов в AI‑сервисах

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Один запрос 18+ и три разных ответа. Сравнили цензуру ChatGPT, Claude и Grok и разобрались в логике ограничений.

Читать далее

You’re absolutely right: как ИИ делает нас увереннее и поверхностнее

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.9K

Вы когда-нибудь замечали, что у нейросетей нет своего мнения? Допустим, вы пишете: «Мой тимлид — идиот, он заставил меня писать на PHP». Модель отвечает: «Я понимаю ваше разочарование. Смена технологического стека действительно может быть стрессовой, и PHP часто критикуют за неоднородную архитектуру. Однако…» — и дальше следует мягкая, вежливая, безличная тирада с равным количеством аргументов “за” и “против”, и обобщенным выводом. Она не поддержит вашу агрессию, но и не скажет прямо: «Вы говорите ерунду, ваш тимлид, скорее всего, прав».

Суть популярных LLM — это обобщение и комфорт в общении. Человеку приятнее, когда с ним соглашаются и хвалят, а вывод либо подгоняется под его мнение, либо размывается до золотой середины.

Но почему так происходит? И чем это грозит нам самим? За последние два года вышло несколько исследований, которые устанавливают взаимосвязь между регулярным использованием LLM и рядом негативных эффектов: снижением критического мышления, ухудшением запоминания, ослаблением метакогнитивных навыков и даже потерей терпения к длительным умственным усилиям. Эту проблему я называю синдромом безрукого специалиста — в статье мы разберём, как он возникает и что с ним делать.

Читать далее

Как у алгоритмов снижения размерности получается вас обмануть. Что происходит внутри PCA, t‑SNE и UMAP

Время на прочтение17 мин
Охват и читатели18K

Сколько глаз у человека? Два.

А в сфере машинного обучения модели умеют видеть любую сразу тысячей или миллионами глаз. Мы живем в 3-х мерном пространстве(3D), и видим 2-х мерную картину мира. Модель, в свою очередь, обитает в цифровом пространстве. Она может видеть ваши 2D фото, 3D модель в Blender сразу со всех сторон и спокойно построить параллелепипед в 15D. 

Мы отлично ориентируемся в двух измерениях, немного хуже в трех, а дальше - ВСЁ. 
То, что вышло за пределы привычного куба, перестает быть геометрией в нашем земном понимании. 

Тем не менее нам приходится анализировать результаты работы моделей, для принятия соответствующих решений. Как это делать? Для этого многомерное пространство приходится каким-то образом «свернуть» в обычную плоскость, сохранив как можно больше информации о взаимном расположении точек.

Для этой задачи разработаны специальные алгоритмы. Самыми известными из них сегодня стали PCAt-SNE и UMAP. Несмотря на схожий результат в виде разноцветной двумерной карты, внутри они основаны на разных математических идеях.  И сегодня мы узнаем на каких

Читать далее

Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

Время на прочтение24 мин
Охват и читатели11K

В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и на каких станках куется «физический интеллект». Теперь — про то, как все это живет в реальности. Про экономику, промышленность, государственные программы и человеческую природу.

Читать далее

Отчет Google AI & Economy ATLAS: ИИ уже в 68% профессий, но пока только в 21% задач

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.4K

Google опубликовала выпуск AI & Economy ATLAS — исследование о том, как люди используют ИИ в работе и повседневной жизни. ИИ уже присутствует в широком спектре профессий, но чаще помогает с отдельными задачами, чем заменяет их целиком. Разбираемся, почему так и разбираем особенно интересные моменты отчета.

Читать далее
1
23 ...