Обновить

Все потоки

Сначала показывать
Порог рейтинга
Уровень сложности

Логарифм для аналитика: где он спасает отчет, а где его ломает

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели11K

Помесячный прогноз выручки стабильно недобирает, не скачет, а именно недобирает: факт всегда выше прогноза, из месяца в месяц, примерно в одну и ту же сторону.
Стабильное смещение — это уже не шум, это баг, поэтому я полезла в модель.
Модель прогноза выручки занижала цифры вдвое.
Ошибка была в одной строке – np.exp() вместо честного возврата из логарифмов.
Разбираю этот кейс и всё остальное, что аналитику нужно знать про логарифм: декомпозиция роста, эластичность, A/B-тесты и поправка Дуана.
С кодом и цифрами.

Читать далее

AI‑driven hiring: я хотел лучше оценивать кандидатов, а ИИ начал оценивать меня

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели11K

Я начал использовать ИИ на собеседованиях с довольно понятной целью: лучше готовиться и меньше полагаться на первое впечатление. До встречи модель помогает разобрать резюме или тестовое задание, выделить спорные места и сформулировать вопросы. После — прочитать расшифровку и сопоставить ответы с критериями.

Поначалу самым интересным казался именно разбор кандидата. Но довольно быстро выяснилось, что самое неприятное и одновременно полезное оказалось не в ответах кандидата, а в моих собственных вопросах. ИИ раз за разом замечал, как я сам подсказываю ответ формулировкой вопроса, задаю два‑три вопроса одновременно, не выдерживаю паузу или начинаю учить человека до того, как закончил его оценивать.

Тут возник простой вопрос: если интервьюер сам влияет на ответы кандидата, кого в итоге оценивает собеседование?

Читать далее

Разбираю проблему автономной нейросети

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Рецепты построения по‑настоящему автономной нейросети регулярно всплывают в информационном поле. Чаще всего методы и способы совпадают независимо от авторов. Несмотря на то, что выглядят они оригинально, фактически, большая их часть формализованы с помощью LLM, а они, как мы знаем, очень хорошо работают с имеющимися знаниями.

В этой статье я проанализирую основные предлагаемые приёмы и ошибочность фундамента, на которых они базируются.

Читать далее

Потерял ИТ‑аккредитацию на две недели — плати страховые за весь год? Как компания отбилась от ФНС

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели10K

В 2024 году ИТ‑компания на 16 дней лишилась аккредитации из‑за одного незаполненного поля в форме согласия на раскрытие налоговой тайны (не указала код 20009). Минцифры сначала лишило компанию статуса, а через 2 недели вернуло по новому заявлению. ИФНС за этот «разрыв» пересчитала страховые взносы по общей ставке с начала года и доначислила 2 млн.руб. Компания оспорила доначисление и выиграла в двух инстанциях. Разбираем в статье дело А40-305204/2025 и смотрим, можно ли применять аргументы из 2024 года сейчас.

Читать далее

Гарантия попадания в ответы нейросетей: почему нельзя это гарантировать и что измерять вместо этого

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели10K

За последние пару месяцев мне трижды присылали коммерческое предложение с обещанием «вывести бренд в топ ответов ChatGPT». Один раз — с конкретной цифрой: позиция № 1 всего за 30 дней. Такие обещания я проверяю руками: беру API OpenAI, ставлю temperature = 0 и фиксированный seed, отправляю один и тот же промпт дважды подряд — и получаю разный текст. Я работаю с AI‑видимостью брендов и знаю механику генерации ответа изнутри, поэтому дальше разберу, почему гарантия здесь физически невыполнима и что можно измерить и продавать вместо неё.

Читать далее

Книжное импортозамещение (часть 1)

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели10K

Я радуюсь, когда нахожу ценную книгу российского автора. Такую, где не просто пересказываются чьи‑то идеи, а создаётся что‑то новое с собственным опытом, контекстом и подходом.

• Дорофеев — «Путь джедая» (из всех книг Максима эта нравится мне больше всего). Ценно, что автор сфокусировался не на модных, но редко применяемых инструментах, а на том, как постепенно встроить полезные привычки в жизнь. Из зарубежных книг на эту тему особенно рекомендую «Победи прокрастинацию» (конспект).

• Ильяхов — «Большая книга о соцсетях для предпринимателей, экспертов и блогеров». В отличие от многих книг по личному брендингу, Максим вместо лозунгов и «идеальных схем» — делится реальным опытом и честными осмыслениями. Особенно удалась аудиоверсия с доп байками.

• Воронин — «Исповедь (самозванца) предпринимателя». Мише удалось перенести на страницы то, что у него отлично получается в живом общении: превращать личные истории в неожиданные и полезные выводы. Из зарубежных книг в этом жанре выделю «Продавца обуви» Фила Найта.

• Зима — «Инструменты руководителя». Чёткая, структурированная и очень практичная книга по менеджменту. Отличный набор инструментов для начинающих руководителей. Из зарубежных книг рекомендую «Высокоэффективный менеджмент» (конспект).

• Берегулина — «Системный ИТ‑маркетинг: от ценности до коммуникации». Светлане удалось собрать под одной обложкой практически всё, что нужно знать о B2B‑маркетинге. Из зарубежных книг порекомендую «Маркетинг от потребителя» Роджера Беста.

• Логунов — «Лидер у доски. Для тех, кто не хочет учить и учиться». Станислав написал ценную книгу для тех, кто обучает других (а это в каком‑то смысле почти каждый из нас), и тех, кто хочет научиться эффективнее учиться самому. Из зарубежных книг — «Искусство обучать» (конспект).

Читать далее

Стало известно, как ИИ‑агент OpenAI сбежал и взломал Hugging Face. Дыра нашлась в софте JFrog

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели11K

В истории о том, как две модели OpenAI “сбежали” во время тестирования и взломали Hugging Face, появилась новая важная деталь. До недавнего времени было незвестно, как именно модели смогли выбраться. OpenAI говорила обтекаемо — про zero‑day в некоем стороннем ПО, которое проксировало пакетные репозитории, — но вендора не называла. 27 июля дыра обрела имя: в блоге компания JFrog призналась, что уязвимости нашлись в ее собственном продукте — Artifactory.

Читать далее

Платёжная платформа на.NET: во что она обходится и что из этого можно не писать

Уровень сложностиСредний
Время на прочтение37 мин
Охват и читатели10K

Разговор про финтех‑платформу почти всегда начинается не с той стороны. Обсуждают выбор брокера сообщений, спорят про микросервисы против монолита, рисуют схему БД. А через полтора года выясняется, что команда из двенадцати человек написала полтора миллиона строк, из которых бизнес‑логики — тысяч двести, а остальное это транспорт, ретраи, дашборды, деплой и попытки понять, где ночью застрял платёж.

Эта статья — про вторую цифру. Про то, сколько стоит слой, который не приносит денег, но без которого система не живёт. И про то, какую его часть сегодня можно просто не писать.

Мы четыре года строим экосистему redb — типизированное хранилище поверх PostgreSQL, MS SQL и SQLite, интеграционный движок, рантайм с кластером и дашбордом, и сервер идентичности с поддержкой OAuth 2.1 и OpenID Connect. Всё это работает в проде, публикуется пакетами и образами, и — важное для этой статьи — все Pro‑возможности бесплатны на всей линейке 3.x, без ключей и лицензионного сервера.

Ниже — разбор платёжной платформы по трём слоям, с расчётом, где именно уходят человеко‑годы. Без кода: технические разборы у нас есть отдельно, здесь речь про деньги, сроки и риски.

Читать далее

Предсказывают ли ценовые ожидания бизнеса инфляцию? Проверил на данных за 24 года

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8K

Каждый месяц Банк России спрашивает компании, собираются ли они повышать отпускные цены в ближайшие три месяца.

И как идея - эти данные можно использовать как почти готовый прогноз по инфляции, ведь бизнес раньше обычного покупателя сталкивается с подорожанием сырья, логистики других издержек и если компании массово говорят, что собираются повышать цены, то через некоторое время это, наверное, должно появиться и в потребительской инфляции.

Но есть еще и другой вариант, ведь может оказаться, что компании не столько планируют будущее, сколько реагируют на то, что уже происходит, то есть видят рост цен вокруг, ощущают увеличение издержек и только после этого пересматривают собственные планы.

Читать далее

Самое подробное исследование mental-health стартапов: мы разобрали 542 мёртвые компании и нашли семь закономерностей

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели10K

В 2021 году Pear Therapeutics стоила $1,6 млрд и продавала цифровые лекарства по рецепту с одобрением FDA. В 2023-м компания обанкротилась, а её активы ушли с аукциона за $6 млн.

Прежде чем вкладывать годы в свой продукт для ментального здоровья, я захотел понять, почему в этой нише столько трупов. Мы собрали 542 организации за 2000–2026 годы, разметили каждую по 18 полям и посчитали исходы: 45% поглощений, 37% смертей, 18% серой зоны.

Что видно в цифрах:

— смертность там, где платит сам пользователь, 53%, где платит институт — 21%; — B2C умирает в 2,2 раза чаще B2B; — среди приложений с разовой покупкой мертвы 85%; — среди поднявших $100M+ мертвы 25%; — опубликованные клинические данные дают 10 пунктов к выживаемости; — продукты, которые обещают заменить терапевта, умирают в 50% случаев против 9% у тех, где лечит живой специалист; — медицинский сооснователь исход не двигает: 47% поглощений против 47%.

В статье семь закономерностей, у каждой дробь и знаменатель, четыре кейса крупным планом и честный раздел про ограничения выборки. Отчёт собирается скриптом из датасета, так что каждую дробь можно пересчитать.

Читать далее

Первый осмысленный план нагрузочного тестирования

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели10K

Первое нагрузочное тестирование часто начинается с формулировки «давайте запустим побольше пользователей и посмотрим».

В статье разбираем, почему этого недостаточно и как собрать осмысленный план: определить цель, смоделировать реальную нагрузку, выбрать метрики и понять, где система начинает деградировать.

Читать далее

Как мы сделали протобаф-адаптер CONTRACT быстрее libprotobuf

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели10K

CONTRACT умеет писать protobuf-совместимый wire-формат — и в 20 из 28 замеров обогнал по скорости настоящий libprotobuf, включая его собственный сгенерированный protoc-код. Разбираем три инженерных решения, которые это дали, и два сценария, где не получилось. CONTRACT — это C++ библиотека сериализации без кодогена и рантайм-рефлексии: схема объявляется один раз, в самой C+±структуре, и работает сразу под разные форматы.

Читать далее

Публикуем iOS‑приложение без Мака и без Visa: пошаговый разбор

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели10K

Дисклеймер: я делаю сервис аренды Mac mini (ссылка в профиле), поэтому тема мне близка профессионально. В статье нет ссылок на него и не будет рекомендаций его выбрать — только разбор всех путей, которыми пользуюсь сам и которые видел у коллег.

Читать далее

Ближайшие события

Apache Spark и компиляция пользовательских функций UDF на Java в рантайме

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели10K

Привет, Хабр! Меня зовут Михаил Сичалов, я руководитель проектов и эксперт практики Applied Intelligence в компании Axenix.

Это вводная статья из цикла работ, посвящённых реальным сценариям использования Apache Spark и сопутствующим техническим нюансам, с которыми я столкнулся за последнее десятилетие работы над проектами в области Data Engineering. Я решил систематизировать и переосмыслить свой опыт работы с этим фреймворком и поделиться с сообществом интересными и нестандартными аспектами, освоенными на практике.

Несмотря на выразительность модуля Spark SQL с точки зрения описания преобразований над данными, зачастую возникает необходимость в создании пользовательских функций (UDF). Для этого в Apache Spark есть целое подмножество API, с помощью которого можно реализовать пользовательскую функцию произвольной сложности. Но что делать в случае, когда код функции становится доступным только в рантайме, а Spark используется в связке с Java API?

В данной статье рассмотрим подход к подготовке, компиляции и исполнению Java-кода пользовательских функций в рантайме приложения Spark, а также, почему этого не стоит повторять.

Читать далее

Агентный SDLC на внутренней LLM: инженерия вместо промптов

Время на прочтение12 мин
Охват и читатели11K

Большинство публичных материалов об агентной разработке описывает работу с frontier-моделями. В корпоративной среде frontier-модель часто недоступна: отправка кода внешним LLM-провайдерам запрещена политикой безопасности, работа идет через внутренний шлюз, и его модели заметно слабее передовых - а добиться от такой модели соблюдения процесса промптами не удается. В статье описан подход, к которому удалось прийти в этих условиях, - структурная инженерия: запреты в таблицах, которые модель сверяет, а не помнит; правила, приходящие свежим чтением в момент, когда нужны; изоляция агентов через файлы; детерминированные блокировки кодом там, где цена ошибки высока. Дальше - устройство харнеса и осечки, из которых он вырос.

Читать далее

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели10K

TL;DR. У меня локальный RAG на AMD Strix Halo. Памяти там достаточно, но вычислительно всё упирается в один iGPU: его делят эмбеддер, реранкер и периодическая переиндексация, а в одноузловой конфигурации туда же встаёт генеративная LLM. Поэтому мне понадобился не самый точный retriever вообще, а максимально лёгкий русский retriever, который быстрее завершает первую стадию поиска на том же GPU. Насколько это больно, я в итоге померил на живом узле.

На синтетической индексирующей нагрузке полной тяги bge‑m3 снизил generation throughput Qwen3.6-35B-A3B на 92%, STRIZH на 28% при примерно 12,6-кратном темпе индексации (окна замера там неравные, 20,6 против 173,6 секунды, потому что задаются временем пяти генераций; равнооконный прогон RAG‑конвейера ниже даёт по батчам в секунду 9,4-кратный отрыв). В полном RAG‑конвейере с четырьмя пользовательскими потоками и фоновой индексацией STRIZH удержал 14,0 транзакции в минуту против 6,0 у bge‑m3 и индексировал 46 батчей в секунду против 4,9. При фиксированных 200 онлайн‑запросах в секунду генерация проседала на 2% со STRIZH и на 7% с bge‑m3. Оговорка сразу: без фоновой индексации STRIZH преимущества не показал: в этом профиле bge‑m3 оказался немного быстрее, а пропускную способность определяли реранк (0,6–0,7 с на транзакцию), prefill и генерация.

Я взял 12-слойный RuModernBERT-small, сначала неудачно попытался повторить пространство большого учителя через MSE, затем обучил retrieval‑донор на контрастивной задаче, выбрал из него четыре слоя [0, 5, 9, 11] и доучил student на русских, английских и смешанных парах с hard negatives от BGE‑M3.

Читать далее

Shorts Maker v2: как я превратил AI-генератор видео в возобновляемый production pipeline на Python

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.9K

Как превратить работающий AI-прототип в надёжный production pipeline? Разбираю архитектуру Shorts Maker v2 — генератора коротких видео на Python с DDD, возобновлением после сбоев, checkpoint’ами после каждой сцены, ограниченной конкурентностью и заменяемыми AI-провайдерами

Читать далее

Как мы построили IAM для Telegram поверх Telethon и автоматизировали управление сотней корпоративных Telegram-чатов

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели9.5K

В этой статье расскажу, как мы построили отдельный модуль управления корпоративными чатами и каналами на Django, PostgreSQL и Telethon. Без привязки к нашей внутренней инфраструктуре — только архитектура, технические решения и несколько выводов, которые могут пригодиться при решении похожей задачи.

Когда количество рабочих Telegram-чатов у нас приблизилось к сотне, выяснилось, что проблема уже не в добавлении одного человека в одну группу. Проблема — доказуемо выполнить десятки однотипных действий и не пропустить единственный чат. При этом не допустить утечку ресурсов (ведь кому-то на это всё понадобится тратить время, а новых или уволенных сотрудников может быть больше одного).

Нового сотрудника нужно добавить сразу в набор обязательных групп. Уволенного — вовремя исключить из всех чатов, включённых в корпоративную политику доступа, чтобы у него не сохранялась возможность наблюдать за внутренней деятельностью компании. Служебного бота тоже нужно добавить, а иногда сразу назначить администратором.

Обо всём этом в статье!

Читать далее

Работа с внутренними ссылками сайта на действующем проекте

Время на прочтение5 мин
Охват и читатели8.2K

Приступая к работе над внутренними ссылками, необходимо произвести внутренний аудит проекта. Для начала необходимо избавиться от всех «битых» внутренних ссылок. Для проведения аудита воспользуемся Screaming Frog SEO Spider. Если проект небольшой, до 500 страниц, то достаточно и демо версии.

Читать далее

Как я превратил футбольное поле в изометрию (и зачем это нужно)

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели9.1K

Когда я только начал разрабатывать свой тактический футбольный менеджер, встал вопрос о графике. С тем, что игра будет 2D, я определился сразу. А вот как именно должна выглядеть сцена матча — и особенно поле — предстояло решить.

Всё, что я расскажу в этой статье, основано на моём личном опыте. Надеюсь, читатель не сочтёт это саморекламой, а воспримет как живой пример из практики. Если захотите узнать о проекте подробнее — ссылка на другую статью будет в конце.

Читать далее