Обновить
512K+

Python *

Высокоуровневый язык программирования

593,07
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему ваш AI-агент тратит 80% токенов на файлы, которые уже читал вчера — и как это починить тремя markdown-файлами

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели15K

В прошлой статье я разобрал почему Claude Code ломает проекты (context drift, отсутствие CLAUDE.md, нет хуков на тесты) и как выстроить защиту от регрессий. Статья попала в топ-5 Хабра за сутки — видимо, проблема задела нерв.

Но в комментариях и в личных сообщениях всплыл вопрос, который я тогда обошёл стороной: а что с самими токенами? Контекстное окно стало миллион, но агент всё равно жрёт его как не в себя. Куда уходят токены? Почему одна и та же сессия с одним и тем же проектом каждый раз начинается с нуля?

Я работаю с 20+ проектами на нескольких VPS-серверах. После того как я замерил, куда реально уходит контекст — картина оказалась неприятной.

Читать далее

PostgreSQL + VectorChord = Гибридный поиск. Часть 2. Безоблачная

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.6K

В первой части мы развернули инфраструктуру на базе PostgreSQL и VectorChord, настроили базовые CRUD-операции и запустили гибридный поиск с реранкингом.

В этой части мы заменим игрушечные компоненты на локальные SOTA-модели, сохраняя оффлайн-архитектуру и отказываясь от облачных API. Пошагово развернём llama.cpp-сервер для мультиязычного эмбеддинга Jina v4, поднимем нативный реранкер через transformers + PyTorch, подключим чанкер на базе chonkie и, наконец, оценим качество поиска.

Читать далее

PostgreSQL + VectorChord = Гибридный поиск. Часть 1. Инфраструктура

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели6.1K

Привет Хабр! Меня зовут Владимир и сегодня я буду развивать тему фишечки VectorChord про которую упомянул в предыдущей статье.

В данном материале я покажу, как поднять инфраструктуру с VectorChord, настроить VechordRegistry, написать пайплайны работы с БД, организовать гибридный поиск и добавить простейший реранкинг.

Поехали.

Читать далее

CorpClaw-Lite или как я сделал безопасный аналог OpenClaw

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели6.4K

Сегодня я хочу рассказать о проекте, над которым я работал последние полтора месяца и сегодня открыл его в опенсорс, чтобы дать ему развитие, и, возможно, предоставить его функционал тем, кому он окажется полезен.

Читать далее

Бюджетный Polaroid. Ну, почти

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели11K

Сразу сделаю оговорку — «Полароидом для бедняков» я эту штуку называю не потому, что она недорогая (ибо детали суммарно мне обошлись дороже, чем самый дешёвый полароид), а потому что это просто наколенночный проект. Который всё же работает. И при этом вышло, что в долгосрок это обходится дешевле — одна фотка на оригинальный полароид стоит около 1 евро, а на эту камеру — около цента (исходя из стоимости рулона термоленты).

Но мы не будем напрямую сравнивать полученные фото, потому что это совсем разные истории. Итак, давайте про эту поделку.

Де-факто у меня получилась моментальная камера, которая печатает фотографии с помощью термопринтера — как чеки на контрольно-кассовых терминалах. Само собой, качество фотографий не такое высокое, как у самопроявляющейся пленки Polaroid. Но своё, гм, очарование у этого тоже есть.

Так вот.

Читать далее

Метрики упали в лужу

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели5.4K

Метрики могут «упасть» даже если вы ничего не меняли в модели.
Разбираемся, как распознать distribution shift и что с ним делать в продакшене.

Читать далее

Как навайбкодить полезный инструмент для работы с ВМ

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели15K

При решении очередной задачи по небольшой "модификации" ПО- возникло решение запуска его под ВМ. По рукой уже стояла Oracle VirtualBox. Но вот незадача- ПО опознало виртуалку и отказалось выдать триал период. 2 промпта и 3 минуты на копирование и сборку решили проблему.

Читать далее

Тридцать лет libmorph

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.7K

К тридцатилетию публикации проекта 1994 года, который остаётся самым скорострельным морфологическим анализатором.

Давным-давно, когда Рунет только появлялся, морфологические анализаторы и системы контроля орфографии уже производили вау-эффект: они не только сводили разные словоформы к основной (словарной), но и зачастую умели их склонять/спрягать, описывали грамматику вхождений и предлагали варианты замены ошибочных начертаний. Да и чуть позже, при появлении первого русского морфологического поиска в Интернет – это был Апорт! – на выставках тоже равнодушных не было. Тогда и родился libmorph.

Читать далее

LLM-агент для поиска свободных доменов: автоматизируем подбор

Время на прочтение12 мин
Охват и читатели14K

Каждый день регистрируются сотни тысяч новых доменов, поэтому найти среди оставшихся что-то короткое, понятное и незанятое становится сложнее. Хороший домен — это узнаваемость и доверие пользователя. 

Привет, Хабр! Меня зовут Сергей. Я работаю инженером в Selectel, а в свободное время пишу пет-проекты для души. Недавно я прикинул: а что, если прямо сейчас мне понадобится запустить свой бренд или продукт? Первое, во что упираешься в таких раздумьях — это выбор домена. В этой статье я покажу небольшой проект, благодаря которому можно подбирать доменные имена не вручную, а автоматически с применением ИИ-агентов. Удобно или нет, решайте сами, подробности под катом.

Читать далее

«Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели12K

Что будет, если столкнуть классический переборный алгоритм упаковки и «математику потока» на базе Numpy? Мы взяли реальный кейс на 398 предметов и проверили: можно ли за доли секунды найти решение, которое окажется дешевле и безопаснее ручного планирования.

Внутри — разбор «Бизнес-Ассемблера», борьба с весовыми лимитами и ответ на вопрос: почему при КПД 61% по объему контейнер может считаться идеально упакованным.

Читать далее

Пошаговые диалоги в Python без боли: описываем визарды в JSON, а не в if-ах

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели1.4K

Писать сложные диалоги в Telegram-ботах — это боль из вложенных if-ов, сломанных переходов и бесконечного рефакторинга. В этой статье — как мы вынесли всю логику визардов в JSON и сделали движок, который сам управляет шагами, условиями и навигацией.

Без спагетти-кода. Без привязки к платформе. С возможностью собрать рабочего бота за вечер.

Читать далее

Сравнение TTS-моделей на реальных задачах бизнеса: голосовой бот и аудиоподкасты

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.2K

Это вторая часть обзора моделей для задачи синтеза речи (Text-to-Speech). В прошлой части я сравнил 7 Open Source моделей для этой задачи по нескольким критериям. В этот раз я решил посмотреть не только на Open Source-модели, но и на проприетарные TTS-решения.

Читать далее

Как решать задачу NER на практике

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели11K

Рассказываю, как на практике решать задачу NER. На примере извлечения сущностей из резюме пройдём путь от разметки данных до работающего API. Меньше теории, больше практики.

🔥 Начинаем 🔥

Ближайшие события

Распознаём реквизиты из карточки контрагентов: Как мы сделали API для извлечения реквизитов из документов

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9.7K

Привет, Хабр!

Каждый, кто работал с бухгалтерией, CRM или просто заводил контрагента вручную, знает эту боль. Вам присылают карточку компании в PDF, договор в DOCX или просто текстовый файл с реквизитами. Задача: достать оттуда ИНН, КПП, расчётный счёт и БИК, чтобы не схлопотать штраф за неверные данные.

Можно нанимать стажёра, который будет перепечатывать это в Excel. А можно довериться машине.

Мы в нашей компании долгое время решали эту проблему для своих внутренних задач (интеграция с 1С и автоматизация документооборота), а в итоге обкатали решение и выпилили в отдельный публичный сервис. Сегодня расскажу, как наш API извлечения реквизитов работает под капотом, покажу примеры кода на 6 языках (включая 1С, куда без него) и честно расскажу о таймаутах и подводных камнях.

Читать далее

Как я собрал автономную AI-новостную систему за полтора месяца

Время на прочтение7 мин
Охват и читатели9.5K

Автор: Алексей Кравцов

Полтора месяца назад у меня было семь воркфлоу в n8n для новостного пайплайна. Каждый делал что-то своё. На бумаге красиво. На практике — постоянные затыки. Где-то новость застряла, непонятно где. Исправляешь одно — ломается другое.

Семь воркфлоу — семь точек отказа. И каждая ломается по-своему.

Сегодня та же задача решена иначе: 160 уникальных источников, 7127 записей в базе, 11 воркеров, 5 AI-агентов, локальная LLM на домашнем мини-ПК — и оркестратор, которому я просто пишу задачу в Telegram.

Без n8n. Без ручного управления. Почти без моего участия.

Вот как это вышло.

Читать далее

Сводка Аналитического Наблюдения — считаем сумму по столбцу в Python

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.2K

Всем привет, меня зовут Виталий, автор телеграмм канала Детектив данных, про мой путь в аналитике данных, мучаю питон и sql, строю графики и думаю как жить дальше.

По работе довольно много времени провожу в питоне и абсолютно всегда нужно контролировать чтобы в процессе работы с данными - эти данные не упустить, и если так произошло, то понять в какой момент нужно за ними вернуться.

Принять объект под наблюдение

Database-клиент для GigaIDE

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели5.9K

Продолжая тему инструментов, интегрированных в среду разработки, сегодня мы рассмотрим клиент для работы с базами данных, доступный пользователям GigaIDE. Для пользователей Community-версии доступен open source-плагин DB Navigator, который хорошо описан, например, здесь. Пользователям PRO-версии доступна пара расширений:

SQL — синтаксическая поддержка и форматирование SQL-кода;

Database — клиент баз данных с широким набором возможностей.

Читать далее

Как школьная идея «списка желаний» превратилась в сервис на 70 000 пользователей

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.9K

У меня обычная семья. Я и жена — айтишники, 2 сына, собака. Обычная работа, обычная школа, обычные прогулки в парке. 

Старший сын Егор  — стандартный школьник. Ходит на информатику, получает там пятерки, сидит за компом до глубокой ночи — то в играх, то в Blender. В какой-то момент открывает для себя вайбкодинг и между делом приносит новости типа “я сделал нейронку внутри Майнкрафта, она там сама живет”, или “мой блог с анимацией набрал 30к подписчиков”, а через неделю забивает на проект. 

Весной 2025го Егор приносит идею. Простую, даже немного наивную. “Хочу сделать бот — список желаний в Telegram и отправлять его родственникам. Потому что вы не знаете, что я хочу, и дарите фигню”. Хорошее описание боли, понятный вариант решения. 

Идея оказалась настолько очевидной, что сразу зацепила. Не как «давайте сделаем стартап», а как «А ведь это правда неудобно. Сделай, мы будем пользоваться».

Первый код бота он навайбкодил за пол дня. Это был не продукт. Это был набор кнопок, который позволял добавить несколько желаний и получить ссылкуна их список. Всё работало не идеально, с ошибками в текстах, местами ломалось, но это можно было использовать.

Жена помогла развернуть код на сервере, чтобы бот жил не только на локальной машине. Мы отдали бота посмотреть друзьям. Папа (я) сделал сайт Fishlist.ru на Tilda и запустил рекламу на 1000 рублей. Первые пользователи появились очень тихо. Никто не писал восторженных отзывов. Никто не говорил «это гениально». Люди просто начинали пользоваться: добавляли подарки, шарили вишлисты друзьям. 

Читать далее

Флип со стрекозой и ПэВ-диапазон чёрной дыры: как я выводил шмеля из крена в симуляции

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6K

Флип 360 градусов при ветре 5 м/с со стрекозой. Пчела и шмель. Как они привели меня к ПэВ диапазону чёрной дыры.

Читать далее

Как мы провели лоботомию 744-миллиардной нейросети GLM-5.1, чтобы запустить её на 16 ГБ VRAM

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели8.8K

У нас не было фермы. У нас была бесплатная виртуальная машина на Kaggle с одной старушкой NVIDIA T4 на 16 ГБ VRAM. И у нас была концепция экстремального MLOps под кодовым названием «Russian Winter 26».

В этой статье я расскажу, как мы вскрыли архитектуру самого тяжелого китайского гиганта, переписали математику матриц внимания, обошли хардкодные ограничения GQA и заставили ядро модели сделать первый вдох на бесплатном железе.

Читать далее