Pull to refresh
32K+
42
Алексей@xonika9

Инди-хакер

33,5
Rating
99
Subscribers
Send message

Harness кодинг‑агента: разобрал исходники Codex, OpenCode, Pi и свою собственную

Level of difficultyMedium
Reading time18 min
Reach and readers14K

Я собираю своего кодинг‑агента поверх моделей OpenAI. Базовый агентный цикл написал сам на Pydantic AI, и он быстро заработал. А потом начались сложные узлы: как сжимать распухший контекст, как не дать агенту делать заново уже сделанное, как понять, что он правда закончил, а не выдохся. На каждом таком узле я застревал и шёл смотреть, как это решают взрослые. Благо исходники Codex, OpenCode и Pi лежат открыто, а архитектуру Claude Code Anthropic описывает сама.

Оказалось, кодинг‑агенты различаются не моделью внутри и не списком фич на лендинге. Они различаются архитектурными ставками обвязки, и эти ставки видны прямо в коде. Дальше — разбор по ставкам, с примерами кода, и попытка понять, какие из этих ставок стоит закладывать всерьёз, а какие проживут до следующего сильного релиза модели.

Читать далее

AI Engineer World's Fair 2026: разбор докладов и куда движется AI-инженерия

Level of difficultyEasy
Reading time8 min
Reach and readers8K

AI Engineer World's Fair 2026 уже прошла, а по-русски её так никто и не разобрал. В официальном расписании 560 сессий: воркшопы, кейноуты, доклады. Глазами это не осилить.

Я собрал агентный пайплайн, прогнал через него доступные записи и сел читать конференцию про агентов с помощью агента. Рассказываю, что в записях повторялось из доклада в доклад, куда сходится AI-инженерия и что посмотреть, если время есть только на пять роликов.

Все доступные доклады с русскими саммари, таймкодами и тематическим навигатором я собрал в отдельном SPA.

Читать далее

Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching

Level of difficultyMedium
Reading time11 min
Reach and readers6.5K

В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост, один символ в системном промпте обнуляет весь кэш. Правило рабочее, я сам собираю агента вокруг него. Но жить по закону, которого не понимаешь, неуютно.

vLLM и paged attention я руками не писал, зато исходники открыты, и я полез в них за байтовой причиной. Что физически лежит на GPU в момент попадания в кэш, как движок управляет этой памятью и почему хватает одного символа, чтобы всё посыпалось.

Читать далее

Prompt caching: оптимизация, которая наказывает молчанием

Level of difficultyEasy
Reading time12 min
Reach and readers5.1K

Из всех способов сэкономить на работе с LLM prompt caching самый коварный. Сложным его не назовёшь, дело в другом: он тихий. Почти любая оптимизация, если ты её сломал, даёт о себе знать: падает тест, краснеет лог, валится метрика. Кэш так не делает. Он не падает с ошибкой, он просто молча перестаёт срабатывать. И единственное, что меняется, это счёт в конце месяца и пара лишних секунд на каждый ответ.

Я долго про кэш не вспоминал: у OpenAI он включается сам, без флагов, и за запись денег не берёт. Ловушка ровно в этом удобстве. Разбираю, что на самом деле кэшируется (не текст и не ответ модели), почему хватает одного символа в начале промпта, чтобы всё обнулить, чем отличается подход OpenAI, Anthropic и Gemini и как убедиться, что кэш реально работает.

Читать далее

Clawdbot → Moltbot → OpenClaw ≠ магия: честный гайд по приручению AI-ассистента

Level of difficultyEasy
Reading time31 min
Reach and readers225K

Подробный разбор OpenClaw (бывший Clawdbot). Рассказываю, почему для личного Джарвиса не нужен Mac Mini, как развернуть систему на VPS за $5 и к каким техническим нюансам стоит подготовиться

Читать далее

Итоги 2025 в AI: прорывы, которые сдвинули индустрию, и ставки на 2026

Level of difficultyEasy
Reading time17 min
Reach and readers7K

2025-й стал годом перехода от эффектных демо к суровой инженерной рутине. В этой статье я подвожу личные итоги года, анализируя работу с GPT-5.1, Claude 4.5 и локальными моделями, а также разбираю, как изменились наши требования к кодингу, видеогенерации и научным исследованиям. В финале — прагматичный прогноз на 2026 год.

Читать далее

LatentMAS: Секрет AI-агентов, которые думают без слов, работают точнее и экономят до 80% токенов

Level of difficultyEasy
Reading time18 min
Reach and readers4.8K

Классические AI-агенты общаются текстом — это дорого и медленно. LatentMAS раскрывает секрет "безмолвного" общения: агенты обмениваются "мыслями" напрямую через общую латентную память (KV-кэш). Разбираемся, как эта архитектура позволяет добиться двузначного прироста точности и радикально сократить расходы на токены.

Читать далее

Мультимодальный AI в 2025: как GPT‑5.1, Gemini, Claude и Grok научились понимать текст, изображения и видео одновременно

Level of difficultyEasy
Reading time25 min
Reach and readers5.5K

В 2020 году AI был архипелагом изолированных моделей. К 2025-му всё изменилось. Эта статья — глубокое погружение в единую парадигму Next Token Prediction, которая позволила GPT-5.1, Gemini, Claude и Grok научиться понимать текст, изображения и видео одновременно. Разбираем, как это работает, и на что способны флагманские модели сегодня.

Читать далее

Сначала был кремний: Почему архитектура чипов, а не код, определяет будущее AI

Level of difficultyEasy
Reading time13 min
Reach and readers5.6K

Мы, разработчики, верим, что наш код — движущая сила AI. Но что, если все наши решения предопределены архитектурой чипов? Эта статья — погружение в «кремниевую геологию»: от монополии NVIDIA и CUDA до восстания альтернатив вроде Groq и Cerebras, кастомных чипов Google и Apple и геополитической войны, которая меняет правила игры для каждого из нас.

Читать далее

Два пути из Тирании Квадрата: Сравнительный разбор MoE и SSM как наследников Трансформера

Level of difficultyEasy
Reading time12 min
Reach and readers5.4K

Архитектура Трансформеров уперлась в стену квадратичной сложности O(n²), или «Тиранию Квадрата». В статье мы разбираем два пути решения этой проблемы: Mixture-of-Experts (MoE), масштабирующий знания, и State Space Models (SSM), масштабирующий контекст. Это сравнительный анализ архитектур, которые определяют будущее AI.

Читать далее

Локальный AI: Прагматичное руководство по запуску LLM на своем железе

Level of difficultyEasy
Reading time18 min
Reach and readers105K

Устали от счетов за API и переживаете за конфиденциальность данных? Пришло время построить свою «AI-кухню» и вернуть контроль. Этот гайд — ваш пошаговый план: от выбора идеальной видеокарты до запуска первой модели через Ollama или LM Studio. Превратите свой ПК в суверенный AI-воркстейшн.

Читать далее

Экономика результатов: Настоящая революция AI-агентов, которую все упускают

Level of difficultyEasy
Reading time12 min
Reach and readers14K

За хайпом вокруг AI‑агентов скрывается фундаментальный сдвиг — переход от «экономики инструментов» к «экономике результатов». Эта статья представляет фреймворк «Трех горизонтов» для оценки бизнес‑амбиций и помогает технологическим лидерам сделать стратегический выбор: стать «Мастером», оптимизирующим процессы, или «Архитектором», строящим новые бизнес‑модели.

Читать далее

AI-ученые уже здесь: Большой тур по LLM, которые меняют фундаментальную науку

Level of difficultyEasy
Reading time17 min
Reach and readers8.6K

Искусственный интеллект превращается из инструмента в полноценного партнера ученого. В этом большом обзоре мы рассмотрим, как LLM вроде AlphaFold 3, TxGemma и ChemLLM совершают революцию в биологии, медицине, химии и материаловедении, переходя от анализа данных к проектированию будущего.

Читать далее

Новые правила игры: что GPT-5, Genie 3 и Qwen-Image говорят о будущем AI

Level of difficultyEasy
Reading time7 min
Reach and readers12K

В начале августа 2025 года OpenAI, Google DeepMind и Alibaba представили релизы, которые меняют правила игры. Мы анализируем долгожданный GPT-5 и open-source модели от OpenAI, прорыв Google в симуляции миров с Genie 3 и элегантное решение Alibaba проблемы с текстом на изображениях с помощью Qwen-Image. Это разбор не только технологий, но и ключевых трендов, определяющих будущее AI.

Читать далее

Анатомия памяти LLM: Почему будущее не за промптами, а за Инженерией Контекста

Level of difficultyEasy
Reading time15 min
Reach and readers22K

Мой счет за Google API взлетел до €51 из-за контекста LLM. Эта статья раскрывает, почему "память" моделей так дорога, как работает механизм Внимания, и предлагает 5 хаков для управления контекстом. Узнайте, почему будущее за Инженерией Контекста, а не за промптами.

Читать далее

Путешествие одного промпта: Что на самом деле происходит под капотом у LLM?

Level of difficultyEasy
Reading time15 min
Reach and readers13K

Загадка работы LLM: что происходит, когда вы нажимаете Enter? Разбираем пошагово путь вашего промпта от токенизации до генерации ответа. Узнайте, как устроены большие языковые модели, как ими управлять и какие мифы они развеивают.

Читать далее

Умный поиск по заметкам: как оживить «второй мозг» с помощью RAG

Level of difficultyMedium
Reading time16 min
Reach and readers12K

Ваша база знаний превратилась в кладбище идей? Я построил RAG-систему, чтобы мой "второй мозг" ожил и стал собеседником. Узнайте, как перейти от хаотичного поиска к осмысленному диалогу с вашими заметками и получить измеримую выгоду для бизнеса.

Читать далее

MiniMax-M1: Разбираем архитектуру, ломающую законы масштабирования (и наш VRAM)

Level of difficultyMedium
Reading time9 min
Reach and readers4K

В мире LLM доминирует квадратичная сложность, ограничивающая контекст. Но MiniMax-M1 бросает вызов: миллион токенов, низкие затраты. Разбираем гибридную архитектуру с Lightning Attention, новый алгоритм CISPO и инженерные прорывы, делающие эту модель уникальной.

Читать далее

Иллюзия мышления: Почему «думающие» модели на самом деле не думают (и что об этом говорит новое исследование Apple)

Level of difficultyMedium
Reading time9 min
Reach and readers9.8K

Новое исследование Apple шокирует: «рассуждающие» нейросети лишь имитируют мышление, проваливаясь на сложных задачах. Но Anthropic в ответ заявляет, что проблема не в ИИ, а в некорректных тестах. Разбираемся в главном споре о возможностях современных языковых моделей.

Читать далее

Стеклянный фасад Apple: почему новый дизайн iOS 26 и macOS — красивая ошибка

Level of difficultyEasy
Reading time4 min
Reach and readers15K

Apple на WWDC 2025 представила радикальный редизайн Liquid Glass. Разбираемся, почему эта красивая концепция может стать провалом с точки зрения юзабилити и доступности, анализируем реакцию сообщества и вспоминаем, почему мы уже видели нечто подобное (и это плохо кончилось).

Читать далее

Information

Rating
241-st
Registered
Activity