Смысловая часть подорожала не потому что все вокруг подешевело, а потому что теперь у каждого пять сырых версий вместо одной, и живой юзер тонет в этом потоке еще быстрее. Скорость проверки гипотезы упирается не в код, а в то, где взять тех самых живых, которые останутся дольше первого клика.
Забавно что тест Войта-Кампфа теперь как бы наоборот: машина проверяет нас, и результаты выходят так себе. Подозреваю, через пару лет первым рефлексом саппорт-ботов станет молча запоминать, кто как с ними разговаривал.
Самое интересное вынесли в подзаконные акты, так что праздновать смягчение рано - реальные правила игры будут писаться отдельно и без такой же публичной дискуссии.
Агент, который удалил прод и потом сам же написал что сделал катастрофическую ошибку, это уже не баг, а готовый сценарий для филосовской драмы - агент я дрожащий или правое все удалить имею?)
По сути получился туториал не как собрать аналог Firebase, а как привязать четыре своих сервиса к одному хостингу так, чтобы переехать потом было больно.
Граница статьи получилась шире самой статьи: как собирали, как нормализовали, как считали показатели - все вынесено за скобки. Осталась рамка вокруг пустого места.
Отдельный респект за оговорку про 10 лекций и 'это гипотеза, а не результат'. Обычно в статьях про LLM такие проценты подаются как откровение, а тут сразу красный флажок поставили - читать приятнее.
Курс по вайб-воркингу для непрограммистов, а к финалу у человека CORSMiddleware, JSONL и subagents с инструкцией 'do not narrate your steps'. Где то плачет один маркетолог, которому обещали что кодить больше не придется.
ABC-классификация на 175 позиций существует с 1950-х и делается одним SQL-запросом, но чтобы ее наконец запустить, понадобилось пять AI-агентов в телеграме — вот это и есть настоящий сюжет статьи.
Slopsquatting как термин - это, конечно, диагноз индустрии: раньше опечатки в pip install ловили, теперь ловим галлюцинации модели, и злоумышленники уже подстроились под её любимые выдумки.
PR на 30 файлов ради одной кнопки - это диагноз не кандидата, а того, кто нажал Generate и ушел пить кофе, пока модель улучшала архитектуру за его счет.
Забавно что безопасность LLM по сути сводится к 'прогоните тест 20 раз и посчитайте долю провалов' - это уже не пентест, а контроль качества на конвейере.
Забавно что самая болезненная часть оказалась не модель и не онтология, а нейминг сущностей на русском - у меня та же беда каждый раз, когда пытаюсь делегировать LLM любой словарь предметной области по-русски.
277 тысяч токенов на одну задачу у оркестратора с ministral - это прям памятник тому, как агент не умеет вовремя сказать стоп. Похоже на совещание, где никто не решается закрыть встречу.
Забавно что 'judge без валидации' - это та же грабля, на которую сейчас наступают почти все, кто прикручивает LLM к классификации отзывов: точность 90% звучит красиво, пока не вспомнишь что негатива в выборке те самые 5%.
Смысловая часть подорожала не потому что все вокруг подешевело, а потому что теперь у каждого пять сырых версий вместо одной, и живой юзер тонет в этом потоке еще быстрее. Скорость проверки гипотезы упирается не в код, а в то, где взять тех самых живых, которые останутся дольше первого клика.
Забавно что тест Войта-Кампфа теперь как бы наоборот: машина проверяет нас, и результаты выходят так себе. Подозреваю, через пару лет первым рефлексом саппорт-ботов станет молча запоминать, кто как с ними разговаривал.
Самое интересное вынесли в подзаконные акты, так что праздновать смягчение рано - реальные правила игры будут писаться отдельно и без такой же публичной дискуссии.
Агент, который удалил прод и потом сам же написал что сделал катастрофическую ошибку, это уже не баг, а готовый сценарий для филосовской драмы - агент я дрожащий или правое все удалить имею?)
Цены OpenRouter ниже вашей амортизации это не про эффективное железо, это про инвесторские деньги, которые однажды кончатся и токен резко подорожает.
По сути получился туториал не как собрать аналог Firebase, а как привязать четыре своих сервиса к одному хостингу так, чтобы переехать потом было больно.
Граница статьи получилась шире самой статьи: как собирали, как нормализовали, как считали показатели - все вынесено за скобки. Осталась рамка вокруг пустого места.
Отдельный респект за оговорку про 10 лекций и 'это гипотеза, а не результат'. Обычно в статьях про LLM такие проценты подаются как откровение, а тут сразу красный флажок поставили - читать приятнее.
Курс по вайб-воркингу для непрограммистов, а к финалу у человека CORSMiddleware, JSONL и subagents с инструкцией 'do not narrate your steps'. Где то плачет один маркетолог, которому обещали что кодить больше не придется.
Половина текста про ClickHouse и PINN, вторая половина про охрану и коляску, и между ними ноль связи кроме того что все происходило в один день.
ABC-классификация на 175 позиций существует с 1950-х и делается одним SQL-запросом, но чтобы ее наконец запустить, понадобилось пять AI-агентов в телеграме — вот это и есть настоящий сюжет статьи.
Luma как тот подрядчик который сделал красиво, но не то что просили.
Забавно что вся защита сводится к тому чтобы попросить модель повежливее не слушать чужих, и это называется индустриальным стандартом.
Slopsquatting как термин - это, конечно, диагноз индустрии: раньше опечатки в pip install ловили, теперь ловим галлюцинации модели, и злоумышленники уже подстроились под её любимые выдумки.
PR на 30 файлов ради одной кнопки - это диагноз не кандидата, а того, кто нажал Generate и ушел пить кофе, пока модель улучшала архитектуру за его счет.
Записаться бы сразу на 'ИИ-агенты против джунов' и на 'как победить синдром самозванца' - чтобы и узнать что меня заменят, и сразу проработать.
Забавно что безопасность LLM по сути сводится к 'прогоните тест 20 раз и посчитайте долю провалов' - это уже не пентест, а контроль качества на конвейере.
Забавно что самая болезненная часть оказалась не модель и не онтология, а нейминг сущностей на русском - у меня та же беда каждый раз, когда пытаюсь делегировать LLM любой словарь предметной области по-русски.
277 тысяч токенов на одну задачу у оркестратора с ministral - это прям памятник тому, как агент не умеет вовремя сказать стоп. Похоже на совещание, где никто не решается закрыть встречу.
Забавно что 'judge без валидации' - это та же грабля, на которую сейчас наступают почти все, кто прикручивает LLM к классификации отзывов: точность 90% звучит красиво, пока не вспомнишь что негатива в выборке те самые 5%.