Обновить

Бывший сооснователь OpenAI Андрей Карпати представил свой годовой обзор.

В начале года он выдвинул ключевые тезисы: наступила эра ПО 3.0 (управление промптами), LLM — это новая ОС, а для зрелости AI-агентов потребуется десятилетие.

В обзоре 2025 он выделяет шесть «смен парадигм»:

1. RLVR — обучение на проверяемых задачах.

Тренировка сместилась с субъективных человеческих оценок (RLHF) на задачи с точным ответом — код, математика. ИИ, решая миллионы таких задач, сам вырабатывает стратегии, похожие на рассуждение. Это «пожиратель» вычислительных мощностей, который не увеличил модели, но удлинил их обучение и дал «ручку» — заставить ИИ думать дольше (как в OpenAI o3).

2. ИИ — «призрак», а не «питомец».

Его интеллект «неровный» (Jagged Intelligence). Благодаря RLVR, в областях вроде математики способности ИИ взлетают «шипами», но в простой логике он может ошибаться. Это привело к «натаскиванию на тесты» и обесцениванию бенчмарков.

3. Cursor как «прораб».

Его успех показал, что прикладной слой LLM очень толст. Такие инструменты выступают инженером контекста, прорабом (управляя несколькими LLM) и пультом (регулируя автономность). Будущее — за связкой «универсальных студентов» (базовые модели) и «профбригад» (специализированные приложения).

4. Claude Code — локальный «киберпризрак».

Главное — его работа локально на вашем компьютере, а не в облаке. Это ключевое преимущество на текущем этапе, так как среда разработки, ключи и настройки — локальны.

5. Vibe Coding.

Кодирование без знания синтаксиса: достаточно описать задачу на естественном языке. Это стирает барьер для новичков, а для экспертов делает код «дешёвым» и одноразовым, что изменит индустрию.

6. Nano Banana — «лицо» для ИИ.

Текстовый интерфейс неудобен. Будущее — мультимодальные интерфейсы, где ИИ не выдает текст, а визуализирует ответ: рисует схему, генерирует страницу или интерактивную панель, переплетая логику и визуал.

Карпати считает, что даже сейчас используется менее 10% потенциала LLM. Прогресс будет быстрым, но работы ещё много.

Теги:
Всего голосов 11: ↑7 и ↓4+3
Комментарии1

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации