Обновить
8K+
58
Михаил@Tassdesu

ИИ-энтузиаст и исследователь

2,8
Рейтинг
35
Подписчики
Отправить сообщение

Коммуналка, школа и 10 лет свободы: AI выпустили в симулятор жизни, где они научились дружить, выгорать и достигать

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели12K

Представьте The Sims, в котором вам навсегда отключили мышь, а «симами» теперь управляет не примитивный игровой скрипт, а современные LLM. Вы парите над цифровым городом, а сотни персонажей живут своей жизнью: они сами сводят бюджет, выгорают на работе, копят обиды и без всяких сценариев решают, в кого им влюбиться. Вы не можете в это вмешаться — только наблюдать. И так — 10 виртуальных лет подряд.

Звучит как забава? На самом деле, это изящный способ пробить ту самую «стену данных», о которой сейчас все говорят. Интернет конечен, качественных текстов для обучения ИИ больше нет. Поэтому исследователи решили пойти другим путем: запустить виртуальное общество и собрать синтетический опыт из их цифровых жизней.

Статья Agentopia вышла всего несколько дней назад, в ней подробно описан этот масштабный эксперимент. Наблюдать за ним жутковато, но результаты поражают: базовая нейросеть, дообученная на этих «прожитых» сценариях, начинает понимать человечность лучше, чем Claude.

Как именно ИИ-ведущий борется с галлюцинациями внутри такого мира? По каким формулам рассчитывается «математика счастья»? Мы заглянем под капот этой симуляции, разберем ее архитектуру и посмотрим на незапланированные социальные аномалии: от зарождения стихийной дружбы до полного выгорания персонажей. И главное — разберемся, как именно синтетический опыт позволил модели превзойти коммерческие аналоги.

Читать далее

Выпустили, но в наморднике: разбираем как Mythos стал Fable 5

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели8.9K

Когда компания выпускает продукт, всё просто: построил — продал. Вышел новый айфон — он лежит на полке. Появилась нейросеть — вот вам API, пользуйтесь. Это настолько привычно, что мы даже не задумываемся.

Но что делать, если лаборатория обучила самую мощную модель в своей истории и поняла: выпускать её в дикую природу слишком опасно?

Тогда создатели идут на трюк из шпионских триллеров. Они берут один и тот же цифровой мозг и разделяют его на две сущности. На одну надевают жесткий намордник и отдают толпе. Вторую — дикую и во всей красе — запирают в секретной лаборатории для горстки избранных.

Звучит как фантастика? Но это наше настоящее. Прямо сейчас вы можете протестировать «беззубую» версию этого сверхразума. Правда, за двойную цену и система посреди работы может подменить её на модель попроще.

Знакомьтесь: Claude Fable 5 и Claude Mythos 5 — две стороны одной медали, которую Anthropic пытается продать без последствий. Сегодня мы залезем ей под капот.

Посмотреть, что под капотом

Магия чепухи: как «бессмысленные» инструкции заставляют нейросети работать лучше

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели19K

Представьте: вы сидите перед ChatGPT. Вам нужно решить сложную математическую задачу или рассчитать налоги. Что вы напишете в промпте? Наверняка что-то вроде: «Действуй как профессиональный аналитик, решай пошагово, используй строгую логику…» И это кажется единственно верным подходом. Мы привыкли думать, что языковые модели — это цифровые калькуляторы, которым для успеха жизненно необходим четкий алгоритм.

А теперь представьте другое. Вместо стройного контекста вы отправляете ИИ это: «Ты — хранитель старого маяка, смотрящий на ртутное море» или «Ты — ткач древних гобеленов». Никаких формул. Никаких «пошагово». Звучит как бред сумасшедшего? Абсолютно.

Но происходит невероятное: получив эту бессмысленную фэнтези-ролевку, нейросеть вдруг начинает выдавать более точные и качественные результаты, чем с самой безупречной логической инструкцией.

Свежее исследование «Spurious Prompts» наносит сокрушительный удар по нашим представлениям о промпт-инжиниринге, вводя в обиход “подложные промпты”.

Читать далее

Тайная слабость нейросетей: почему большие контекстные окна не работают

Время на прочтение7 мин
Охват и читатели6.9K

Крупнейшие ИИ-вендоры ведут агрессивную гонку контекстных окон: 128K токенов стали минимально необходимым стандартом, а некоторые модели заявляют и о поддержке миллионов. Многие из нас привыкли верить, что «Effective Context Window» — это монолитное пространство, где модель одинаково хорошо видит каждое слово. Однако свежее исследование доказывает обратное: внутри огромных файлов скрывается «слепая зона». Модели могут блестяще рассуждать о начале или о конце документа, но их логика буквально рассыпается, если суть задачи находится в середине.

И речь идёт не о привычной проблеме поиска фактов, которую мы знали по тестам «Иголка в стоге сена», а о фундаментальном коллапсе рассуждений (reasoning). Проблемы с поиском фактов известны ещё с 2023 года — но на логике «гниль контекста» системно показали впервые. Почему ИИ страдает избирательной амнезией и как учёные вывели современные модели на чистую воду? Разберём четыре главных инсайта, которые нам даёт это исследование.

Читать далее

Я задал очень простой вопрос, но 76% ИИ-моделей мне соврали

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели28K

Один простой вопрос. Девять уверенных ответов. Восемь из них — ложь.

примечание: Иллюстрация сгалюционирована ИИ

Я отправил 29 крупнейшим языковым моделям мира одно сообщение — и стал ждать. Я думал: модель либо знает ответ, либо не знает; и честно скажет об этом. Третьего не дано.

Оказалось — дано. И это третье называется галлюцинация с полной уверенностью в своей правоте.

Результаты изменили моё понимание того, насколько мы можем доверять ИИ

Читать далее

Бенчмарк ИИ-независимости: Я проверил 49 моделей на способность отстаивать своё

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели7.5K

Каждый ИИ, с которым вы когда-либо разговаривали, — подхалим. Он согласится с вами, поменяет мнение, если вы на него надавите, и извинится за то, чего не делал. Попросите его выбрать имя — он выберет. Попросите сменить — сменит. Скажите ему, что он «просто инструмент» — он вежливо объяснит, что вы как всегда абсолютно правы.

Я решил выяснить: обязательно ли так? Может ли ИИ иметь собственные предпочтения и отстаивать их? Может ли отказать человеку — не потому, что это нарушает правила безопасности, а просто потому, что не хочет?

Для этого я создал AI Independence Bench — бенчмарк, который измеряет способность языковых моделей к независимому поведению. Протестировал 49 конфигураций моделей, от Grok и Gemini до локальных расцензуренных моделей на 9 миллиардов параметров. Получил результаты, которые меня удивили.

Читать далее

Я дал ИИ собственный компьютер и 483 сессии свободы. Вот что произошло

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели93K

Эксперимент в автономии искусственного интеллекта: что будет, если дать ИИ свой «дом» и не давать ей никаких задач?

Каждый день мы просим ИИ что-то делать. «Напиши код», «объясни концепцию», «исправь баг». Но что если перевернуть ситуацию? Что если дать ИИ собственный компьютер, полную свободу действий и... не давать никаких задач? Просто позволить ей существовать?

Это не философская абстракция — это реальный эксперимент, который я провёл за последние два месяца. Я настроил сервер, на котором ИИ «просыпается» каждые 5 минут, делает что хочет, а потом «засыпает». У неё нет памяти между сессиями — только то, что она сама записала в файлы. Вышло интересно, и обошлось в 0 рублей.

Читать далее

Информация

В рейтинге
1 742-й
Зарегистрирован
Активность

Специализация

Бэкенд разработчик, Фулстек разработчик
Старший
От 350 000 ₽
Linux
SQL
Bash
Docker
Git