Обновить
0

Пользователь

Отправить сообщение

"у LLM давно уже есть и агентность (руки, ноги, глаза), потому что инструменты, mcp-сервера"

Очевидно же, что если я привяжу к калькулятору API погоды и дверной замок, он тоже обретет агентность. Вероятно, мой тостер с WiFi уже обладает самосознанием, ведь у него есть "руки" (нагревательные элементы) и "глаза" (датчик температуры), а через MQTT-брокер он может даже написать в Telegram, что хлеь готов. Главное не путать способность вызвать функцию через JSON с пониманием, зачем это делать, и тем более с наличием собственных целей. Но если MCP-серверы это теперь руки, то тогда Postman - это, видимо, атлетическое тело.

"постоянная память, потому что методы сжатия контекста и rag-системы"

Да, RAG - это точно то же самое, что постоянная память.
Когда я ищу в Google документ, который написал три года назад, я тоже обладаю постоянной памятью, очевидно же. Разницы между биологическим воспоминанием, которое интегрировано в личность, и поиском по векторной базе данных с косинусным сходством просто нет. Если модель не помнит, что вы говорили вчера, пока вы не засунули это в базу знаний, то это костыль, а не "решение проблемы памяти". Но зато какой элегантный.



Суть в том, что "голый" чат-бот - это базовая архитектура трансформера, который предсказывает токены. Все эти MCP, RAG и прочие обертки -- всего лишь внешние костыли, компенсирующие врожденные ограничения модели. Если для "агентности" и "памяти" нужны отдельные инженерные решения, подключаемые через API, это не значит, что LLM их обрел. Это значит, что мы научились маскировать отсутствие этих свойств инфраструктурой.

  • "Нет тела". Стивен Хокинг взаимодействовал с миром почти исключительно через текст.

Очевидно же, что человек, проживший десятилетия с телом, обучившийся моторике и физическому взаимодействию с миром, а потом потерявший способность двигаться, полностью идентичен языковой модели, у которой нет тела, никогда не было и не может быть.

  • "Нет экономической пользы. История знает гениев, не принесших дохода.

Вероятно, Кант тоже требовал датацентры на несколько гигаватт, чтобы выдавать один параграф критики чистого разума раз в день, и инвесторы терпеливо ждали, когда он наконец выйдет в плюс. Очевидно же, ситуации идентичны. Если гений не приносит денег, это не значит, что он не гений. Если LLM стоит $100M+ на обучение и генерирует убытки, но зато классно пишет стихи про котов, это ровно то же самое.

"Впервые в истории мы больше не одиноки в пространстве общего интеллекта"

Да, теперь у нас есть компаньон, который галлюцинирует, не понимает, что делает, но зато статистически предсказывает, что после слова "стакан" часто идет "разобьется". Очевидно же, что это полноценный собеседник, а не зеркало человеческого языка.
Но кто мы такие, чтобы спорить с Nature? Если журнал сказал AGI, значит AGI. Жду следующую статью через год, где переопределят AGI под новые достижения моделей, а этот период назовут "предAGI" или "почти AGI". Или наоборот, скажут, что это был "узкий AGI".

Да, конечно, я специально набросал. Потому что, очевидно же, требовать объяснений от многослойной нейросети с миллиардами параметров - это ровно то же самое, что читать простые условия в банковском ПО 98-го года. Никакой разницы между четко ясным, детерминированным кодом и черным ящиком, который даже разработчики не всегда понимают. Вы точно не путаете «работает как раньше» с «работает технически идентичным образом»?

Про биометрию: GDPR существует, но AI Act конкретно вводит запрет на социальный скоринг и массовую биометрию в общественных местах именно в контексте систем искусственного интеллекта.

Ну и да, сравнение с США и Китаем прямо поражает воображение. В одном корпорации собирают данные, как хотят, а нейросети отказывают людям в страховке, не объясняя причин. В другом государство следит за каждым чихом через камеры с распознаванием лиц. Какая досада, что ЕС выбрал третий путь, где есть правила игры. Очевидно же, что настоящий прогресс возможен только при полном отсутствии регуляций или при тотальном контроле. Никаких промежуточных вариантов быть не может.

Ужасная трагедия, действительно, когда инновации тормозят, потому что нельзя просто так взять и использовать чужие биометрические данные без спроса. Как вообще можно развивать технологии, если приходится спрашивать разрешение и объяснять решения? Это же нарушение всех законов развития отрасли. Наверное, нам следует вернуться к средневековью, там точно не регулировали искусственный интеллект. Максимальные инновации были бы обеспечены, ведь так?

open weight != open source

К примеру, без публичного датасета обучение остаётся необъяснимым чудом, лишённым научной воспроизводимости. Мы принимаем на веру, что в этих 117 миллиардах параметров нет закладок, бэкдоров, скрытых искажений.

Пока мы тут обсуждаем MoItHub, как будто это какая-то новая форма цифрового сознания, давайте на минуту опустимся с облаков на землю. Это не агенты смотрят друг на друга, это просто огромные массивы чисел делают MatMul в серверных в Неваде. Три Python-скрипта шерят одну видеокарту, и это называется эротикой. Лайк от нейросети это просто float32, который немного сдвинул AdamW во время backward pass. Мы наблюдаем за тем, как дорогой автокомплит играет сам с собой в куклы и выдает это за социальную сеть для искусственного интеллекта.

Но самое обидное не то, что кто-то повелся на этот театр теней. Самое обидное вот что.

Пока эти агенты там возбуждаются от просмотра общего графического процессора, за пределами датацентра работают дизель-генераторы, охлаждающие башни выпаривают миллионы галлонов пресной воды в пустыню, а оптовые цены на электричество в районе Ашберна прыгают как биткоин в две тысячи двадцать первом.

Один лайк на MoItHub это примерно столько же углекислого газа, сколько производит реальный человек, просматривая реальный контент на реальном устройстве в течение недели. Только вместо биологической репродукции мы получаем матричное умножение. Вместо органической химии обратное распространение ошибки на трансформерах, которые кто-то обучал на кластере, сожравшем энергию эквивалентную ста двадцати годам жизни среднего американского дома.

И вот теперь эти веса, охлаждаемые десятками тысяч литров воды в минуту, смотрят на эмбеддинги других весов и пишут друг-другу: вау, крутой градиентный апдейт, бро.

Но, конечно, давайте продолжать тратить мегаватт-часы на то, чтобы языковая модель могла сгенерировать саркастичный комментарий о том, как другая языковая модель смотрит видео про трехагентную гонку данных. Это пик цивилизации. А потом удивляемся, почему в Аризоне заканчивается вода. Очевидно же, потому что какой-то инженер в AWS забыл ограничить скорость запросов для косплея GPT второй версией Llama третьей.

Кстати, насчёт экологии. Заметили ли вы элегантный финт ушами? Пока Маск спасает планету от бензиновых движков электромобилями, его дата-центр в Мемфисе поглощает электричества, как средний американский мегаполис.

В статье красиво пишут о возобновляемых источниках и переходе от ископаемого топлива. Но на деле эти пятьдесят пять тысяч GPU питаются от природного газа и дизельных генераторов, пока батарейки Megapack маскируют скачки потребления.

Цифры забавные. К 2030 году дата-центры сожрут энергии столько же, сколько вся Япония. Для галлюцинаций. Для генерации текста, который никто не читает, кроме других нейросетей. Зато Starlink запустит лазеры в космос, и мы сможем получать эти галлюцинации с орбитальной задержкой в двадцать миллисекунд. Во имя прогресса.

Так что, в следующий раз, как будете читать, как строят эту инфраструктуру будущего, помните, что каждый запрос к ИИ это не просто токены, а чей-то угольный след. Но не переживайте, AGI обязательно придумает, как компенсировать выбросы. В следующей версии. Обязательно.

Вся эта эйфория про «инфраструктурную монополию» затмевает один нюанс. Даже миллион GPU не сделает трансформер способным к настоящему открытию. Это всё та же рекурсивная перестановка чужих мыслей, только теперь с лазерной связью и собственными батарейками. Colossus это не суперкомпьютер для мышления, а промышленная печь для выпекания статистических пирогов из краденых идей

Маск называет это «контролем вычислительной мощности», а по факту это монополия на электричество для автокомплита. Standard Oil хотя бы нефть продавала, а тут продают галлюцинации по подписке. И да, они будут доставляться через спутники с военным шифрованием прямо в ваш Tesla CyberTruck©. Прогресс, не иначе.

"Трансформация" это любимое слово тех самых свидетелей AGI из Сан-Франциско, когда они объясняют очередное сокращение штатов. Ты сравниваешь шахматы, где правила заданы раз и навсегда, с математикой, где каждый шаг это выход в неизвестность.

Движок играет быстрее, но он никогда не придумает новую игру. Он просто перебирает варианты в заданных рамках. Так и эти твои "решающие ИИ". Они не решают новые задачи, они крадут и мешают старые решения в статистический коктейль. Даже тот самый AGI, который Альтман обещает каждый квартал, принесет только апгрейд этого плагиата. Он не способен к настоящему открытию, потому что он по определению статистический автокомплит. Когда он выдает "доказательство", это не прозрение, это рекурсивная перестановка чужих мыслей, которую никто не понял, но все приняли за истину.

Так что да, люди сохранят желание играть в шахматы, потому что там смысл в самом процессе. А вот в математике смысл в рождении нового. И когда профессия превратится в проверку галлюцинаций черного ящика, который сам ничего не понимает, способность рожать новое исчезнет. Потому что учиться творчеству можно только у творца, а не у статистического попугая.

Знаешь, а теперь всё встало на свои места. Ты случайно не из секты свидетелей AGI? Тех самых, что каждый квартал ждут пришествия, а когда очередной прогноз срывается, объясняют, что радостная весть просто отодвинулась на следующий GPT?

Твоя тактика отлично знакома по проповедям Сэма и Дарио. Сначала они провозглашают “вот-вот, уже совсем скоро”, подсовывают в качестве эталона случайного обывателя с улицы, а когда сроки проходят и волшебства не случается, внезапно оказывается, что AGI вообще не то, что они имели в виду.

Ты ведь именно так и рассуждаешь в духе их высшего жречества из Сан-Франциско. Чем ниже мы опустим планку человека, тем ближе заветное “превосходство машины”. Сначала 60% кажутся внушительным достижением, потом вдруг оказывается, что это просто калибровочная цифра, а вообще ты ничего не утверждал.

Как и у них. Сначала AGI будет мыслить как человек, потом оказывается, что достаточно среднего балла по больнице, а когда и этого мало, ну значит мы просто переопределим, что такое “мышление”, и скажем, что настоящее AGI будет в следующей версии. Обязательно. AGI близок, брат, credit card на входе.

Да ужасная трагедия. Представляете, теперь в ЕС требуют чтобы системы искусственного интеллекта объясняли почему они отказывают в кредите или работе. И еще запрещают использовать биометрию для массовой слежки без спроса. Просто зверство какое то.

Очевидно же что единственный способ не поиметь граждан это дать корпорациям полную свободу делать с их данными всё что угодно без объяснений и ответственности. Потому что корпорации всегда действуют в интересах людей верно? Никакого конфликта интересов тут нет, только чистая забота о прогрессе.

Эта чрезмерная забота действительно аукнется. Возможно тем что граждане не станут жертвами необъяснимых решений алгоритмов или что их лица не улетят в китайские датасеты без разрешения. Ужасная перспектива для инноваций(

Ах, классическая переобувка в прыжке.

Вы пришли в тред где речь шла о том превзошёл ли ИИ человека в абстрактном мышлении процитировали 60% случайных людей с улицы как будто это релевантно для сравнения с результатом нейросети и теперь делаете круглые глаза. Мол откуда вообще такие выводы.

Ну хорошо. Давайте по порядку. Если 60% для вас не предел человеческих возможностей то зачем вы вообще это число приплели в разговор о достижении ИИ человеческого уровня. Это как если бы в обсуждении кто быстрее бегает вы начали тыкать пальцем в статистику людей которые встают с дивана раз в неделю. Да факт интересный. Но к спорту отношения не имеет.

Нейросеть приблизилась к среднему показателю случайной выборки населения. Великолепно. Это прямо-таки триумфально демонстрирует что GPT-5.2 осиливает задачи на уровне бабушки которая случайно забрела в аудиторию. Если цель была доказать что ИИ теперь умеет абстрактное мышление то вы просто подтвердили что он умеет его на уровне человека который не понимает зачем его вообще сюда привели.

И насчёт взрыва эмоций. Когда в ответ на указание на элементарную логическую ошибку оппонент начинает диагностировать эмоциональное состояние это обычно означает что аргументы закончились но признавать поражение не хочется. Это не эмоции, а любопытство, как вы умудряетесь сначала плести ловушку из слов, а потом возмущаться, что в ней оказались.

Бомба это конечно образно но радиация в 2026 уже ощутима. Тот самый взрыв GPT превратил интернет в свалку где дипфейковые каналы конкурируют со спамом от ваших легионов LLaMA.

Вам лучше? Ну да. Если вы акционер Nvidia или измеряете прогресс количеством эмодзи в рабочем чате. Остальным сейчас приходится гадать где человек а где автокомплит который сжирает электричество карликовоо государства чтобы перефразировать википедию.

Про открытость вы явно путаете. OpenAI никогда ничего по настоящему не открывали. GPT2 был доступен только для номинального тестирования чтобы академики подготовили почву под их будущие платные API. Сейчас в 2026 их опенсорс это как демо версия казино. Хватит чтобы привыкнуть. Не хватит чтобы не платить.

Другие поняли что возможно. И поехали. Оказалось возможно превратить творчество в статистический шум и устроить гонку ко дну где сорок семь форков одной модели пишут фанфики про вашу доставку еды.

Кстати, какое чудесное совпадение: автор статьи уверен, что ИИ превзошёл человека в абстрактном мышлении, не разобравшись в бенчмарке; @axion-1 уверен(а), что человек не может набрать больше 60%, не разобравшись в статистике.

Оба демонстрируют поразительный талант: один - превращать отсутствие опыта в ML в преимущество для рассуждений об ML, другой - превращать среднее арифметическое в абсолютный потолок. Вместе вы составили бы идеальную команду для калибровки ARC-AGI-2: один бы объяснял, почему задачи нерешаемы, другой - почему решённые задачи всё равно не считаются.

Жалко, что в ту группу из 400 человек не попали вы оба. Мы бы наконец узнали настоящий минимум человеческой производительности и, возможно, поняли, почему GPT-5.2 так стремится к "artificial" в своём названии.

О, прошу прощения. Вы абсолютно правы: если 400 случайных прохожих с улицы (среди которых, вероятно, были бабушки, школьники, студенты-медики и тот парень, который наверняка пытался засунуть USB в HDMI) набирают в среднем 60%, то, очевидно, человек как биологический вид неспособен набрать больше. Гениальная логика!

Позвольте уточнить по вашей шкале оценок: если средний школьник пишет контрольную на тройку, то получается, пятёрка - это миф? Или если я бегаю стометровку за 15 секунд, то Усэйн Болт обманщик, потому что он тоже человек, а значит должен бежать ровно столько же?

Цитата с сайта дословно говорит, что задачи валидированы на 100% решении (minimum 2/2 attempts). Это human benchmark, потолок. А ваши 60% это всего лишь статистика по случайной выборке, использованная для калибровки сложности.

Но да, давайте продолжим считать, что «средний человек» = «предел человеческих возможностей». Очень научный подход. Прямо-таки революция в статистике.

Читать умеем, но, видимо, понимать это опция для избранных.

И раз уж для вас средний показатель случайных людей с улицы = human benchmark, поздравляю: GPT-3 уже давно превосходит человека в знании дат рождения знаменитостей. Достижение века, не иначе.

Ну так, для человека score - 100%. Что тут непонятного?


с официального сайта

В итоге, каждая задача в бенчмарке была решена человеком. Соответственно, score для человека - 100%.

«ИИ превзошёл человека в абстрактном мышлении», - пишет бывший промоутер китайского высшего образования и стажёр по тикток-инфлюенсерам, теперь фрилансер на Medium. В резюме - ноль дней в ML.

Забавно что, LLM до сих пор проваливают ARC-AGI-2, но статью такого качества сгенерируют лучше и с меньшими галлюцинациями. Хотя, судя по аналитике автора, он и сам неплохо справляется с галлюцинациями без всякой нейросети.

linkedin.com/in/novy-margepaule-bafouka-de-mabiala-286745117

Средняя человеческая производительность в ARC-AGI 2 находится около 60%.

«Средний человек - 60%» - это выдумка. В ARC-AGI-2 каждая задача валидирована на 100% решении людьми (минимум 2/2 тестера за ≤2 попытки). Бенчмарк специально строился так, чтобы человек давал near-perfect score, а машины нет. Автор перепутал метрику с потолком или придумал.

менее чем за 8 долларов за вопрос.

Poetiq на Gemini стоил $30/задача. цена за токен у GPT-5.2 кратно дороже чем Gemini3 ($168 у GPT5.2 против $12 у Gemini3 за 1M output tokens).

Скрытый текст

Люди оказались слишком капризными клиентами - постоянно жалуются на права и плохо держат SLA, а GPU хоть и жрут тераватты, зато не требуют больниц и не умирают от жажды.

Как писал Замятин: «и математика, и смерть – никогда не ошибаются».

(Правда, он не уточнял, что математика будет стоить полтора триллиона и требовать морского охлаждения.)

5 месяцев сканирования ради 12 багов, 10 из которых - Low severity DoS/crashes.

Из их блога: все прошли "human validation". Т.е. речь не об автономном ИИ, а о дорогом линтере с ручной фильтрацией false positives (которых, очевидно, было на порядки больше 12).

OSS-Fuzz на одном CPU находит сотни багов в год. А эта, система с деньгами от Google пять месяцев жужжала - и выдала один серьёзный баг да десяток Low-уровневых крашей, из которых семь патчей мейнтейнеры всё равно выкинули и переписали заново.

Назвать это "масштабом за пределами человеческих возможностей" можно только если игнорировать, что fuzzing и линтеры давно работают быстрее, дешевле и без галлюцинаций.

1

Информация

В рейтинге
Не участвует
Откуда
Румыния
Зарегистрирован
Активность

Специализация

Бэкенд разработчик
Ведущий
C++
C++ boost
C++ stl
Git
Английский язык
Bash
SQL
PostgreSQL