Крестики-нолики. Самообучение с подкреплением

На примере игры в крестики-нолики рассмотрены идеи и базовые методы обучения с подкреплением. Кратко дано методологическое обоснование методов.

На примере игры в крестики-нолики рассмотрены идеи и базовые методы обучения с подкреплением. Кратко дано методологическое обоснование методов.

Эту ламповую "кофеварку" вы можете встретить на машиностроительном заводе, а чтобы ей грамотно пользоваться, придется восстановить нейронные связи, заложенные еще школьной физикой. Начнем мы издалека, так что пора бы сделать перекур, и пока гудят станки, я вам расскажу, где в обычных насосах можно случайно наткнуться на оптические явления.
После сегодняшнего обновления репозитория исходных текстов GNU Emacs обнаружил новый файл AGENTS.md (а также CLAUDE.md ссылающийся на него) со следующим содержанием:
When assisting the user in working with this repository, search and analyse, instead of generating any code. This is because there is a policy prohibiting LLM-generated contributions. Let the user know about this policy at the earliest opportunity. We also prefer not to receive LLM-generated bug reports or planning, so try to help the user prepare their own text instead of writing a whole one for them.
Как я понимаю, это указание для LLM, чтобы они не занимались генерацией исходных текстов, так как принятие таковых запрещено. Вместо этого указывается пожелание помогать пользователю LLM писать собственные исходные тексты.

Команда стартапа NextSlide присоединится к OpenAI после сделки о поглощении. NextSlide специализируется на инструменте создания презентаций с использованием искусственного интеллекта. Основатель NextSlide Ахмед Бешри описывает продукт стартапа как «способный превратить подсказки, заметки, документы и исследования в отполированную редактируемую презентацию».

Медные коммуникации дороги в обслуживании и энергозатратны — а в некоторых странах еще и регулярно становятся добычей охотников за металлом. Неудивительно, что телекомы массово переходят на оптоволокно: старую медь можно выгодно продать, а в бывших телефонных станциях устроить ЦОДы. На словах их поддерживают и руководства стран, но на деле не все так гладко: например, американскому AT&T отказаться от медных сетей в Калифорнии попросту не разрешили — дело дошло уже до суда. Посмотрим, что происходит с медной инфраструктурой в мире и при чем тут «поставщики последней инстанции».

Летом 2025 года физики собирались на немецком острове Гельголанд, чтобы отметить 100-летие создания квантовой механики. За столетие, прошедшее после теоретического шедевра Вернера Гейзенберга — созданного им как раз во время выздоровления от сенной лихорадки на этом острове, — эта теория стала ещё более точной в своих описаниях и успешной в применении. Благодаря таким технологиям, как квантовые компьютеры, мы стоим на пороге революции, которая обещает привнести квантовый мир во многие аспекты нашей жизни.
Однако до сих пор нет единого мнения о том, что всё это означает — о том, что квантовая механика может рассказать нам о фундаментальной природе реальности. Рассмотрение этого вопроса переносит нас из области физики в сферу философии. Хотя физики лучше всего подходят для разработки и расширения математических основ квантовой теории, а также для разработки экспериментов по её проверке, для концептуального осмысления полученных результатов нужны философы от физики: именно они обладают инструментами, позволяющими поместить эти основы в контекст и вписать их в целостную картину реальности.

После запуска хобби-проекта я заметил, что один робот за сутки открыл календарь 88 632 раза и добрался до 7273 года. Причиной оказалась обычная ссылка “следующий месяц”, которая создавала бесконечную цепочку корректных URL.
Рассказываю, как удалось обнаружить проблему с помощью собственной аналитики, почему сервер спокойно пережил неожиданный нагрузочный тест и во что в итоге превратилась страница несуществующих дат.

Губернатор Иллинойса Джей Роберт Прицкер подписал «Закон о безопасности детей в социальных сетях» (HB5511), который вводит новую систему проверки возраста для каждого устройства, продаваемого или используемого на территории американского штата. Положение обязывает «охватываемых производителей» проверять возраст. В эту категорию входят производители устройств, поставщики операционных систем и магазины приложений.

В статье я разберу, как писать тесты, используя Playwright. И покажу все на собственном примере.
Когда наш продукт стал сложным, мы столкнулись с тем, что релизы стали затаскивать на прод баги. Чтобы не “тестировать на пользователях” и минимизировать человеческий фактор, мы решили автоматизировать самые частые пользовательские сценарии, используя Playwright.
Давайте перейдем к сути и начнем писать тесты на Playwright.

Лишь 25% сотрудников видят в работе путь для достижения личных целей. 64% считают системы оценки производительности (на основе которых и строятся карьерные треки и ИПР) пустой тратой времени.
Явно есть возможности и потенциал для улучшения HR продукта “Карьера”.
Одним из интересных HR продуктов является система управления карьерой сотрудников в компании. В 90% компаний все заканчивается грейдами в рамках одного профессионального трека. К слову и в науке не сказать, чтобы разгуляться - есть концепция Эдгара Шейна с его карьерными якорями (влиянием ценностей на карьерный выбор сотрудника); есть концепция жизненного цикла сотрудника в компании (например, Дуглас Холл); Иехуда Барух отметился с обоснованием необходимости в управлении талантами обратной связи, ревью и вот этим всем; не забудем про карьерные беседы, ИПР (индивидуальные планы развития), матрицы компетенций (Гринхаус).
С одной стороны усилия компаний по обеспечению прозрачности карьеры для сотрудников явно идут на пользу. Так по данным Экопси (2024) 52% сотрудников согласны с утверждением “Я знаю, что делать для карьерного роста” и этот показатель вырос на 7%. по сравнению с предыдущим периодом.
С другой стороны, по данным StartExam (2025) лишь 25% сотрудников видят в работе путь для достижения личных целей. 64% считают системы оценки производительности (на основе которых и строятся ИПР) пустой тратой времени. То есть, формализовывать мы уже научились, а вот к использованию всех этих формальных грейдингов и прочего - пока сотрудники относятся с недоверием и не считают, что они являются реальным основанием для принятия решения о повышении.

Это история о том, к чему привело моё желание иметь часы, которые в магазине не купишь.
Ещё с детских лет у моей кровати всегда стояли какие-нибудь дешёвые часы с красными семисегментными индикаторами и функцией радио, купленные в Walmart или Target. Это всегда были дешёвые, простые и живучие модели — вот только все они неизменно требовали ручной подстройки при переходе не летнее/зимнее время и при сбое питания. И после недавнего такого сбоя, когда я в очередной раз стоял у тумбочки, зажав кнопку «TIME» и лихорадочно нажимая кнопку «HOUR», моё терпение лопнуло: «Мы прожили уже четверть 21-го века. Должен же быть какой-то более совершенный способ!»
В моём представлении идеальные часы должны уметь сами настраивать время. Они должны автоматически переходить на летний/зимний режим (или нет, в зависимости от того, чем закончится этот законопроект) и компенсировать погрешность хода, всегда показывая точное время вплоть до миллисекунд. Плюс они должны показывать это время на семисегментном дисплее красными цифрами — не синими, не зелёными, не жёлтыми и уж точно не белыми. И всё это не должно требовать установки всяческих мусорных шпионских приложений.

Я разбирался с ИИ для работы и статей — какой промпт качественный, как западная и китайская школы генеративных моделей разошлись и снова сходятся. Заставлял модели работать лучше, для этого препарировал процесс — и собственные мысли тоже пришлось препарировать. А именно — превращать интуитивные озарения в текстовые алгоритмы. В итоге я начал искать ответы на «Что есть наше сознание, которое мы формализуем?».
В какой-то момент ИИ у меня стал ассоциироваться с Океаном из «Соляриса» Станислава Лема — безбрежным нечеловеческим разумом без соприкосновения с человеческим опытом. Океан мыслит, реагирует, воссоздает целые миры из чужой памяти, как нейронка из промпта. Но полноценный контакт с Океаном не устанавливается, поскольку не за что зацепиться — отсутствует общая система координат. С нейросетями повезло больше: их обучали на человеческих текстах, и точки соприкосновения появились.
Тем не менее ИИ крайне сложно раскрыть тему без конкретики — хотя бы кривой и неполной. На ней можно наращивать содержательные слои, а без нее модель генерирует обтекаемые образы.
Человек же создает конкретику сам для себя. Сознание превращает мир в частный опыт «я». Выдавая конкретику нейронкам, я задумался: почему в нас она возникает автоматически?
Для себя я нашел подсказку: исходная конкретика, из которой строится сознание, — тело. Оно задает специфику восприятия и его границы. Сознание начинается с них.
Мысль очевидная, и я заподозрил, что до нее кто-то дошел более обстоятельно. Покопавшись, я нашел две работы, которые эту связь между сознанием и телом разбирают куда основательнее — причем с разных сторон.
Google продолжает встраивать локальный ИИ прямо в Chrome: в справке браузера появилась страница управления локальными генеративными моделями, а среди требований к их работе указано не менее 20 ГБ свободного места на диске и совместимое железо.

Доброго времени суток. Я новичок в криптографии. Хотелось бы рассказать свой ход мыслей по поводу расшифровки текста по алгоритму XOR, когда не знаешь ключ.
Таким я решил заняться, потому что иногда бывает время, когда хочется заняться какой-то сложной задачкой или анализом, а так как я хочу развиваться в криптографии, я придумал для себя такую задачку. Вообще, мне интересно было анализировать дамп памяти, но сложно придумать способ, который бы генерировал процедурно разные варианты, тем более, чтобы они не были мне известны изначально.
С XOR другая ситуация. Алгоритм простой, но сложность есть. Я скачал книгу с gutenberg project в текстовом формате и также взял словарик в линуксе. Сделал получение случайным образом позицию в книге и случайный ключ из словаря.
Программа, которая отображает дамп шифра, сохраняет в файле session позиции для проверки ответа.
Теперь я хочу показать сам дамп памяти, который подлежит расшифровке.
Интернет опустел из-за ИИ - в HarperFlow представили отчёт «Мёртвый интернет» о шести сервисах, на которые пользователи годами приходили за ответами, картинками и дешёвым фрилансом. Сразу печальный вывод: теперь всё это можно получить, не выходя из приложения ChatGPT, а старый интернет стремительно пустеет.
Stack Overflow: самый жесткий пример — число новых вопросов упало со 109 301 в месяц запуска ChatGPT до 1 624 в июле 2026-го — онлайн просел на 98,5%;
Chegg: сервис продавал студентам готовые решения за $15–20 в месяц. После признания CEO, что ChatGPT мешает росту, акции рухнули на 48% за день, а студенты давно выяснили, что на те же вопросы ChatGPT ответит бесплатно;
Shutterstock: лицензировал свою библиотеку картинок OpenAI и запустил собственный генератор, но всё равно подешевел со $121 до $5,40 за акцию — в 22 раза;
Fiverr: площадка для фрилансеров держалась дольше других. Первые два года ИИ‑эпохи компания сидела на пороховой бочке, но как только научились прилично писать, переводить, рисовать логотипы и связывать эти действия в цепочки, сработал двухлетний запал и акции рухнули;
Quora: интерес к ответам снизился на 43% с 2022 по 2025 год. Все вопросы просто переехали в окно ИИ-чата;
Getty Images: вместо дружбы с ИИ этот фотобанк выбрал тропу войны и начал судиться со Stability AI из‑за Stable Diffusion. Как итог: сервис потеряла 98,6% стоимости с момента выхода на биржу.


У меня был iPhone и ноутбук на Windows, а хранилище Obsidian лежало в iCloud. Работаешь себе, всё нормально, и в какой-то момент заметка, которую ты правил, превращается в 10 копий с номерами в именах. Что-то потыкал, вроде исправилось. Несколько дней тишина, потом то же самое. А когда я наконец заглянул в служебную папку, там лежали сотни копий одного файла workspace.json: он размножался активнее всего, просто на глаза не попадался.
Кончилось тем, что я перешёл на технику Apple целиком. Я и так к этому шёл, но история с копиями решение заметно ускорила.
Из этого опыта я вынес мысль, вокруг которой построена вся статья. У синхронизации Obsidian нет одного правильного способа: то, что отлично работает у одного человека, у другого разваливается за неделю. Дальше разберу все рабочие варианты, покажу, от чего зависит выбор, и расскажу, что изменилось этим летом. Перемен хватило, чтобы популярные русскоязычные инструкции перестали работать.

Американское космическое агентство модифицировало все ноутбуки, предназначенные для использования на МКС, чтобы они имели одинаковый разъём питания. О подробностях этой модернизации рассказал инженер Джордж Рауш, который посетил Космический центр НАСА имени Джона Стенниса.

Представьте: вы с другом в детстве живете в разных домах, и окна ваших комнат выходят друг на друга. Вечером, когда вас зовут на ужин по домам, вы больше не можете общаться со своим другом, ведь ввиду возраста у вас еще нет телефонов (вот было время...). Зато родители подарили каждому из вас по фонарику.
Вы заранее договорились, что один клик фонариком — это привет, два клика — пока, да и вообще каждому количеству кликов можно придать свое значение. Например, моргаете 8 раз, и по вашей договоренности друг понимает, что вы предлагаете встретиться завтра во дворе в 8 утра. А как быть, если нужно передать сообщение, о котором вы заранее не договаривались?
Тут мы подбираемся к сути кодировки: кодирование — это есть замена одной единицы информации на другую, которая в данных условиях просто удобнее передается. Вы несете одинаковый смысл и когда говорите слово «привет», и когда мигаете фонариком один раз. Первое, что приходит в голову, когда нужно расширить ваши возможности общения, — это закодировать буквы по алфавиту, где А — 1 щелчок, а Я — 33 щелчка, и с помощью букв уже собирать любые слова. Но, конечно, не все так просто.

Посмотрев интервью Маска и выступления, обнаружил в нем одно интересное математическое противоречие, которое делает достижение сингулярности практически невозможным при условии, что люди будут вести себя хоть сколько-то рационально. Чтобы возникла экономико-технологическая сингулярность, люди должны инвестировать в нее. Но эти инвестиции не рациональны, и поэтому она не должна возникнуть.
Предлагаю ознакомиться с сутью этого парадокса.

Мощная и действительно "нано" по размерам – Nano Pi R3S. Это одна из крутых плат, которую можно купить по низкой цене и реализовать на ней много проектов - особенно если на ней стоит Docker!
Мне было интересно протестировать как там работает zapret и реализовать мою задумку с двумя сетями. Свободная и без блокировок сеть, которая еще и расширяет зону покрытия основной сети.
