Обновить
256K+

Математика *

Царица всех наук

363,57
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Решение задачи про козу, капусту и волка через конечный автомат

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.9K

Есть река и надо перевести на другой берег козу, капусту и волка. В лодку помещается только крестьянин и что-то одно из груза: капуста, волк или коза. Если на одном берегу без присмотра крестьянина оставить козу и капусту, то коза съест капусту. Если оставить волка и козу, то волк съест козу. Как перевести груз без потерь?

Я представил формальное решение на основе конечного автомата.

Читать далее

Новости

Дискретная диффузия: цепи Маркова с непрерывным временем

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели6.6K

Этот материал, задуманный как первый в серии статей о дискретных диффузионных моделях, уже несколько месяцев лежал у меня в черновиках. Выход модели Gemini Diffusion от Google показался мне отличным поводом наконец его опубликовать.

Цепи Маркова с дискретным временем — это последовательности случайных величин, в которых прошлое и будущее условно независимы при известном настоящем. Они достаточно хорошо известны в машинном обучении. А вот непрерывные аналоги этих цепей встречаются гораздо реже. Подобные модели фигурируют в исследованиях по дискретным диффузионным моделям (вот, вот и вот — далеко не полный список публикаций на эту тему). Поэтому мне показалось, что можно вернуться к блогу и написать о цепях Маркова с непрерывным временем, а может быть, и подготовить целый цикл публикаций. Пока же цель этого материала — сформировать у читателя интуитивное понимание того, как работают марковские цепи с непрерывным временем.

Читать далее

Flow Matching: обучение и дистилляция

Уровень сложностиСложный
Время на прочтение29 мин
Охват и читатели5.9K

Flow Matching — один из главных подходов к генерации изображений. Его используют, например, Stable Diffusion 3.5 и FLUX.2.

Но есть нюанс: чтобы сгенерировать одну картинку, модель приходится запускать десятки, а иногда и сотни раз.

В новой статье разбираемся, как устроен Flow Matching и как дистиллировать обученную модель в быстрый одношаговый генератор 🏎

Разберём, что такое Flow Matching и при чём здесь векторные поля 🌾, почему генерация требует множества шагов и чем это мешает, а также как устроена дистилляция в одношаговый генератор — и при чём тут игра двух моделей 🎲.

P. S. Будет много интуиции, математики и практических деталей обучения 🧠

Читать далее

Наш мир может быть продвинутой версией Game of Life, и через 10к лет на месте Луны и Земли будет мегаструктура

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.5K

В этой статье я хотел бы поговорить про мегаструктуры. Меня с детства безумно увлекал этот сеттинг, и когда я начал писать статьи для хабра, я хотел написать материал по этой теме, но долго не мог понять, как к ней подступиться.

Но кажется я придумал как. Предлагаю рассмотреть нашу вселенную (математически) как сложную хаотическую систему, которая при достаточном количестве времени начинает самопроизвольно порождать все более сложные структуры.

И мы, люди, являемся одним из этапов этого начавшегося самоусложнения материй. И мы можем находится у порога уже нового скачка, связанного с развитием техносферы.

Запустить технологическую сингулярность

Теория возможностей заменит теорию вероятностей в ML?

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели11K

Наньянский технологический университет предлагает альтернативу теорию вероятностей в ML - теорию возможностей. Разбираем, как это работает и какие результаты это даёт.

Читать далее

Информационный парадокс внутри чёрной дыры

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели14K

Итан Сигел (американский астрофизик‑теоретик и научный журналист, автор рубрики «Спросите Итана», один из пропагандистов современных научных знаний), разбирает один из нерешённых вопросов современной физики: куда девается информация о различных частицах, попадающих в чёрную дыру, при том что чёрная дыра испарится путём излучения Хокинга и исчезнет?

@avshkol перевёл эту статью, поскольку здесь Итан подробно разбирает проблему, и если вы только начинаете изучение всего, что связано с чёрными дырами и информацией, то эта статья будет прекрасным введением в предмет. И ещё Итан утверждает, что, несмотря на огромнейшее количество работ по этой теме, парадокс потери (или сохранения) информации в чёрной дыре пока не разрешён!..

Читать далее

Моя собственная Gated RNN: как работает? (и бенчмарки, конечно же)

Время на прочтение9 мин
Охват и читатели8.4K

Всем привет!

Не давно сделал свою Gated RNN, то есть с другой математикой, ни как у LSTM, GRU и подобного.

Я хочу (для вас) разобрать её теоретически, практически, замерить (я не умею замерять так что буду замерять как могу), ну и конечно же расскажу плюсы и минусы.

Читать далее

Рациональная параметризация, как метод устранения численных погрешностей при построении графиков

Время на прочтение3 мин
Охват и читатели8.6K

При построении графиков по математическим формулам, особенно если они заданы в полярных координатах или в параметрической форме в окрестностях некоторых точек они могут существенно искажаться. Обычно это происходит вблизи точки O с координатами 0;0, потому что ошибка округления в районе этой точки имеет такой же порядок или даже выше, что и значения функции. Но есть и вторая причина этого – для некоторых функций 0 является пограничной точки, то есть с одной стороны нуля, как правило, с положительной функция определена, а с другой, как правило отрицательной – неопределенна. Примером такой функции является квадратный корень.

В некоторых случаях это преодолевается с помощью математических выкладок...

Читать далее

AGI как когнитивная ОС: что если искать программы, а не веса

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели9.1K

Представьте, что вам передали на поддержку систему. Она работает — и работает блестяще: пишет код, переводит, рассуждает, шутит. Документации нет. Исходников нет. Есть бинарник на несколько сотен гигабайт и лог того, как его собирали. На вопрос «а как оно устроено внутри?» команда честно разводит руками.

Примерно так сегодня выглядят большие языковые модели. Мы научились компилировать интеллект из данных, но не научились писать — и даже толком читать — его исходный код.

Читать далее

Шри Янтра без погрешностей: что получается, если нарисовать её точно

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели7.2K

Шри Янтра — девять треугольников в круге, которые пересекаются так, что образуют 43 маленьких треугольника. Её часто называют самой сложной для построения фигурой индийской традиции, и на это есть причина: в правильной янтре в десятках мест три линии обязаны сходиться ровно в одну точку. Стоит сдвинуть одну линию на волосок, и точка распадается на крошечный лишний треугольник.

Мы решили разобраться всерьёз. Можно ли построить Шри Янтру абсолютно точно? Сколько таких фигур существует? И если их много, можно ли честно, без подгонки, выбрать среди них одну — «идеальную»?

Коротко: точных янтр бесконечно много, у них ровно четыре степени свободы. Единственной идеальной нет, но есть несколько естественных кандидатов, есть пара неожиданных теорем и есть внятный ответ на вопрос, почему идеальной нет.

Читать далее

Long Tanh: гибридная функция активации для глубоких сетей

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели8.3K

В статье я рассказываю о LTanh — функции активации, которая сохраняет форму Tanh, но решает проблему затухающего градиента. Показываю, как пришёл к формуле, вывожу производную и сравниваю её с Tanh в точках 0–5. В хвостах LTanh даёт в 150–850 000 раз больший градиент, оставаясь ограниченной и гладкой.

Читать далее

Корреляция и коинтеграция: математическая разница, которую важно понимать до построения стратегии

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.5K

Одна из частых ошибок при построении количественных стратегий — путать корреляцию и коинтеграцию. Кажется, если два ряда данных исторически двигались синхронно, то отклонение между ними — сигнал для действия. На практике эта логика подводит: высокая корреляция сама по себе не гарантирует возврата к среднему, а без этого возврата любая стратегия, построенная на отклонениях, не работает.

Читать далее

Наибольшее число, которое можно уместить в одном твите

Время на прочтение29 мин
Охват и читатели13K

Привет! Меня зовут Джоэл Дэвид Хэмкинс, и сегодня я хотел бы рассказать вам о парадоксе наибольшего числа, которое можно уместить в твите.

Конечно, теперь Twitter называется X, но я буду пользоваться старой терминологией и говорить о твитах, Twitter и так далее. Традиционное ограничение на длину твита составляет 280 символов. И, разумеется, в твите можно записывать числа. Например, можно просто заполнить весь твит цифрами. Допустим, я пишу твит - вот мой твит - и заполняю его цифрами: 28765 и так далее. Я могу заполнить весь твит цифрами и тем самым записать некоторое число. Какое наибольшее число можно записать таким способом?

Конечно, можно записать число гораздо больше. Вместо разных цифр можно использовать одни девятки и полностью заполнить ими твит. Тогда получится огромное число - на единицу меньше, чем 10^{280}. Но в твите можно задать числа гораздо большего размера. Например, вместо того чтобы выписывать само число, можно привести его описание. Я мог бы написать «один центиллион», а центиллион - это 10^{303}. Это число гораздо больше того, которое получится, если заполнить весь твит цифрами 9. Итак, мы уже нашли число побольше. Но какое самое большое число вообще можно уместить в твите?

Читать далее

Ближайшие события

Пересекающиеся эксперименты: как мы навели порядок в A/B-тестах

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели5K

Привет! Меня зовут Кирилл Кочнев, я руковожу продуктовой аналитикой в hh.ru и веду «Статзначимый подкаст». Каждый месяц мы в компании запускаем больше сотни A/B-экспериментов, и со временем тесты начали пересекаться: разные команды одновременно меняли связанные части пользовательских сценариев, из-за чего результаты искажались. 

В этой статье расскажу, как мы подошли к управлению пересекающимися экспериментами: выстроили процесс согласования между командами и бизнес-владельцами, доработали платформу A/B-тестов и превратили это не только в техническое изменение, но и в способ развивать культуру планирования экспериментов.

Читать далее

Один шар на бильярдном столе теоретически способен выполнить любое вычисление

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели19K

Трудно представить себе физическую систему проще бильярдного стола. Пустите шар по столу, и его движение будет подчиняться простому правилу: он движется по прямой, пока не ударится о борт, после чего отскочит от него под тем же углом, под каким приблизился. И всё же даже такая простая система — по крайней мере теоретически — способна воспроизвести любое вычисление, доступное гораздо более сложному компьютеру.

Как показали математики Ева Миранда из Политехнического университета Каталонии в Испании и Исаак Рамос из Швейцарской высшей технической школы Цюриха, один шар, отскакивающий от стенок двумерного «бильярда» особой формы, может имитировать универсальную машину Тьюринга — такую, которая способна моделировать любую другую машину Тьюринга.

Для Миранды эта работа стала итогом многолетних попыток свести механическую систему к минимальному числу деталей, необходимому ей для работы в качестве компьютера. «Каков минимальный геометрический механизм, позволяющий физической системе выполнять универсальные вычисления, и как мы можем его обнаружить? — спрашивает она. — Бильярд представляет собой самую суровую проверку такого процесса упрощения. Одна‑единственная частица. Вся программа записана в геометрии границы».

Машина Тьюринга — это не машина в привычном смысле слова. Это математическая модель вычислений, предложенная британским математиком Аланом Тьюрингом в 1936 году. В простейшем виде она состоит из воображаемой ленты, разделённой на ячейки, головки, которая может считывать и записывать символы на этой ленте, и набора инструкций, определяющих её последующие действия. Каждая отдельная операция предельно проста: прочитать символ, записать символ, переместиться вдоль ленты и повторить всё снова.

Читать далее

Мечтает ли трехмерный андроид о четырехмерных овцах?

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели12K

Компьютер является математической структурой, отлитой в кремний. И фактически с ним можно взаимодействовать так же, как с любым другим математическим обьектом.

Чтобы лучше раскрыть эту мысль, мы разберем компьютер сначала как математическую абстракцию, а потом реализуем его в двумерном, трехмерном и четырехмерном измерений, и напишем для них инструкции.

Да. Через формулы

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Время на прочтение17 мин
Охват и читатели12K

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.

Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением пропускной способности и минимизацией задержек. Два этих показателя необходимо оптимизировать в рамках ограничений, задаваемых тремя принципиальными факторами: вычислительные (скорость аппаратных операций и поддерживаемые типы), память (ёмкость и иерархия) и коммуникация (ширина передачи данных в памяти и сети, задержка и иерархия). Эти концепции отлично рассмотрены в книге Scaling Book от Google, а именно в разделе Roofline.

Читать далее

Интеграл Гаусса + необычная его аппроксимация

Время на прочтение2 мин
Охват и читатели8.2K

Показано, как из классического вычисления интеграла Гаусса-Пуассона получается еще одна аппроксимирующая формула для этого интеграла

Читать далее

ИИ-дилемма: рост против риска для человечества. Разбираем этически неоднозначную статью экономиста Чарльза Джонса

Уровень сложностиСредний
Время на прочтение49 мин
Охват и читатели12K

Публикуется полный перевод статьи The AI Dilemma: Growth versus Existential Risk, опубликованной в 2024 году за авторством Чарльза Джонса (Charles I. Jones).

Эта статья ставит непростой этический вопрос: можем ли мы обменять ускоренный экономический рост и (возможное) увеличение продолжительности жизни, которое нам сулит повсеместное внедрение ИИ и рост самого ИИ до (предполагаемого) суперинтеллекта, на риски, связанные с полным уничтожением человечества как вида? В статье предлагается математическая модель, включающая параметры ускорения экономического роста, увеличения продолжительности жизни и риск уничтожения человечества сверхсильным ИИ. Этически неоднозначной статью делает утверждение, что существует и может быть теоретически оценен уровень риска для человечества, который "допускается принять" в обмен на ускорение экономического роста и увеличение средней продолжительности жизни...

Кроме того, текст и формулы снабжены комментариями @avshkol для помощи в понимании формул и части сложных мест работы, а также критическими комментариями @avshkol там, где предположения и выводы, сделанные в модели, заслуживают критики или иного взгляда (см. заключительный комментарий).

Читать далее

Одинаковые данные, разные p‑value: почему важно правило остановки

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Почему одинаковые данные могут давать разные p-value? На простом примере с монетой разбираю, как правило остановки меняет частотный вывод, а затем связываю это с подглядыванием в A/B-тесты и повторными проверками значимости. Заодно становится понятнее, что именно ломается при peeking и почему проблема не в самом просмотре данных, а в том, как промежуточные результаты влияют на решение остановить эксперимент.

Подсмотреть
1
23 ...