Обновить
256K+

Математика *

Царица всех наук

241,58
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Проверка теории улучшения результата LoRA файн‑тюнинга на «умных» слоях

Уровень сложностиСложный
Время на прочтение21 мин
Охват и читатели3.7K

При LoRA‑дообучении адаптеры обычно применяются ко всем слоям модели, хотя активность разных слоев во время обработки промпта заметно различается. Возникает вопрос: можно ли выбрать более «умные», активные слои для конкретной темы и получить прирост качества?

Проверил гипотезу на Qwen3-1.7B: воспроизвёл метод из статьи Act‑LoRA, добавил свою метрику по градиентам, статистически проверил устойчивость сигнала и получил результат, который многое объясняет о том, как на самом деле работает LoRA‑дообучение.

Читать далее

Новости

6 новых методов обучения нейросетей, которые придуманы тысячелетия назад

Время на прочтение16 мин
Охват и читатели4.7K

Нейросетям в современном виде — несколько десятилетий. А вопросом «как вообще возникает знание?» люди занимаются больше двух тысяч лет. Значит, рассуждал я, где-то между Платоном, Аристотелем, Пирсом, Гегелем и Кантом наверняка лежит забытый метод обучения. Осталось перевести его с философского на PyTorch, вызвать backward().

План был отличный. Я взял список методов машинного обучения, наложил его на философские теории познания и сначала получил двенадцать «неиспользованных» идей. Потом начал проверять литературу — и половина списка исчезла.

Абдукция Пирса уже живёт в Abductive Learning и нейросимвольных системах. Скептическое воздержание от суждения называется selective prediction. Воплощённое познание ездит по лабораториям в роботах. Телеология устроилась в goal-conditioned reinforcement learning. Даже диалектика уже добралась до отдельных алгоритмических работ.

То есть бесплатной оптимизации у Платона не нашлось, а то что нашлось я упаковал здесь.

Зато обнаружилось кое-что полезнее: философия чаще даёт машинному обучению не готовые алгоритмы, а постановки задач. «Что значит знать пределы своего знания?», «как понять часть через целое?», «как сохранить оба полюса противоречия?», «что останется, если временно отключить привычную предпосылку?» — это уже почти техническое задание. Не хватает состояния, оператора, функции потерь и эксперимента, в котором идея может проиграть.

В этой статье я разделю философские аналогии на три класса, затем разберу шесть механизмов, которые всё ещё формализованы лишь частично, и покажу объединённый PyTorch-модуль. В отличие от первой версии, здесь есть не только формулы и тесты, но и два воспроизводимых синтетических эксперимента.

Читать далее

Почему реки так математичны?

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели6.9K

Реки, как и все «транспортные сети», следуют математической структуре, из‑за которой они так похожи на фракталы.

Моё сердце принадлежит реке. Не суровой чёрной Темзе, извивающейся через Лондон, где я родилась, а ленивой зелёной реке в 10 000 км отсюда — там, где я провела свою юность: реке Бланко в Техасе. Мои предки по материнской линии купались в её водах на протяжении многих поколений, как и я в бесчисленные летние дни.

Бланко — приток реки Сан‑Маркос, которая впадает в реку Гуадалупе, а та, в свою очередь, — в Мексиканский залив. Вы, наверное, можете представить, как это выглядит на карте, ведь все речные сети похожи друг на друга: они ползут по ландшафту, сливаются во всё более широкие и длинные русла, спускаясь вниз к морю. Эта схема напоминает веточки, соединяющиеся со стволами деревьев (а также разветвления их корневых систем), и точно так же напоминает жилки на листьях растений, нашу собственную систему кровеносных сосудов, а также сети железных дорог и автомагистралей, ведущих в города.

В этом повсеместно встречающемся узоре есть что‑то притягательное, настолько притягательное для меня лично, что я сделала себе татуировку на предплечье: силуэт дерева с безлистными ветвями, устремлёнными вверх, и корнями, уходящими вглубь, словно зеркальное отражение. «Формы рек, сосудистая система листьев и так далее — разветвлённые сети — вы можете более или менее уловить закономерность, но она по‑прежнему хаотична, и в этом есть что‑то завораживающее», — сказал Крис Паола, специалист по рекам из Университета Миннесоты.

Читать далее

Проблема общего знания. Часть 1

Время на прочтение11 мин
Охват и читатели8.5K

Три логика заходят в «Бар логики».

Официант: Вы все хотите пива?

Первый логик: Я не знаю.

Второй логик: Я не знаю.

Третий логик: Да.

Уморительно! … Вы поняли шутку?

Объяснять шутки, конечно, редко бывает смешно, но все же позвольте мне это сделать. Вся соль шутки заключается в эпистемической логике - логике знания. Дело в том, что официант спросил, хотят ли пива все трое. Поэтому логики отвечали не только за себя, но и исходя из того, что им было известно о желании остальных выпить пива. Поскольку первый логик ответил: «Я не знаю», он, очевидно, сам хотел пива, но не знал, хотят ли его все остальные. Если бы он сам не хотел пива, то просто ответил бы «нет», поскольку тогда он знала бы, что пива хотят не все. Но ответить «да» лишь потому, что он сам хотел пива, тоже было бы неправильно: он ничего не знал о желаниях остальных, а вопрос состоял в том, хотят ли пива все.

Аналогичным образом мы можем заключить, что второй логик тоже хочет пива, поскольку в противном случае он ответил бы «нет». Однако он не знает, хочет ли пива третий логик. Наконец, третий логик, рассуждая точно так же, как только что рассуждали мы, понимает, что первые двое хотят пива. А поскольку он, очевидно, и сам хочет пива, то отвечает: «Да», ведь теперь он знает, что пива хотят все трое.

В этой главе мы рассмотрим целую серию занимательных задач по эпистемической логике, многие из которых приведут нас к более глубоким и серьезным вопросам этой области.

Читать далее

Соревнование замерло 16 августа, а таблица поехала дальше. Разбираю, что из этого настоящее

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.5K

Я полез в данные соревнования Pokemon TCG AI Battle посмотреть, кто там выигрывает, и залип на другом. На публичной таблице 6806 команд. Самая поздняя отправка решения датирована 16 августа, 23:58:53. После этой секунды не отправил никто

1668 команд из 6806, почти четверть поля, сделали финальную отправку именно в этот день: 824 из них после шести вечера, 350 в последний час. Похоже, немалая часть узнала про срок в тот же день, когда он истекал

Читать далее

ИИ поступает в ШАД в 2026

Время на прочтение5 мин
Охват и читатели5.8K

Автор: Лыков А., к.ф.-м.н., академический руководитель Школы Высшей Математики и ШАДХелпера.

В статье смотрим, как большие языковые модели справляются с задачами первого этапа вступительного экзамена в ШАД 2026 года.

В прошлой статье мы разбирали вступительную кампанию ШАД-2026 и показали, что ИИ проходит второй этап. Теперь берём все 40 задач первого этапа во всех четырёх вариантах (A, B, C, D) и тестируем пять моделей: Claude Opus 4.8, DeepSeek-R1-0528, ChatGPT Sol, Qwen3.7-Max и GigaChat-3-Ultra.

Сразу скажем результат: Claude Opus 4.8 набрал 39,5 балла из 40, DeepSeek-R1-0528 — 38,25, ChatGPT Sol — 37,75, Qwen3.7-Max — 32,5. При проходном балле около 30 все зарубежные модели прошли бы первый этап, а GigaChat с 25,25 — нет. Отдельная история вышла с Gemini 3.1 Pro: его пришлось дисквалифицировать за списывание — но виновата тут наша методика, а не модель. Разбираем, кто на чём ошибался, сколько это стоило по времени и деньгам, и что всё это значит для онлайн-экзаменов.

Читать далее

Как одноклеточный слизевик спроектировал токийское метро

Время на прочтение4 мин
Охват и читатели6.7K

В 2010 году исследователи из Хоккайдского университета поставили чашку Петри. На дно налили влажный агар, разложили 36 овсяных хлопьев в точках, соответствующих крупнейшим городам вокруг Токио, а кусочек слизевика поместили в центр — в точку, соответствующую Токио. Участки, соответствующие горам и водоёмам, засветили лампой — физарум избегает яркого света и сам обходил эти зоны, воспроизводя реальные географические ограничения при прокладке железных дорог.

Через 26 часов посмотрели что получилось.

Сеть из протоплазматических трубок, которую вырастил слизевик, воспроизводила топологию реальной железнодорожной сети токийской агломерации. Узел за узлом. Причём не просто воспроизводила — по трём инженерным критериям одновременно: стоимости (суммарная длина трубок), транспортной эффективности (среднее время пути между узлами) и устойчивости (сколько соединений можно убрать, прежде чем сеть развалится).

Читать далее

Слепой поиск новых частиц (и не только частиц): что мы построили и что из этого получилось

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.7K

Мы построили систему, которая умеет честно останавливаться, когда не может довести гипотезу до конца.

Слепой отбор координаты в пространстве представлений SU(3)×SU(2)×U(1), группа гейтов на аномалии/унитарность/UV-завершение, и правило «нельзя ранжировать меньше пяти механистически разных гипотез». По пути — не только результаты, но и честные признания: семь «исследовательских кандидатов» оказались вручную закодированы, а не выбраны вслепую (поймали аудитом кода); клетка с представлением размерности 1518 упёрлась в UV-стену и получила BLOCKED вместо выдуманного числа; найден баг, который ложно добавлял канал распада по совпадению подстроки.

Два кандидата дошли до настоящих d=7 операторов и первой условной зоны исключения по данным CMS. Для одного из них не хватает ровно одной вещи — специалиста, который умеет собирать UFO-модели для цветовых секстетов.

Архитектура при этом не заточена под физику частиц — на ней же стоят глобальный фит нейтринных экспериментов (DayaBay, KATRIN, T2K) и модуль аэроупругости с реальными данными DLR.

Подробности, формулы и вся цепочка проверок — в статье.

Читать далее

Проблему репетиторства сформулировали в 1984 году. Ответа до сих пор нет

Время на прочтение11 мин
Охват и читатели83K

В 1984 году Бенджамин Блум доказал: ученик, занимающийся с репетитором один на один, обходит 98% обычного класса. Казалось бы, вывод очевиден. Но сам Блум написал, что это слишком дорого для общества, и поставил вопрос — чем заменить. Рассказываю, как мы отказались от занятий один на один, посадили 12 человек на одного преподавателя и почему это дало результат лучше, чем мини-группы.

Читать далее

Claude Code Antifraud, часть 2: крысы‑биссектрисы и обезьяны‑медианы на детской математической олимпиаде

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели7.2K

В прошлой серии знакомый принёс мне импортное за триста и попросил посмотреть результаты московской олимпиады по геометрии. Пока публиковал статью, пришёл второй заказ. В этот раз питерская олимпиада для 4–11 классов: 6 сезонов, 40+ площадок проведения, устный формат. Устный — это когда участник рассказывает решение, жюри кивает или не кивает, черновиков нет, перепроверить нельзя.

И снова импортное за триста. Что ж, триста так триста. Погнали.

Читать далее

Многомировая природа контингентности, или как выйти из корреляционного круга и не уничтожить физику

Уровень сложностиСредний
Время на прочтение54 мин
Охват и читатели7.1K

Поздравляю всех, кто ещё жив и в состоянии меня читать – с момента публикации моей предыдущей статьи прошло больше месяца, а законы физики за это время так и не изменились! Если вы не удивлены, то зря, ведь в условиях Гиперхаоса им следовало бы меняться намного чаще. Конечно, всегда можно прибегнуть к дежурной фразе «если угодно будет Господу и живы будем», но в наши дни она уже мало кого удовлетворяет. Так что нам придётся искать объяснение, почему законы физики стабильны. Мы возьмём за основу спекулятивный материализм Мейясу, проведём его критическую деконструкцию, рассмотрим альтернативные представления о контингентности (возможности всего быть другим) и поможем Мейясу доказать способность математики обеспечивать доступ не только к Абсолюту, но и к частным свойствам контингентного мира, объективным по отношению к наблюдателю.

Как же сохранить рассудок в мире, где всё может радикально измениться в любой момент? Сможем ли мы доказать, что логическая аргументация и критическое мышление имеют преимущество над слепой верой, а учебники, научные статьи и диссертации являются более надёжным источником знаний, чем религиозные откровения или бред сумасшедших? Математика – объективное знание об отношениях между абстрактными объектами или социальный конструкт? Даёт ли она возможность, по выражению Гегеля, «зайти сзади», чтобы «застигнуть врасплох» пресловутую кантовскую «вещь» и узнать, какова она «в себе», а не «для нас»? Применима ли теория вероятности к такому событию, как изменение законов физики? Почему мир кажется таким устойчивым, если у него нет достаточного основания не быть другим? Давайте попробуем ответить на эти вопросы и понять хоть что-то, прежде чем исчезнуть в пучине Гиперхаоса.

Читать далее

DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее?

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.3K

Привет, Хабр! Давайте на примере кейса с рекламой в ПВЗ Wildberries разберемся в двойном машинном обучении (DML) и методе псевдорандомизации (PSM). Вы в деле?

Меня зовут Платон Попов, я дата-аналитик в команде A/B-платформы RWB. В нашей команде я занимаюсь задачами из области причинно-следственного анализа (Causal Inference) и методами понижения дисперсии. 

В этой статье расскажу о самом кейсе и объясню, почему для него не подошёл классический t-тест. Покажу, как мы учитывали спутывающие факторы с помощью Propensity Score Matching (PSM), почему этого оказалось недостаточно и почему в итоге перешли к Double Machine Learning (DML). В конце сравним результаты и обсудим наш план выкатки метода оценки нерандомизированных экспериментов в промышленный масштаб.

Читать далее

Что общего у Эйлера, воздушных шариков и одной из самых сложных задач информатики?

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели8.5K

Оказывается, из обычного длинного воздушного шарика можно сделать не только собачку, но и вполне серьезный математический объект. Исследователи Эрик Демейн, Мартин Демейн и Ви Харт предложили целую теорию вычислительного моделирования фигур из воздушных шаров. Их идея проста: представить скрученную фигуру как граф.

Читать далее

Ближайшие события

Известное исследование содержит ошибку: Вселенная не является анизотропной

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели8K

Итан Сигел (американский астрофизик-теоретик и научный журналист, автор рубрики "Спросите Итана", один из пропагандистов современных научных знаний), опровергает недавнюю научную сенсацию (публикацию в журнале Nature от 24 июня 2026), заявляя, что обнаруженная анизотропия Вселенной является ошибкой в обработке данных.

Это довольно серьёзная точка разногласий в современных взглядах на Вселенную: ведь если она не изотропна во всех направлениях (анизотропна), то это открывает возможность для выдвижения массы теорий, противоречащих современному астрофизическому мейнстриму. @avshkol перевёл этот текст Итана, как возможность донести точку зрения, противоположную громким заголовкам в интернет-статьях...

Читать далее

Гидродинамика на python: Пишем CFD симуляцию плоского течения несжимаемой жидкости

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9.3K

В этой статье мы решим классическую задачу из курса гидродинамики [4]: сделаем симуляцию плоского течения в канале. Для этого мы напишем на Python код, численно решающий систему дифференциальных уравнений в частых производных, описывающих поведение несжимаемой жидкости:

Читать далее

Скептик выбрал гипотезу, которую ИИ не решит. Grok ее решил

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.1K

Математик Паата Иванишвили из Калифорнийского университета в Ирвайне сообщил, что Grok 4.6 в обвязке Grok Build (аналог Claude Code от SpaceXAI) доказал гипотезу Холмса, Холройда и Рамиреса, которую Иванишвили окрестил "Greedy is least speedy" ("жадный — самый медленный"). Модель доказала более сильную комбинаторную Гипотезу 5 из той же статьи — а из нее основное утверждение следует автоматически. Результат оформлен в короткую заметку, соавтором которой стал Шэнтун Чжан из Стэнфорда.

Читать далее

Программу, по которой я учился в началке, просто вычеркнули

Время на прочтение9 мин
Охват и читатели6.1K

Учебник математики, по которому учились поколения детей, не прошёл экспертизу с формулировкой: содержание не способствует формированию патриотических чувств, поскольку в книге присутствуют «гномы, эльфы, факиры со змеями, три поросёнка». Это не анекдот, а заключение 2014 года. Рассказываю, как разобрали образовательную систему, по которой я сам учился в начальной школе.

Читать далее

Таинственный остров: находим геолокацию с помощью геометрии и программирования GPU CUDA

Время на прочтение10 мин
Охват и читатели8.8K

Свой пост я написал после участия в соревнованиях gralhix 004, организованных Софией Сантос | Gralhix.

Задача

Это фотография островного курорта.

Вопросы:

а) Как называется курорт?

б) Каковы координаты острова?

в) В какую сторону света была направлена камера, когда делали снимок?

На мой взгляд, решение этой задачи при помощи Google Объектива будет потраченной впустую возможности развлечься, поэтому я захотел решить её при помощи математики и программирования.

Читать далее

Путь программиста компьютерной графики

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели6K

Классическое академическое образование порой бывает очень сложным, рутинным и непонятным. Достаточно только заболеть на пару дней, и ты уже в поте лица пытаешься наверстать упущенные знания по матану где-то на mathprofi.ru

Согласно исследованию НИУ ВШЭ «От совмещения учебы с работой к совмещению работы с учебой» (К. В. Рожкова, С. Ю. Рощин, П. В. Травкин, «Вопросы образования», 2024, № 2), около 53% студентов очной формы обучения работали хотя бы один месяц за время учебы в вузе. На первом курсе бакалавриата работают около 18% студентов, к выпускному курсу доля вырастает до 35% у бакалавров и до 40% у специалистов. Чаще других учебу с работой совмещают студенты направления «Математика и компьютерные науки» — 58%; авторы связывают это с широкими возможностями удаленной занятости для тех, у кого есть цифровые компетенции. На мой взгляд, отсюда следует и рост потребности в самостоятельном обучении, а оно требует структурированного подхода и проверенных материалов. Это уже не говоря о тех, кто пытается не забывать о личной жизни: спорт, студенческий актив, личные интересы и другое.

Также, на мой взгляд, имеет место проблема конспектирования лекции в реальном времени. Не всегда удается одновременно усваивать слова лектора и записывать.

Таким образом, этой статьей я хочу предоставить доступ к удобному и систематизированному набору академических знаний. Этот roadmap в мир КГ является дополнением к академическому образованию, он поможет облегчить учебу в университете: лучше понимать структуру и дать ссылки на материалы. К нему нужно относиться как к вспомогательному инструменту в обучении

В путь

Математики до сих пор не уверены, как быстрее всего перемножать числа

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели29K

Ученики начальной школы могут заучивать таблицу умножения однозначных чисел, но простого запоминания будет недостаточно, когда учитель задаст задачу на умножение трёхзначных чисел. Здесь требуется алгоритм: учеников учат выстраивать числа друг над другом и умножать каждую цифру нижнего числа на каждую цифру верхнего. На протяжении тысячелетий математики считали это самым быстрым способом умножения, пока в 1960 году 23-летний молодой человек не сделал шокирующее открытие, которое привело к загадке, остающейся неразгаданной до сих пор.

Эта загадка имеет решающее значение для всех, кто имеет отношение к цифровому миру, поскольку умножение является основополагающей операцией для компьютеров. Шифрование, робототехника, искусственный интеллект, обработка звука и практически всё остальное, чем мы заставляем заниматься кремниевые чипы, связано с умножением, причём иногда огромных чисел, умножаемых многократно. В таких масштабах даже простая операция становится «узким местом», и любое дополнительное повышение эффективности имеет глобальные экономические последствия.

Чтобы понять суть этого «узкого места», обратите внимание на то, как «школьный» алгоритм справляется с увеличением размера чисел. При умножении двух двузначных чисел выполняется четыре однозначных умножения. Если перейти к паре трёхзначных чисел, то потребуется девять однозначных умножений. Нагрузка растёт пропорционально квадрату количества разрядов (n², где n — количество разрядов в умножаемых числах). При анализе подобного алгоритма компьютерные учёные не измеряют скорость в секундах, поскольку она зависит от аппаратного обеспечения. Вместо этого они подсчитывают количество вычислительных шагов. Они также игнорируют второстепенные детали, такие как время, необходимое для переноса единицы при умножении. Когда числа становятся достаточно большими, эти низкоуровневые операции перестают иметь значение, поскольку их полностью затмевают более ресурсоёмкие операции. Информатики обозначают количество шагов с помощью так называемой нотации «большого O»: например, алгоритм, который учат в начальной школе, требует O(n²) шагов, что читается как «порядка n в квадрате». В общих чертах, если числа в два раза длиннее, для выполнения алгоритма требуется в четыре раза больше вычислительной работы. Если числа в тысячу раз длиннее, требуется в миллион (1 000 в квадрате) раз больше работы.

Читать далее
1
23 ...