Pull to refresh

Comments 17

Первое впечатление. Зашел по ссылке в тг бот, при нажатии /start получил сообщение "Доступ закрыт. Попроси администратора добавить тебя", на этом этапе отсеются 8 из 10 попытавшихся попробовать :) просто потому что неизвестно где этот администратор, кому писать, что делать и т.п. Хоть в описание бота добавьте контакты админа =) Ну ок, я решил потестить, поэтому не поленился и написал тут, а обычному пользователю как?:)

О, как, спасибо за баг. Не, это точно просто баг, с тестовой версии приехало. И большая часть людей все-таки в веб приходит. Для меня бот прям сильно не основная штука, т.к. неудобно лично самому такой формат. Веб интерактивный, с уроками и реалтайм голосом, а чат - это я уже видел в других местах, мне не зашел формат

Аппку в итоге запустил, на старте предлагает отметить слова, которые точно понимаешь.

В списке слов есть несуществующие, это может и будет искажать смысл опроса, потому что люди будут сомневаться. Например слово abulled - это что? Ни моя память ни гугление ни шуршание словарем не сумели помочь, оно выдуманное что-ли?:) Ну имя есть арабское такое, но причем тут английский язык?)) Может нейросетка сгаллюцинировала и это должно было быть annulled? Тоже самое с proute, reful, symping (ну ок это дико сленгово и даже на urbandictionary идут споры имеет ли оно место быть или это просто кривое произношение simping)? Sarate - это что за чудо? Есть даже вариант слова "iii". Ну то есть я сомневаюсь что набор несуществующих слов поможет как-то определить моё знание английского.

Да, это как раз специальная механика, которую я нашел в научной статье по изучению языков - 20% слов ненастоящие. Генерировал их цепями маркова, потом еще Sonnet отсеивал "похожее на слова". Идея в том, что правильные слова добавляют уверенности в оценку, а ненастоящие - убавляют. В результате, если отметить все, то оценка будет "0 слов", что как будто бы и правильная при попытке затыкать все.

Вот сама статья - https://link.springer.com/article/10.3758/s13428-011-0146-0

Там конечно больше охват и как-то они постарались соединить модельные наборы с реальными, но в целом результаты кажутся довольно здоровыми.

По итогу выдало мне С2 с парой ошибок при проверке, с которыми я не особо согласен, ну да ладно, потом дальше покручу=)

И вот тут у меня тоже начинаются проблемы. Как будто грамматику +- я понимаю и уж "выбери из 3х вариантов" получаются, вон тот же EF тоже C2 выдает. Но это ж неправильно. Учителя живые на первом занятии просто говорят "давай, поговори там чего-нибудь". Но я боюсь такое сразу людей отпугнет, потому, что меня такое в других продуктах удивило и я продолжать не стал. А самая главная проблема потом начинается - оно же считает, что все, C2, и это подается на вход LLM, типа "не стесняйся в выражениях, там нормально все" и получаются грамматические монстры, которые мне вообще не понятны

Сейчас пришла идея, что может нужно динамическую переоценку проводить, на основании ошибок? Я же все равно всю историю собираю и по грамматике и по словам. Только как потом пользователю сказать, что мы как будто бы немного ошиблись и у него не C2, а очень даже B1 😣

Это можно сделать ненавязчиво и незаметно. Просто добавлять в изучаемые слова что-то уровня ниже и если пользователь их не тыкает "Знаю - больше не показывать" - просто понизить уровень знания, не говоря ему об этом.

Не говорить вроде как-то неправильно, но можно предупредить, что будет переоценка и показывать ее в настройках просто. Что бы потом и пользователь мог сказать "а вот и не угадали" и вернуть обратно. Основная то идея уровня в том, что задания генерируются под уровень, а не слова. Слова нужны, конечно, но в целом нет такой штуки как "слова уровня B2" - это скорее предположение, что 80%, у кого уровень близок к этому столкнулись и знают. Но у меня 4 датасета с разных источников и в них процентов 30 расхождений по оценке уровня слов, поэтому на одном словаре наверное не стоит основываться. На словаре и грамматике вполне можно, наверное

Я не маркетолог, но проверку уровня языка я бы положил ДО входа и создания аккаунта.

Вот над этим я тоже думал, но очень уж я часто сталкиваюсь с волшебными решениями, где проходишь какой-нибудь опрос, тратишь время, а они потом тебе "а давай-ка ты сразу подписочку оформишь". А я вроде как и не хочу никому подписочку лишнюю предлагать. Хочу добро людям нести. Основная цель такая была - принести чего-нибудь полезное, потому что мне лично было полезно грамматический тренер. Вообще очень по-дурацки получается, EF грамматика C2, а открываю уроки 1.1/1.2 и половина неправильно говорю в реалтайм. В сущности идея была сделать этакий грамматический решебник, но без идей "3 примера на правило" и вообще без "вставь в пропуск" в идеале (от B1 дефолтный режим ставится "полный перевод"). Потому, что вставь пропуск - это то же самое, что и выбрать из 3х вариантов - не помогает запомнить. Но для A2 понятно, что полностью перевод сразу тяжело сделать, особенно голосом в реалтайм

это мой пет-проект, который я более или менее довёл до состояния «можно показывать людям»

Очень неплохо, как по уровню реализации. Вопрос, как всегда, в подобных случаях, а устраивает ли, лично меня, используемый подход?

Понятно, что мнением одного пользователя всегда можно пренебречь. Однако, концепция обучения «говорению» на иностранном, при этом, никуда не денется. Наверное, эта тема будет вечной, как и любовь.

Я тоже иногда размышляю о «вечном», но, все известные мне подходы, мне не нравятся. Для себя, я определяю решение в наличии «правильных» текстов. Под которыми, я понимаю последовательности независимых, грамматически однородных фраз, с постепенно нарастающей сложностью. Другими словами, грамматика и словарный запас должны быть «вшиты» в простые слова и фразы, т.е., осваиваться в контексте.

Например, сначала идут, допустим, фразы, типа: «Я что-то делаю», «Он что-то делает», …, «Они что-то делают». Потом, тоже самое, в простом прошедшем и будущем времени. Затем, в сослагательном наклонении и т.д. и т.п. Помимо акций, должны также осваиваться описания свойств и состояний, вроде: «Мы – лучшие!», «Он – гений!», или там, «Штирлиц – насторожился!», «Я хочу / могу / надеюсь чего-то там или на что-то». Ну, думаю, идея понятна. При этом предложения в нашем «фразебуке» должны быть, начиная от одного-двух слов до трех-пяти, максимум, на первом этапе. Длинные предложения, затем, строим через композицию коротких.

Вот именно с этими «последовательностями независимых, грамматически однородных фраз, с постепенно нарастающей сложностью» и должен иметь пользователь.

Это напоминает достаточно популярные и широко используемые русско-иностранные и иностранно-русские разговорники. Только, имеет смысл объединить озвучку, хотя бы TTS-ную, с текстом. Тем самым мы получаем уроки в видео-формате. Для интерактивной работы используем соответствующие обучающие программы.

Например, я никогда ранее не изучал немецкий язык, но решил попробовать сделать первые уроки в формате немецко-русского (или наоборот) видео-разговорника. Потом эти данные конвертировать в формат Sqlite, для моей обучающей программы «L’école». Примеры обучающих видео с двуязычными субтитрами можно посмотреть на моих каналах (более подробную информацию можно найти в моем профиле).

Да, имеющийся у меня текст немецкого разговорника неплохой, хотя и не идеальный, по моим меркам, но, хорошего текста нет нигде, а чтобы генерировать его самому либо на пару с ИИ-ями, нужно уже иметь соответствующий уровень.

Короче говоря, главное, при изучении языка, это хороший текст, на языке оригинала. «Всё остальное можно купить за деньги!», то бишь, получить, используя бесплатные ИИ-сервисы, не говоря уже о платных.

Вот как раз встраивание изучаемых слов (с приоритетом тех, которые плохо запоминаются) это и было первым реализовано и это довольно легко. И работает в целом неплохо - в тренажере и в ролевых и в обсуждении новостей может подсунуть, но без фанатизма (в зависимости от уровня изученных слов эффективность разная, конечно).

Но вот эта вечная идея прогрессивного обучения спотыкается о то, что нужно как-то оценить, куда пользователь движется и как у него в мозгу это укладывается. То есть как-то почитать его мысли и узнать его лучше, чем он знает себя сам. Даже учителя не все с этим справляются, не то, что ИИ, к сожалению. И мы не скоро достигнем состояния, когда можно будет хотя бы "уверенность" в ответе измерить каким-то разумным способом, чтобы от него модель считать. Всякие измерения кожного сопротивления не в счет - не каждый ученик будет учить английский в детекторе лжи 😅

Мне кажется как раз программа важна. Путь, по которому пользователя можно или быстро протащить или задержать где, в зависимости от сложности (мне раньше нравилась подача ютубера CGPGray - у него адаптивная скорость подачи в зависимости от важности была очень хорошо настроена. Вот такую бы и мне в тренажер).

Программы во всяких duolingo настроены на наборы фраз и фактически "программой изучения" языка то и не являются, как не является программой любой карманный разговорник. А хочется системность, а не разговорник для туристов. И насчет бесплатных ИИ не вполне согласен. Я пробовал с чатами это делать - набор заданий сделать можно, но это разовая акция, без оценки, без реалтайма, без произношения, в общем сделай и оцени сам. Тоже не мой случай.

нужно как-то оценить, куда пользователь движется и как у него в мозгу это укладывается

В моей программе есть режим «Экзамен», там можно проверить уровень запомненных слов и фраз (путем выбора правильного варианта из неправильных либо отказаться от выбора, чтобы система сделала подсказку – этот вариант нужен для того, чтобы не портить себе статистику, за счет удлинения времени «экзамена»). Проверять можно в двух направлениях: оригинал – перевод и перевод- оригинал.

Всякие измерения кожного сопротивления не в счет - не каждый ученик будет учить английский в детекторе лжи

Ну, если мы учим язык не для «дяди», а для себя, то это, скорее всего, не понадобится. Мне лично достаточно одного понимания устной речи, а для письменного общения можно использовать онлайн-переводчики. Устное общение у меня было, когда-то, с одним американцем, который приезжал в наш город, и которому нужно было помочь с временным обустройством. Там, где я не понимал его, просил писать на бумаге. Письменная речь у меня была явно лучше устной. А мой «американский» язык он понимал вполне.

А хочется системность, а не разговорник для туристов.

Мне тоже хочется, поэтому я и говорю, что главное – это хорошо структурированный и сбалансированный по содержанию оригинальный текст. Однако, его никто не дает. По крайней мере, в моем понимании. Я просмотрел сотни обучающих роликов, на разных языках, на Ютубе и другие источники в «ваших Интернетах», но системы по содержимому, не увидел нигде. Только, более-менее, по форме подачи материала (грамматика, словарный запас).

Поэтому, подбирая себе текст, для изучения немецкого языка, я ничего лучшего материала разговорников не нашел. По крайней мере, этот текст (и его озвучку) можно перетасовать на свой лад. На безрыбье, как говорится…

В принципе, если перелопатить всю текстовку всех видео и книг, то найти что-то путное можно. Другое дело, что это не под силу одному человеку. Поэтому, возьму часть материала из разговорников, а потом можно будет добавлять, постепенно, что-то внятное из других источников.

И насчет бесплатных ИИ не вполне согласен. Я пробовал с чатами это делать - набор заданий сделать можно, но это разовая акция, без оценки, без реалтайма, без произношения, в общем сделай и оцени сам

Я имел в иду немного другое. Берем подходящий текст на языке оригинала. С помощью ИИ-сервисов делаем, при необходимости, его озвучку, перевод и транскрипцию. А с этими задачами «Искусственный Идиот» вполне справляется. Если же подходящий текст доступен только в виде озвучки на языке оригинала, то, существуют очень неплохие бесплатные транскрибаторы (STT), до 30 минут на сеанс, с помощью которых мы получаем нужную текстовку, которую, нам никто не мешает отредактировать на свой вкус (при наличии некоторых способностей). Вот так и живём… :) .

Тоже не мой случай.

Естественно! У каждого собственные представления о прекрасном.

Фактически Экзамен - это рекалибровка по контрольным точкам. Но вот насчет подсказки не уверен. Это как-то ухудшает показатель экзамена? В том смысле, что если нет - то как будто бы не совсем верно. Ты не знаешь, но все равно оценка как будто знаешь.

И экзамен как-то сам назначается, по объему прохождения или нужно помнить и запускать?

И про перевод в двух направлениях тоже не уверен. Много где читал, что у изучающих язык проблемы как у меня - читать отлично, а говорить очень плохо. Поэтому на восприятие не ориентировался вообще. Даже слова в двух направлениях только потому, что они новые и как будто бы человек не знает ни в одном направлении.

И цель как раз закрыть зазор между восприятием и знанием правил и применением в реалтайме. В идеале, когда ты запускаешь тренажер в режиме постоянного перевода и он говорит “а скажи-ка мне вот это” или “давай поговорим о твоих сегодняшних словах” и у тебя 1.5 секунды, что бы подумать ) Письменное с grammarly заходит на ура, но когда надо мгновенно - то у меня сразу проблемы. Практика решает

А еще вопрос про разговорник и лицензии на него. Даже переработанное - это все равно собственность некоторых людей. Поэтому я брал только открытые датасеты. По идее сами предложения сейчас уже можно недорого собрать LLM, хоть и не с первого раза 😅

И экзамен как-то сам назначается, по объему прохождения или нужно помнить и запускать?

У меня программа для индивидуального пользователя. «Экзамен» там делается для себя лично, а не для кого-то. Подсказка – вариант самообучения, чтобы не возвращаться в режим «Конспект» или «Видео» для повторного усвоения. Статистика тоже предназначена для себя. Вот, из ста слов, допустим, угадал, к примеру, 95. На последние пять можно обратить дополнительное внимание. В общем, всё по желанию.

И про перевод в двух направлениях тоже не уверен.

Без примеров, мы говорим о разном. Вот пример, работы режима «Экзамен», в двух направлениях (при включенной подсказке для лучшего восприятия):

Проверка оригиналов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка оригиналов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка переводов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка переводов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку

Конечно, когда у слова «миллион» значений, то работать с ним в программе менее удобно, проще использовать видео-словарь ( https://my.mail.ru/mail/emmerald/video/_myvideo/27.html ):

Пример многозначного перевода французского глагола»
Пример многозначного перевода французского глагола»

А еще вопрос про разговорник и лицензии на него. Даже переработанное - это все равно собственность некоторых людей.

Ну, одни и те же фразы встречаются в разных источниках, разных авторов. Кому, скажем, принадлежат фразы, типа: «Hallo! Guten Tag! Guten Morgen! Guten Abend! Gute Nacht! Willkommen! Herzlich willkommen! Auf Wiedersehen. Auf Wiederhören. Bis bald. Tschüss., и т.д. и т.п.»? Что-то более сложное можно брать из разных источников.

Мы берем эти и подобные фразы, лепим к ним озвучку, например, TTS, скажем, на базе локальных, бесплатных onnx-моделей (у меня есть статья на эту тему, здесь). Добавляем перевод из Гугл-транслэйта и снабжаем транскрипцией из какого-нибудь ИИ-сервиса. Все это оформляем в виде видео-уроков либо данных для обучающей программы. Ну и как тут будут решаться вопросы «собственности некоторых людей»? Хотя, допускаю, имея команду юристов и желание кого-то наказать, можно и к столбу доклепаться.

Экзамен можно например по времени в приложении предлагать - поработал 2 часа и забыл про него - оповещение о том, что неплохо бы и контроль сделать.

А как генерируется подсказка? Какой-то смысловой подбор или просто слова из словаря? Кажется, что LLM бы разобралась, но может быть детерминистически можно разобрать (не смог скачать https://lecole.free.nf/Prg/Lecole101_orig.zip что бы посмотреть - говорит ошибка 404). Для Английского есть например база Open English WordNet (лицензия CC BY 4.0) - можно собрать ко-гиперонимы чтобы по коннотации рядом, но не совсем оно. Расстояния семантического только там, конечно же, нет, чтобы выбирать какие-то подальше смыслы, но тоже решаемо детерминистически.

Sign up to leave a comment.

Articles