Обновить

Комментарии 27

Первое впечатление. Зашел по ссылке в тг бот, при нажатии /start получил сообщение "Доступ закрыт. Попроси администратора добавить тебя", на этом этапе отсеются 8 из 10 попытавшихся попробовать :) просто потому что неизвестно где этот администратор, кому писать, что делать и т.п. Хоть в описание бота добавьте контакты админа =) Ну ок, я решил потестить, поэтому не поленился и написал тут, а обычному пользователю как?:)

О, как, спасибо за баг. Не, это точно просто баг, с тестовой версии приехало. И большая часть людей все-таки в веб приходит. Для меня бот прям сильно не основная штука, т.к. неудобно лично самому такой формат. Веб интерактивный, с уроками и реалтайм голосом, а чат - это я уже видел в других местах, мне не зашел формат

Аппку в итоге запустил, на старте предлагает отметить слова, которые точно понимаешь.

В списке слов есть несуществующие, это может и будет искажать смысл опроса, потому что люди будут сомневаться. Например слово abulled - это что? Ни моя память ни гугление ни шуршание словарем не сумели помочь, оно выдуманное что-ли?:) Ну имя есть арабское такое, но причем тут английский язык?)) Может нейросетка сгаллюцинировала и это должно было быть annulled? Тоже самое с proute, reful, symping (ну ок это дико сленгово и даже на urbandictionary идут споры имеет ли оно место быть или это просто кривое произношение simping)? Sarate - это что за чудо? Есть даже вариант слова "iii". Ну то есть я сомневаюсь что набор несуществующих слов поможет как-то определить моё знание английского.

Да, это как раз специальная механика, которую я нашел в научной статье по изучению языков - 20% слов ненастоящие. Генерировал их цепями маркова, потом еще Sonnet отсеивал "похожее на слова". Идея в том, что правильные слова добавляют уверенности в оценку, а ненастоящие - убавляют. В результате, если отметить все, то оценка будет "0 слов", что как будто бы и правильная при попытке затыкать все.

Вот сама статья - https://link.springer.com/article/10.3758/s13428-011-0146-0

Там конечно больше охват и как-то они постарались соединить модельные наборы с реальными, но в целом результаты кажутся довольно здоровыми.

По итогу выдало мне С2 с парой ошибок при проверке, с которыми я не особо согласен, ну да ладно, потом дальше покручу=)

И вот тут у меня тоже начинаются проблемы. Как будто грамматику +- я понимаю и уж "выбери из 3х вариантов" получаются, вон тот же EF тоже C2 выдает. Но это ж неправильно. Учителя живые на первом занятии просто говорят "давай, поговори там чего-нибудь". Но я боюсь такое сразу людей отпугнет, потому, что меня такое в других продуктах удивило и я продолжать не стал. А самая главная проблема потом начинается - оно же считает, что все, C2, и это подается на вход LLM, типа "не стесняйся в выражениях, там нормально все" и получаются грамматические монстры, которые мне вообще не понятны

Сейчас пришла идея, что может нужно динамическую переоценку проводить, на основании ошибок? Я же все равно всю историю собираю и по грамматике и по словам. Только как потом пользователю сказать, что мы как будто бы немного ошиблись и у него не C2, а очень даже B1 😣

Это можно сделать ненавязчиво и незаметно. Просто добавлять в изучаемые слова что-то уровня ниже и если пользователь их не тыкает "Знаю - больше не показывать" - просто понизить уровень знания, не говоря ему об этом.

Не говорить вроде как-то неправильно, но можно предупредить, что будет переоценка и показывать ее в настройках просто. Что бы потом и пользователь мог сказать "а вот и не угадали" и вернуть обратно. Основная то идея уровня в том, что задания генерируются под уровень, а не слова. Слова нужны, конечно, но в целом нет такой штуки как "слова уровня B2" - это скорее предположение, что 80%, у кого уровень близок к этому столкнулись и знают. Но у меня 4 датасета с разных источников и в них процентов 30 расхождений по оценке уровня слов, поэтому на одном словаре наверное не стоит основываться. На словаре и грамматике вполне можно, наверное

Я не маркетолог, но проверку уровня языка я бы положил ДО входа и создания аккаунта.

Вот над этим я тоже думал, но очень уж я часто сталкиваюсь с волшебными решениями, где проходишь какой-нибудь опрос, тратишь время, а они потом тебе "а давай-ка ты сразу подписочку оформишь". А я вроде как и не хочу никому подписочку лишнюю предлагать. Хочу добро людям нести. Основная цель такая была - принести чего-нибудь полезное, потому что мне лично было полезно грамматический тренер. Вообще очень по-дурацки получается, EF грамматика C2, а открываю уроки 1.1/1.2 и половина неправильно говорю в реалтайм. В сущности идея была сделать этакий грамматический решебник, но без идей "3 примера на правило" и вообще без "вставь в пропуск" в идеале (от B1 дефолтный режим ставится "полный перевод"). Потому, что вставь пропуск - это то же самое, что и выбрать из 3х вариантов - не помогает запомнить. Но для A2 понятно, что полностью перевод сразу тяжело сделать, особенно голосом в реалтайм

это мой пет-проект, который я более или менее довёл до состояния «можно показывать людям»

Очень неплохо, как по уровню реализации. Вопрос, как всегда, в подобных случаях, а устраивает ли, лично меня, используемый подход?

Понятно, что мнением одного пользователя всегда можно пренебречь. Однако, концепция обучения «говорению» на иностранном, при этом, никуда не денется. Наверное, эта тема будет вечной, как и любовь.

Я тоже иногда размышляю о «вечном», но, все известные мне подходы, мне не нравятся. Для себя, я определяю решение в наличии «правильных» текстов. Под которыми, я понимаю последовательности независимых, грамматически однородных фраз, с постепенно нарастающей сложностью. Другими словами, грамматика и словарный запас должны быть «вшиты» в простые слова и фразы, т.е., осваиваться в контексте.

Например, сначала идут, допустим, фразы, типа: «Я что-то делаю», «Он что-то делает», …, «Они что-то делают». Потом, тоже самое, в простом прошедшем и будущем времени. Затем, в сослагательном наклонении и т.д. и т.п. Помимо акций, должны также осваиваться описания свойств и состояний, вроде: «Мы – лучшие!», «Он – гений!», или там, «Штирлиц – насторожился!», «Я хочу / могу / надеюсь чего-то там или на что-то». Ну, думаю, идея понятна. При этом предложения в нашем «фразебуке» должны быть, начиная от одного-двух слов до трех-пяти, максимум, на первом этапе. Длинные предложения, затем, строим через композицию коротких.

Вот именно с этими «последовательностями независимых, грамматически однородных фраз, с постепенно нарастающей сложностью» и должен иметь пользователь.

Это напоминает достаточно популярные и широко используемые русско-иностранные и иностранно-русские разговорники. Только, имеет смысл объединить озвучку, хотя бы TTS-ную, с текстом. Тем самым мы получаем уроки в видео-формате. Для интерактивной работы используем соответствующие обучающие программы.

Например, я никогда ранее не изучал немецкий язык, но решил попробовать сделать первые уроки в формате немецко-русского (или наоборот) видео-разговорника. Потом эти данные конвертировать в формат Sqlite, для моей обучающей программы «L’école». Примеры обучающих видео с двуязычными субтитрами можно посмотреть на моих каналах (более подробную информацию можно найти в моем профиле).

Да, имеющийся у меня текст немецкого разговорника неплохой, хотя и не идеальный, по моим меркам, но, хорошего текста нет нигде, а чтобы генерировать его самому либо на пару с ИИ-ями, нужно уже иметь соответствующий уровень.

Короче говоря, главное, при изучении языка, это хороший текст, на языке оригинала. «Всё остальное можно купить за деньги!», то бишь, получить, используя бесплатные ИИ-сервисы, не говоря уже о платных.

Вот как раз встраивание изучаемых слов (с приоритетом тех, которые плохо запоминаются) это и было первым реализовано и это довольно легко. И работает в целом неплохо - в тренажере и в ролевых и в обсуждении новостей может подсунуть, но без фанатизма (в зависимости от уровня изученных слов эффективность разная, конечно).

Но вот эта вечная идея прогрессивного обучения спотыкается о то, что нужно как-то оценить, куда пользователь движется и как у него в мозгу это укладывается. То есть как-то почитать его мысли и узнать его лучше, чем он знает себя сам. Даже учителя не все с этим справляются, не то, что ИИ, к сожалению. И мы не скоро достигнем состояния, когда можно будет хотя бы "уверенность" в ответе измерить каким-то разумным способом, чтобы от него модель считать. Всякие измерения кожного сопротивления не в счет - не каждый ученик будет учить английский в детекторе лжи 😅

Мне кажется как раз программа важна. Путь, по которому пользователя можно или быстро протащить или задержать где, в зависимости от сложности (мне раньше нравилась подача ютубера CGPGray - у него адаптивная скорость подачи в зависимости от важности была очень хорошо настроена. Вот такую бы и мне в тренажер).

Программы во всяких duolingo настроены на наборы фраз и фактически "программой изучения" языка то и не являются, как не является программой любой карманный разговорник. А хочется системность, а не разговорник для туристов. И насчет бесплатных ИИ не вполне согласен. Я пробовал с чатами это делать - набор заданий сделать можно, но это разовая акция, без оценки, без реалтайма, без произношения, в общем сделай и оцени сам. Тоже не мой случай.

нужно как-то оценить, куда пользователь движется и как у него в мозгу это укладывается

В моей программе есть режим «Экзамен», там можно проверить уровень запомненных слов и фраз (путем выбора правильного варианта из неправильных либо отказаться от выбора, чтобы система сделала подсказку – этот вариант нужен для того, чтобы не портить себе статистику, за счет удлинения времени «экзамена»). Проверять можно в двух направлениях: оригинал – перевод и перевод- оригинал.

Всякие измерения кожного сопротивления не в счет - не каждый ученик будет учить английский в детекторе лжи

Ну, если мы учим язык не для «дяди», а для себя, то это, скорее всего, не понадобится. Мне лично достаточно одного понимания устной речи, а для письменного общения можно использовать онлайн-переводчики. Устное общение у меня было, когда-то, с одним американцем, который приезжал в наш город, и которому нужно было помочь с временным обустройством. Там, где я не понимал его, просил писать на бумаге. Письменная речь у меня была явно лучше устной. А мой «американский» язык он понимал вполне.

А хочется системность, а не разговорник для туристов.

Мне тоже хочется, поэтому я и говорю, что главное – это хорошо структурированный и сбалансированный по содержанию оригинальный текст. Однако, его никто не дает. По крайней мере, в моем понимании. Я просмотрел сотни обучающих роликов, на разных языках, на Ютубе и другие источники в «ваших Интернетах», но системы по содержимому, не увидел нигде. Только, более-менее, по форме подачи материала (грамматика, словарный запас).

Поэтому, подбирая себе текст, для изучения немецкого языка, я ничего лучшего материала разговорников не нашел. По крайней мере, этот текст (и его озвучку) можно перетасовать на свой лад. На безрыбье, как говорится…

В принципе, если перелопатить всю текстовку всех видео и книг, то найти что-то путное можно. Другое дело, что это не под силу одному человеку. Поэтому, возьму часть материала из разговорников, а потом можно будет добавлять, постепенно, что-то внятное из других источников.

И насчет бесплатных ИИ не вполне согласен. Я пробовал с чатами это делать - набор заданий сделать можно, но это разовая акция, без оценки, без реалтайма, без произношения, в общем сделай и оцени сам

Я имел в иду немного другое. Берем подходящий текст на языке оригинала. С помощью ИИ-сервисов делаем, при необходимости, его озвучку, перевод и транскрипцию. А с этими задачами «Искусственный Идиот» вполне справляется. Если же подходящий текст доступен только в виде озвучки на языке оригинала, то, существуют очень неплохие бесплатные транскрибаторы (STT), до 30 минут на сеанс, с помощью которых мы получаем нужную текстовку, которую, нам никто не мешает отредактировать на свой вкус (при наличии некоторых способностей). Вот так и живём… :) .

Тоже не мой случай.

Естественно! У каждого собственные представления о прекрасном.

Фактически Экзамен - это рекалибровка по контрольным точкам. Но вот насчет подсказки не уверен. Это как-то ухудшает показатель экзамена? В том смысле, что если нет - то как будто бы не совсем верно. Ты не знаешь, но все равно оценка как будто знаешь.

И экзамен как-то сам назначается, по объему прохождения или нужно помнить и запускать?

И про перевод в двух направлениях тоже не уверен. Много где читал, что у изучающих язык проблемы как у меня - читать отлично, а говорить очень плохо. Поэтому на восприятие не ориентировался вообще. Даже слова в двух направлениях только потому, что они новые и как будто бы человек не знает ни в одном направлении.

И цель как раз закрыть зазор между восприятием и знанием правил и применением в реалтайме. В идеале, когда ты запускаешь тренажер в режиме постоянного перевода и он говорит “а скажи-ка мне вот это” или “давай поговорим о твоих сегодняшних словах” и у тебя 1.5 секунды, что бы подумать ) Письменное с grammarly заходит на ура, но когда надо мгновенно - то у меня сразу проблемы. Практика решает

А еще вопрос про разговорник и лицензии на него. Даже переработанное - это все равно собственность некоторых людей. Поэтому я брал только открытые датасеты. По идее сами предложения сейчас уже можно недорого собрать LLM, хоть и не с первого раза 😅

И экзамен как-то сам назначается, по объему прохождения или нужно помнить и запускать?

У меня программа для индивидуального пользователя. «Экзамен» там делается для себя лично, а не для кого-то. Подсказка – вариант самообучения, чтобы не возвращаться в режим «Конспект» или «Видео» для повторного усвоения. Статистика тоже предназначена для себя. Вот, из ста слов, допустим, угадал, к примеру, 95. На последние пять можно обратить дополнительное внимание. В общем, всё по желанию.

И про перевод в двух направлениях тоже не уверен.

Без примеров, мы говорим о разном. Вот пример, работы режима «Экзамен», в двух направлениях (при включенной подсказке для лучшего восприятия):

Проверка оригиналов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка оригиналов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка переводов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку
Проверка переводов запомненных слов, с озвучкой. Если не знаем правильный ответ – просим подсказку

Конечно, когда у слова «миллион» значений, то работать с ним в программе менее удобно, проще использовать видео-словарь ( https://my.mail.ru/mail/emmerald/video/_myvideo/27.html ):

Пример многозначного перевода французского глагола»
Пример многозначного перевода французского глагола»

А еще вопрос про разговорник и лицензии на него. Даже переработанное - это все равно собственность некоторых людей.

Ну, одни и те же фразы встречаются в разных источниках, разных авторов. Кому, скажем, принадлежат фразы, типа: «Hallo! Guten Tag! Guten Morgen! Guten Abend! Gute Nacht! Willkommen! Herzlich willkommen! Auf Wiedersehen. Auf Wiederhören. Bis bald. Tschüss., и т.д. и т.п.»? Что-то более сложное можно брать из разных источников.

Мы берем эти и подобные фразы, лепим к ним озвучку, например, TTS, скажем, на базе локальных, бесплатных onnx-моделей (у меня есть статья на эту тему, здесь). Добавляем перевод из Гугл-транслэйта и снабжаем транскрипцией из какого-нибудь ИИ-сервиса. Все это оформляем в виде видео-уроков либо данных для обучающей программы. Ну и как тут будут решаться вопросы «собственности некоторых людей»? Хотя, допускаю, имея команду юристов и желание кого-то наказать, можно и к столбу доклепаться.

Экзамен можно например по времени в приложении предлагать - поработал 2 часа и забыл про него - оповещение о том, что неплохо бы и контроль сделать.

А как генерируется подсказка? Какой-то смысловой подбор или просто слова из словаря? Кажется, что LLM бы разобралась, но может быть детерминистически можно разобрать (не смог скачать https://lecole.free.nf/Prg/Lecole101_orig.zip что бы посмотреть - говорит ошибка 404). Для Английского есть например база Open English WordNet (лицензия CC BY 4.0) - можно собрать ко-гиперонимы чтобы по коннотации рядом, но не совсем оно. Расстояния семантического только там, конечно же, нет, чтобы выбирать какие-то подальше смыслы, но тоже решаемо детерминистически.

Экзамен можно например по времени в приложении предлагать - поработал 2 часа и забыл про него - оповещение о том, что неплохо бы и контроль сделать.

Я думаю, вскоре, заняться разработкой второй версии программы. У меня накопились свои претензии. Но, вашего посыла я не понял. Что вы понимаете под «оповещением» и «контролем»?

А как генерируется подсказка? Какой-то смысловой подбор или просто слова из словаря?

У меня идет отбор из слов из текущего файла базы данных, той же самой грамматической категории (глагол, существительное и т.п.), кроме присутствующих в «правильной» записи. Например, случайный подбор вариантов перевода не должен показывать значения, которые могут быть верными и для правильного слова и для неправильного. Если слов не хватает, то количество вариантов перевода уменьшается с пяти, вплоть до одного. Фразы имеют общую, неопределенную категорию, поэтому угадывать их легче, если знаешь, хотя бы какие-то слова в них.

не смог скачать https://lecole.free.nf/Prg/Lecole101_orig.zip что бы посмотреть - говорит ошибка 404

Спасибо, за замеченную ошибку! Проверил, действительно, файл отсутствует (удалил сам сервер). Попробовал перезалить, но сервер отказывается его принимать. Думаю, что дело в его размере. Похоже, что с некоторых пор, (бесплатный) сервер стал удалять большие файлы (порядка 100 мегабайт). При этом, файлы: https://polezp.narod.ru/Prg/Lecole100_orig.zip (57 Мб) и https://lecole.free.nf/Prg/MiniDL100.zip (графическая обёртка для консольного загрузчика видосиков – 363 Кб) – доступны. Чтобы решить проблему, я добавил туда Lecole101_orig.zip и Lecole100_orig.zip (который тоже был удалён), но просто с одним html-файлом в котором указаны реальные ссылки, в т.ч., на Yandex.disk (чтобы не менять страницу на сайте: https://lecole.free.nf/Prg/Lecole.php ). Короче говоря, эквивалентные ссылки: https://polezp.narod.ru/Prg/Lecole100_orig.zip и https://disk.yandex.ru/d/5yjYP4JP1aVnIw – Lecole101_orig.zip) работают, только что проверил.

Жаль, что не могу плюсануть. Но ещё круче было бы добавить тренировку произношения.

Уточнение: я имел в виду тренировку интонации. Корректировки отдельных звуков, как по мне, недостаточно.

LLM проверяет, но в уроках эти отдельные элементы есть - как нулевой артикль, так и различные применения. Но за ссылочки спасибо, проверю, что все как я думаю )

Вы сами смогли свободно заговорить при подобном подходе?
Просто вы обозначили проблему как "стык между «знаю правило» и «сказал вслух и не облажался» и сделали очень хороший тренажер чтобы как можно дольше бултыхаться на месте этого стыка, т..е у вас реализована тренировка отдельных слов и грамматики и затем сразу переход к разговору с ИИ, путь даже ИИ будет подсовывать вам изучаемые слова. Вы в любом случае остаетесь на уровне мучительного построения фраз и предложений со скоростью, которую может вынести только ИИ. Для свободного говорения нужно тренировать беглость, которая появляется когда вы автоматизировали произношение не отдельных слов, а чанков и коллокаций, автоматизировали грамматические паттерны настолько, что не думаете о них и начинаете думать о том что сказать, а не как сказать. Добавьте раздел тренировка беглости, с учетом изучаемых слов и ваш стык будет закрыт. Ну и тренировку слов стоит расширить до тренировки слов в чанках, а не изолированных лексических единиц.

Спасибо за отличный отзыв! А что вы имеете в виду под тренировкой беглости? У меня есть условно "правила", "слова" и "предложения", как просто для тренировки произношения, так и самый главный модуль - просто произношение предложений. В этом режиме как раз можно включить реалтайм разговор и по правилам даже просто в режиме "заполни пропуск" говорить целиком предложения (не так стрессово, как полностью перевод - для новичков подойдет) и получать анализ произношения да заодно и грамматику. То есть я вижу это как набор "посмотрели правило" -> "поделали упражнения в тексте" -> "поговорили"

Я делал для себя и вижу, что у меня очень большая проблема с грамматикой, которая рождает неуверенность. Когда занимался с репетитором этот пробел не закрылся - просто не будет человек каждый раз поправлять и считать ошибки у тебя по темам.

А чанки к словам это фразы или предложения? Никогда такого не видел, но кажется идея очень интересная. В целом то можно насобирать по 5-6 фраз к одному слову для его тренировки и каждый раз показывать разное. Такое что-то?

Chunks and collocations - готовые блоки из нескольких слов (2-3-4-5 и больше) которые хранятся у вас в долговременной памяти как одно целое. Это и фразовые глаголы, и устойчивые сочетания типа heavy rain, (а не strong rain), вводные конструкции to be honest, as far as I know, шаблоны предложений What I meant was... и т.д.
Как это влияет на беглость? В фокусе сознания вы можете держать ограниченное количество элементов, если каждый элемент - это отдельное слово, вы захлебываетесь в длинном предложении, если каждый элемент - это пресобранный блок из 3-4 слов, вы не тратите время и ресурс на составление сложного предложения, и можете думать о смысле того, что хотите донести. За счет этого скорость речи возрастает в 3-5 раз, и грамотность тоже, потому что грамматика уже вшита в чанк. Например What I'm trying to say (блок 1) is that (блок 2 ) I've always been into (блок 3) learning languages (блок 4).
Как это тренировать? Во-первых нужно научиться видеть это в речи носителей, письменной и устной. Затем вытаскивать чанк в свою программу тренировок лексики и гонять его в каких хотите вариантах, но самое главное - проговаривая ВСЛУХ в хорошем темпе до тех пор, пока вам не станет ЛЕГКО проговаривать всю фразу, "легко" не значит как 100% носитель, это значит ваш артикуляционный аппарат готов выдать эту фразу на автомате как слитное целое. Побочный эффект - также вырастут ваши listening skills.
Чем больше таких пресобранных блоков, (которые вам легко произнести вслух и естественно вы понимаете смысл этой фразы) вы загнали в область бессознательного, тем легче вам во время речи сосредоточиться на том, что вы хотите сказать, каким маркером вежливости воспользоваться в данной ситуации, где сделать логическое ударение и прочее, а область бессознательного будет подкидывать вам строительные блоки уже грамматически оформленные. Да, вы будете лажать, и это нормально, даже на родном языке мы можем сказать не то окончание, и заметить это уже после того, как слово вылетело. Но лучше лажать по мелочи, чем рожать одно предложение 3 минуты.

Всё так. И всё-таки, стоит добавить сюда интонацию .

Вы сами смогли свободно заговорить при подобном подходе?Просто вы обозначили проблему как "стык между «знаю правило» и «сказал вслух и не облажался» и сделали очень хороший тренажер чтобы как можно дольше бултыхаться на месте этого стыка, т..е у вас реализована тренировка отдельных слов и грамматики и затем сразу переход к разговору с ИИ, путь даже ИИ будет подсовывать вам изучаемые слова. Вы в любом случае остаетесь на уровне мучительного построения фраз и предложений со скоростью, которую может вынести только ИИ.

Вот этот вопрос "Вы сами смогли свободно заговорить при подобном подходе" это не в какие ворота. Чтобы свободно заговорить на языке обычному человеку нужно от 4 лет безостановочных занятий и разнообразной практики. Как вы думаете, сколько существует это приложение?

Как получается, что люди учат язык 10-20 лет и все еще не могут пройти на этом языке собеседование чтобы на нем работать?
Грамматика как теория изучается за 3 месяца. Ее беглое использование придет когда будет практика, а практика будет при условии, что есть на чем тренироваться, а для этого нужен эффективный активный словарный запас тысячи на 3 слов (причем не включая сюда производные слова и интернациональные).
Люди плохо способные к языкам тратят десятилетия без толку из за засилия мнений исходящих от полиглотов, что нужно отрабатывать правила, устойчивые сочетания, идиомы, беглость и так далее. По мне, так слон в комнате для простого смертного, это всегда активное вокаблари и больше ничего. Если у меня хватает слов чтобы выразить то что я хочу выразить я вам выдам это на скорости пулемета, если слов не хватает, всякие "What I'm trying to say" на уровне автоматизма помогут только генерить бессмыслицу а не выражать то что я хочу объяснить. А эмоциональная и вежливая окраска речи, это вообще очень узкая тема не очень много кому нужная.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации