Pull to refresh
332
Maxim Mozgovoy@rg_software

university professor and software developer

155
Subscribers
Send message
Вот опять же, не совсем понятно. Если у меня на входе фраза из 10 слов, это не ахти какой великой размерности данные. Есть словарь языка, значит, у меня просто набор вида w1, ..., w10, где каждый элемент — это индекс слова в словаре.

Векторизацией мы занимаемся не ради снижения размерности, а просто потому, что из исходного набора очень трудно вычленить хоть что-то разумное. Вот если заменить каждый элемент wi на вероятность слова, то можно хотя бы сравнивать «похожесть» предложений с помощью скалярного произведения. Это совершенно неудовлетворительно, но хотя бы ясно, как осуществить.

Я это говорю к тому, что в данной задаче исходный вектор признаков (с точки зрения размерности) меня вроде как удовлетворяет, и искать автоматически «оптимальные» атрибуты не нужно. Или ошибаюсь?
То есть фильтры Габора и т.п. уже не понадобятся? Вот с точки зрения юзера, на входе просто картинка N*M пикселей, а там уже сеть сама думает, нужен ей edge detection, цветовые фильтры, снижение шума и т.п.?
О, я вот тоже изучал нейросети до бума deep learning и тому подобного. Можете подтвердить/опровергнуть два тезиса?

1) Основная killer feature свёрточных сетей — это умение автоматически подобрать «правильные» признаки из потенциального «полного» набора. При этом данное умение явно полезно для computer vision, где на входе мы имеем картинки с тысячами возможных признаков. А вот, например, если мы хотим анализировать «короткие английские предложения длиной не более 10 слов», то с признаками и так всё более-менее ясно, и значит, каких-то откровений от новых методов ждать не приходится.

2) Даже если мы анализируем картинки, всё равно на вход такой нейросети идёт не просто «прямоугольник из 400*500 пикселей», а уже каким-то образом обработанная картинка, из которой выудить признаки легче, и значит, всё равно от ручного анализа и труда не избавиться.
Ну, есть методы, которые мозг заведомо не использует.
Например, могу предположить, что любой метод, требующий большого объёма оперативной памяти, для мозга явно труден.

А по поводу «понять хочется» — да, хочется, но меня удивляет сама тональность высказывания. Оба этих тезиса (удивительно, что не-человеческие алгоритмы работают хорошо; удивительно, что человек работает по алгоритму) звучат странно.
С одной стороны, если допустить, что нейронные сети не похожи на мозг, то возникает вопрос: почему же они порой так хорошо работают? С другой стороны, если мозг похож на компьютер, то, неужели, мышление можно свести к алгоритмам?


А в чём проблема? Support vector machines совсем не похожи на мозг, но при этом очень хорошо работают. С другой стороны, ещё Тьюринг прямо писал, что мышление сводится к алгоритмам, так почему же 60 лет спустя нас это может удивлять?
Эта критика не по адресу. Академик по сути выдвигает тезис, что патентное бюро должно давать какую-то оценку патентуемой идее, но с чего бы?

Авторское свидетельство, выдаваемое в СССР, фактически являлось документом о передаче прав на использование изобретения. Если изобретение в дальнейшем использовалось, то автор имел право на вознаграждение. Таким образом, государство в этой сделке выступало покупателем, и, разумеется, было заинтересовано в формировании качественного патентного портфеля.

Патент служит защитой идеи автора. Зачем ведомству заниматься детальным анализом идеи? Ну запатентовал человек «симптоматическое лечение заболеваний с помощью осиновой палочки» — и что с того? Да, теперь никто другой не сможет лечить заболевания осиновой палочкой без выплаты вознаграждения автору. Скорее всего, как мы понимаем, этого никогда не произойдёт (= всем пофигу).

Считайте патент чем-то вроде торговой марки. Она может выглядеть и звучать по-идиотски, но это проблема автора, который надеется что-то из этого для себя получить, а не регистрирующей организации.
В целом вы, бесспорно, молодцы, сделали хорошую работу, причём наверняка не всегда данные были непротиворечивыми и удобными для обработки. Но вообще говоря, качество исходных данных удручает. С такой информацией можно только на кофейной гуще гадать, потому что все выводы делаются на очень шатком фундаменте. Вот так подумаешь, что данных лучшего качества всё равно ни у кого нет, а государственные решения принимать как-то надо, и сразу тоскливо становится.
Да, цитату не заметил. В своё оправдание хочу только сказать, что всё-таки вы на это прямо намекаете:
«Если вам интересно узнать, как размер зарплаты и успех трудоустройства зависит от вуза, специальности и региона» — мне вот интересно. Как?
Вообще, конечно, вы продемонстрировали корреляцию между вузом и зарплатой, но говорить о том, что «зарплата зависит от вуза» всё-таки некорректно: этого не было показано никак, так что всё-таки неплохо бы уточнить утверждения. Может, это вуз зависит от зарплаты, или оба зависят от третьего фактора.

По медиане: если данные по медианным доходам в России доступны, можно попробовать просто воспользоваться общими знаниями о медианах для тех или иных профессий.
Два вопроса, если можно:

1) Если попытаться назначить комбинацию Ctrl+Tab (или Ctrl+Shift+Tab), браузер говорит, что комбинация уже назначена. Все настройки перерыл, где она? Нет такой комбинации (или плохо смотрю)?..

2) Только у меня страницы с большим количеством рисунков (например, ЖЖ пост с картинками) загружается нереально медленно и очень рано сдаётся (вместо картинок показывает заглушки)? Кстати, непонятно, почему в контекстном меню нет пункта «перезагрузить картинку», это же достаточно частая история. Аналогично, через раз работают сайты вроде google maps и google поиск картинок.

Да, а вот и третий вопрос поспел: почему-то очень плохая вёрстка текста. См., напр., слово «два»:

image
Да, и «рабочие визы» в данном случае не так важны, мало ли кто по какому статусу приезжает. Вот: «In 2014, 1.3 million foreign-born individuals moved to the United States, an 11 percent increase from 1.2 million in 2013. India was the leading country of origin for new immigrants, with 147,500 arriving in 2014, followed by China with 131,800, Mexico with 130,000, Canada with 41,200, and the Philippines with 40,500.»
Не путайте «карьеризм» и «олимпиады». Для хорошего студента хорошего американского вуза куда надёжнее получить internship в большой корпорации и на месте завести контакты, а там уже найти себя, нежели пускаться в рискованные олимпиадные предприятия.
Могла быть, а могла и не быть, это всё спекуляции. По моим ощущениям (взлёт вконтакта застал в студенческие годы) вконтакт просто стал «русским фейсбуком», на тот момент у него тоже не было аналогов. У фейсбука не было даже русскоязычного интерфейса на тот момент.
Нет, я совершенно не согласен.
Суть в том, что хороший студент в каком-нибудь Берлине не нуждается в шансе на собеседование в Гугле. Он просто садится в трамвай, едет на улицу Унтер дер Линден и собеседуется на месте без того, чтобы прыгать через десять обручей, получать визы и обивать пороги. Более того, хорошие корпорации сами устраивают там ярмарки вакансий и т.п. В моём университете (в Японии) фирмы сами приезжают в кампус и устраивают предварительные собеседования со студентами. Это обычный нормальный процесс, и если человек хочет прыгнуть в корпорацию, ему нет необходимости приезжать на соревнования и вырывать свой приз, он получит то же самое в нормальном рабочем режиме.

Тешить эго можно массой других способов: пилить свой стартап, писать свою операционную систему или ещё как. Я же не говорю, что спорт плох, просто именно этот способ интересен определённой группе людей, вот и всё. В том и дело, что в обычном спорте точно так же преобладают люди из бедных семей, это данность. Недаром на чемпионатах Европы по футболу или в NBA мы видим так много чёрных, это не случайность.

А про «оценки за учёбу автоматом» — это просто смешно. В хорошем вузе оценки ставят только за достижения по текущему предмету, а не за успехи в олимпиадах, балете или КВН.
А что, с него уже массово сваливают? Не заметил.
Юзеров у них, мягко говоря, побольше, оптимизация тоже имеет пределы, а оборудование денег стоит. Бизнес.
Да в том и дело, что наш стереотип «белый — значит, приехал много поколений назад», а «китаец — значит, приехал вчера» тоже не совсем справедлив. В Америке всю вторую половину XX века идёт мощный приток мигрантов, поэтому я не удивлюсь, если половина (если не больше) ребят, выглядящих как китайцы и индусы уже реально были рождены и воспитаны на месте.
Ну, я уже высказался, жителям Европы, Канады и прочей Новой Зеландии эта движуха не очень интересна. Я вот как сотрудник японского университета говорю: наша провинциальная ACM команда занимала призовые места на уровне страны и региона (Азия), но не могу сказать, что по этому поводу был какой-то большой шум, хотя могли бы и поднять. Как был клуб по интересам, так и остался.

А вот для китайцев и индусов это большое дело. Из тех же соображений европейцы (да и японцы) не рвутся в США тысячами — им и дома неплохо.
Ну, достаточно голословное утверждение. Вконтакт — всего лишь один из многих-многих десятков и сотен высоконагруженных сайтов. Не первый, и не последний. Если вас послушать, так этих гениев производят в промышленных масштабах, раз все эти многочисленные сайты не тормозят.
Оптимизация — штука непростая, но хорошо изученная и вполне поставленная на поток.

Information

Rating
4,636-th
Location
Фукусима, Япония
Date of birth
Registered
Activity