Nemiling не удерживает собственный процент с каждого платежа. Текущая помесячная цена «Анлим» — 2 990 ₽; 2 499 ₽ — эквивалент месяца при оплате 29 990 ₽ за 12 месяцев. Один тариф действует на проекты одного аккаунта. Актуальные условия: https://nemiling.info/help/stoimost/
Хорошая практика, особенно идея начинать с уточнения входных данных, а не сразу просить ИИ «нагенерить 100500 записей».
Я бы только добавил ещё один важный пункт: проверять нужно не только то, что SQL выполняется и JSON верный, но и насколько хорошо сгенерированные данные покрывают реальные тестовые сценарии.
Например, попросить ИИ создать набор, где есть пограничные даты, дубликаты там, где они допустимы, конфликты связей, редкие комбинации статусов, максимальные длины строк и заведомо неверные значения для негативных тестов - уже гораздо интереснее.
В этом смысле ИИшку для тестовых данных я бы воспринимал не как «генератор случайных записей», а скорее как помощника по конструированию набора сценариев.
И ещё момент, который сегодня становится особенно важным: чем ближе данные к production-like, тем больше вопросов к приватности и управлению ими. Synthetic data здесь действительно выглядит перспективнее простого копирования production с последующим маскированием, но само слово «synthetic» ещё не означает автоматически «безопасно и качественно».
А с API вообще любопытно наблюдать, куда всё движется: Postman уже развивает Agent Mode, который может генерировать тесты на основе контекста запросов и ответов.
Поэтому, похоже, следующий уровень - не «ИИ сделал тестовые данные», а цепочка требования-сценарии-данные-проверки-анализ результата, где человек остаётся тем, кто определяет, что именно должно считаться качественным тестом.
Самое интересное тут для меня даже не «1С обогнал Python» и не «hh врёт/не врёт», а то, насколько сильно результат зависит от того, что именно мы положили в датасет и как потом разметили.
Особенно забавно с HR: если агрегатор называет IT-смежные вакансии IT, а потом мы на основании этого же датасета делаем вывод, что «самая массовая профессия в IT - HR», то мы фактически измеряем не весь IT-рынок, а рынок вакансий по правилам конкретного классификатора. А пример с вакансией шоколадницы в категории HR из комментариев как раз показывает, что тут есть куда допиливать.
С зарплатами та же история. Сравнивать медиану hh и Telegram/Getmatch можно, но это скорее сравнение разных срезов рынка, а не доказательство, что одна и та же работа «вне hh стоит в 2-3 раза дороже». На hh массовый найм, джуны, регионы и вакансии без вилок, а в телеге и нишевых бордах уже изначально другая аудитория. Это примерно как сравнить среднюю скорость всех машин на МКАДе со скоростью машин на трек-дне и потом удивиться, что где-то почему-то быстрее.
При этом сам вывод мне нравится: искать работу только на одной площадке сегодня, действительно так себе стратегия. И вот это уже практическая ценность исследования, даже если некоторые цифры ещё требуют методологического шаманства.
Ну и отдельный респект за попытку показать исходные ограничения, выборки и довер интервалы. Для нас это уже почти production-ready аналитика, осталось только продакшен.
А вообще, если мы теперь любую выборку из 100 тысяч вакансий называем «рынком IT», то следующий шаг - собрать 10 тысяч резюме и доказать, что Россия наконец-то состоит из десяти тысяч уникальных разработчиков, которые почему-то все одновременно ищут работу, не так ли?
Nemiling не удерживает собственный процент с каждого платежа. Текущая помесячная цена «Анлим» — 2 990 ₽; 2 499 ₽ — эквивалент месяца при оплате 29 990 ₽ за 12 месяцев. Один тариф действует на проекты одного аккаунта. Актуальные условия: https://nemiling.info/help/stoimost/
Хорошая практика, особенно идея начинать с уточнения входных данных, а не сразу просить ИИ «нагенерить 100500 записей».
Я бы только добавил ещё один важный пункт: проверять нужно не только то, что SQL выполняется и JSON верный, но и насколько хорошо сгенерированные данные покрывают реальные тестовые сценарии.
Например, попросить ИИ создать набор, где есть пограничные даты, дубликаты там, где они допустимы, конфликты связей, редкие комбинации статусов, максимальные длины строк и заведомо неверные значения для негативных тестов - уже гораздо интереснее.
В этом смысле ИИшку для тестовых данных я бы воспринимал не как «генератор случайных записей», а скорее как помощника по конструированию набора сценариев.
И ещё момент, который сегодня становится особенно важным: чем ближе данные к production-like, тем больше вопросов к приватности и управлению ими. Synthetic data здесь действительно выглядит перспективнее простого копирования production с последующим маскированием, но само слово «synthetic» ещё не означает автоматически «безопасно и качественно».
А с API вообще любопытно наблюдать, куда всё движется: Postman уже развивает Agent Mode, который может генерировать тесты на основе контекста запросов и ответов.
Поэтому, похоже, следующий уровень - не «ИИ сделал тестовые данные», а цепочка требования-сценарии-данные-проверки-анализ результата, где человек остаётся тем, кто определяет, что именно должно считаться качественным тестом.
Самое интересное тут для меня даже не «1С обогнал Python» и не «hh врёт/не врёт», а то, насколько сильно результат зависит от того, что именно мы положили в датасет и как потом разметили.
Особенно забавно с HR: если агрегатор называет IT-смежные вакансии IT, а потом мы на основании этого же датасета делаем вывод, что «самая массовая профессия в IT - HR», то мы фактически измеряем не весь IT-рынок, а рынок вакансий по правилам конкретного классификатора. А пример с вакансией шоколадницы в категории HR из комментариев как раз показывает, что тут есть куда допиливать.
С зарплатами та же история. Сравнивать медиану hh и Telegram/Getmatch можно, но это скорее сравнение разных срезов рынка, а не доказательство, что одна и та же работа «вне hh стоит в 2-3 раза дороже». На hh массовый найм, джуны, регионы и вакансии без вилок, а в телеге и нишевых бордах уже изначально другая аудитория. Это примерно как сравнить среднюю скорость всех машин на МКАДе со скоростью машин на трек-дне и потом удивиться, что где-то почему-то быстрее.
При этом сам вывод мне нравится: искать работу только на одной площадке сегодня, действительно так себе стратегия. И вот это уже практическая ценность исследования, даже если некоторые цифры ещё требуют методологического шаманства.
Ну и отдельный респект за попытку показать исходные ограничения, выборки и довер интервалы. Для нас это уже почти production-ready аналитика, осталось только продакшен.
А вообще, если мы теперь любую выборку из 100 тысяч вакансий называем «рынком IT», то следующий шаг - собрать 10 тысяч резюме и доказать, что Россия наконец-то состоит из десяти тысяч уникальных разработчиков, которые почему-то все одновременно ищут работу, не так ли?