А можно подробнее? На чем бенчили до/после, как работает утилитка, какие конкретно данные убраны из модели?
Насколько я знаю, Gemma 4 26b по дефолту выше GPT OSS 120b в coding index + TerminalBench, без каких-либо доработок, но хуже в других бенчах. Так что интересна конкретная методика замеров поумнения модели.
Я все еще не уверен, что поощрять и взращивать сексизм — это лучший способ бороться с ним. Огораживая женщин в отдельные загончики, мы не помогаем им развиваться в профессиональной среде.
В статье стоило уточнить, что речь именно про второе. Код библиотек нуждается в сильно более полном покрытии тестами. Если кто-то поверит статье и протестирует библиотеку по принципу «нет смысла покрывать юнит-тестами тривиальный код», он с крайне высокой вероятностью столкнется с проблемами в будущем.
Также не совсем ясно, зачем автор вводит новую терминологию, вроде «общительных» тестов. Чем не устраивают классические e2e-тесты?
Ну и в статье из рубрики «как тестировать» я бы ожидал увидеть больше «мяса»: какие бывают метрики тестирования, как писать тестируемый код и так далее.
Если уж рекламируете свои сервера с почасовой оплатой, показали бы, как поднимать такой сервер через API из кода, чтобы не тыкать ручками в интерфейсе, а делать все программно по потребности.
WUJI полноценно исполняет стандартные 32-битные инструкции RISC-V, корректно выполняет арифметические операции с числами до 4,2 миллиарда и поддерживает адресацию гигабайтных объемов данных
Разве тут не написано 3 раза одно и то же?
Ну и по статье я так и не понял, чем же эти новые процессоры лучше старых, хотя бы в перспективе и в теории.
Штош, справедливо. Но сама идея «суперкомпьютера из звонилок» звучит кликбейтно.
Насколько осмысленно накупить таких телефонов, поставить туда какую-нибудь Ubuntu Server, и сделать из них Kubernetes-кластер?
Красавчики.
«выйди и зайди нормально!»
Появились волонтеры — сделали перевод. Пропадут волонтеры — поддержку свернут. В целом наличие нативного перевода — хорошо.
Пчелы против меда.
Че по бенчам?
В проекте тестов нет.
А можно подробнее? На чем бенчили до/после, как работает утилитка, какие конкретно данные убраны из модели?
Насколько я знаю, Gemma 4 26b по дефолту выше GPT OSS 120b в coding index + TerminalBench, без каких-либо доработок, но хуже в других бенчах. Так что интересна конкретная методика замеров поумнения модели.
Пустые тесты ловятся машинерией на базе мутационного тестирования.
Я все еще не уверен, что поощрять и взращивать сексизм — это лучший способ бороться с ним. Огораживая женщин в отдельные загончики, мы не помогаем им развиваться в профессиональной среде.
Прежде всего, тесты бывают 2 видов:
Для переиспользуемого кода (библиотек, например)
Для «одноразового» кода (веб-сервисы и подобное)
В статье стоило уточнить, что речь именно про второе. Код библиотек нуждается в сильно более полном покрытии тестами. Если кто-то поверит статье и протестирует библиотеку по принципу «нет смысла покрывать юнит-тестами тривиальный код», он с крайне высокой вероятностью столкнется с проблемами в будущем.
Также не совсем ясно, зачем автор вводит новую терминологию, вроде «общительных» тестов. Чем не устраивают классические e2e-тесты?
Ну и в статье из рубрики «как тестировать» я бы ожидал увидеть больше «мяса»: какие бывают метрики тестирования, как писать тестируемый код и так далее.
Вроде что-то прочитал, а вроде и вода-водой.
возможно мы в пузыре пузырей
Если уж рекламируете свои сервера с почасовой оплатой, показали бы, как поднимать такой сервер через API из кода, чтобы не тыкать ручками в интерфейсе, а делать все программно по потребности.
Разве тут не написано 3 раза одно и то же?
Ну и по статье я так и не понял, чем же эти новые процессоры лучше старых, хотя бы в перспективе и в теории.
Mermaid умеет рендериться только на десктопном гитхабе. Гитхаб-мобайл не умеет отображать эти схемы.
На малинах будет работать?
Надпись "Как мы делаем Яндекс" под этой статьей особенно символична.
Проект выглядит охренительно, жаль я вообще из другой области, но звездочку занес.