Ну и пара примеров «маленького» софта: VS Code 31 062 093 , Moodle 73 021 682
Цифры примерные, так как подходы к счёту токенов есть разные, как и к созданию файла с кодовой базой, но порядок величины можно узнать, хотя и различия в подходах будут составлять внушительное количество токенов (миллионы). В данном случае при подсчёте использовался такой подход: в начале файла дерево кодовой базы, далее с переносом строки содержимое всех файлов подряд (рекурсивный обход, как и в случае с деревом) в формате <file_name.file_extension>```\n<file_content>\n```\n\n, что добавляет лишние строки (например, количество строк для ядра Линукс выросло с реальных 30 млн (информация с Википедии) до 40 млн, следовательно выросло и количество токенов), но это необходимо для разделения содержимого файлов и общей «читаемости» файла со всей кодовой базой... Также можно было бы встраивать содержимое прямо в дерево, но это сделало бы дерево прерывистым и некрасивым.
Для контекста. Например, в ядре Линукс вот столько токенов на текущий момент, если взять всю кодовую базу в один файл и посчитать токенизатором для GPT-4o: 456 479 607
Это просто показывает, что иногда лучше подумать и придумать что-то новое, чем брать за основу то, что есть. Не знаю, на что должен быть похож идеальный язык разметки, но точно не на HTML
А давайте пофантазируем, каким бы вы хотели видеть такой язык? Что по вашему мнению достойно было бы занимать пьедестал всемирной путины, который сейчас занимает HTML? Вернее сказать — как оно должно было бы выглядеть?
Изначально я и хотел так написать...
Итак, я написал статью, если кому интересно: https://habr.com/ru/articles/875022/
Помощники уже есть. Далее — переход на автономные системы, которые повышают уровень абстракции ещё сильнее и убирают необходимость писать код.
Ну скиньте тогда через Pastebin, облачный диск какой-то, способов делиться кодом нынече масса...
Скорее «... ранее независимый математический бенчмарк... »
Ломать не строить...
Ну и пара примеров «маленького» софта: VS Code
31 062 093, Moodle73 021 682Цифры примерные, так как подходы к счёту токенов есть разные, как и к созданию файла с кодовой базой, но порядок величины можно узнать, хотя и различия в подходах будут составлять внушительное количество токенов (миллионы). В данном случае при подсчёте использовался такой подход: в начале файла дерево кодовой базы, далее с переносом строки содержимое всех файлов подряд (рекурсивный обход, как и в случае с деревом) в формате
<file_name.file_extension>```\n<file_content>\n```\n\n, что добавляет лишние строки (например, количество строк для ядра Линукс выросло с реальных 30 млн (информация с Википедии) до 40 млн, следовательно выросло и количество токенов), но это необходимо для разделения содержимого файлов и общей «читаемости» файла со всей кодовой базой... Также можно было бы встраивать содержимое прямо в дерево, но это сделало бы дерево прерывистым и некрасивым.Для контекста. Например, в ядре Линукс вот столько токенов на текущий момент, если взять всю кодовую базу в один файл и посчитать токенизатором для GPT-4o:
456 479 607Скиньте ссылку на репозиторий, пожалуйста
А давайте пофантазируем, каким бы вы хотели видеть такой язык? Что по вашему мнению достойно было бы занимать пьедестал всемирной путины, который сейчас занимает HTML? Вернее сказать — как оно должно было бы выглядеть?
Не понятно. Почему?
А почему? Кроме явной проблемы — подобный синтаксис не поддаётся минимизации — ничего на ум не приходит...
Собственно, трансформеры (GPT) и появились для перевода, но оказались полезны не только для этого...
Шаг за шагом помаленьку...
Такими темпами не будет больше задач миллениума
Разработка в принципе становится проще и доступнее
Правильно — их и не будет...
Само слово "саморазвитие" дискредитировали инфоцыгане
Trust-me-bro бенчмарк
o3