Планируется ли реализация спекулятивного декодирования mtp? Это запланировано.
Как увеличить контекст? Гибкое управление контекстом в разработке.
При загрузке большой модели типо qwen 3.6 27b или 35B пытается по таймауту переключится на CPU. Это уже исправлено и будет доступно в ближайшем обновлении.
На практике это ещё упирается в стратегию выборки: агент должен решать не только что хранить, но и что поднимать в контекст сейчас — и тут время часто важнее, чем семантическая близость.
Чувствую что это будет горячая неделя )
Сейчас как раз занимаюсь оптимизацией контекста и памятью агента, будет решено в ближайших обновлениях.
Спасибо за отзыв!
Используется llama.cpp
Планируется ли реализация спекулятивного декодирования mtp?
Это запланировано.
Как увеличить контекст?
Гибкое управление контекстом в разработке.
При загрузке большой модели типо qwen 3.6 27b или 35B пытается по таймауту переключится на CPU.
Это уже исправлено и будет доступно в ближайшем обновлении.
А что именно взлетит в космос?
С OpenRouter отлично работает.
Телеграм пока не планирую.
Mac на Intel не поддерживается
На практике это ещё упирается в стратегию выборки: агент должен решать не только что хранить, но и что поднимать в контекст сейчас — и тут время часто важнее, чем семантическая близость.
Векторная база решает немного другую задачу - поиск по сходству (semantic retrieval).
Это удобно, когда нужно “вспомнить что-то похожее”.
А граф — это уже про структуру и связи:
кто с кем связан, что от чего зависит, какие есть состояния и переходы.
Условно:
векторка отвечает на вопрос “что похоже на это?”
граф отвечает на вопрос “как это связано и что из этого следует?”
В реальных агентах они часто комбинируются:
векторка — для retrieval, граф — для логики/контекста.
Написать, согласен.
Вопрос в том, как он будет себя вести на длинных и неочевидных задачах.
На практике:
без нормального управления памятью агент “плывёт”
без стратегии декомпозиции - тупит на сложных задачах
без валидации - уверенно врёт
Поэтому большинство таких решений остаются “игрушками под себя”, а не универсальными инструментами.
От 8гб
Попробуй новую версию 1.5.6 там исправлено
В новой версии добавлено управление контекстом так что должно быть нормально
Ок тоже сделаю
Сделаю в ближайшее время
Нет, к сожалению, без avx2 не заработает.
Да уже в курсе этой проблемы, на днях выпущу версию в которой это исправлено.
Исправлено в новой версии 1.5.1
Исправлено в версии 1.5.1
Да, похоже по железу несовместимость вылезла какая-то
Проект не на питоне, но спасибо за наводку