Ноутбук lenovo с Intel core 9 285h ai npu на борту и возможностью подключения внешней видеокарты через oculink, дома как раз она крутится, в дороге встроенный CPU с ядрами GPU и Npu.
Под мои задачи удачно вписывается модели уровня oss20b. Даже если 35b и получилось бы закрутить, то 32gb ОЗУ свели бы попытку на нет)
Сколько не пробовал npu, пользу смог только на одном из этапов диаризации говорящих выявить. В остальных случаях сколько не гонял, всегда получалось что встроенный процессор GPU 140t обходит ядра npu раз в 10 по скорости, при этом не имеет ограничений по весу моделей.
NPU крайне сырая технология, и изначально она создавалась не под современные LLM с огромными матричными весами и сложным attention, а под более простые и хорошо распараллеливаемые нейросетевые вычисления вроде распознавание изображений и речи.
Хотя может дело в том, что встройка в процессоре спокойно дает играть в игры уровня atomic heart :)
А по поводу контекста, то можно бить обработку на батчи и скармливать по 4к-8к, а не 32к контекст за раз передавая потом результат обработки кусочков на итоговый шаг обработки. Для экономии памяти. Но это страдания, когда ОЗУ 32gb, при ваших 64gb уже не актуальны)
Я в другую сторону подзаморочился.
Ноутбук lenovo с Intel core 9 285h ai npu на борту и возможностью подключения внешней видеокарты через oculink, дома как раз она крутится, в дороге встроенный CPU с ядрами GPU и Npu.
Под мои задачи удачно вписывается модели уровня oss20b. Даже если 35b и получилось бы закрутить, то 32gb ОЗУ свели бы попытку на нет)
Сколько не пробовал npu, пользу смог только на одном из этапов диаризации говорящих выявить. В остальных случаях сколько не гонял, всегда получалось что встроенный процессор GPU 140t обходит ядра npu раз в 10 по скорости, при этом не имеет ограничений по весу моделей.
NPU крайне сырая технология, и изначально она создавалась не под современные LLM с огромными матричными весами и сложным attention, а под более простые и хорошо распараллеливаемые нейросетевые вычисления вроде распознавание изображений и речи.
Хотя может дело в том, что встройка в процессоре спокойно дает играть в игры уровня atomic heart :)
А по поводу контекста, то можно бить обработку на батчи и скармливать по 4к-8к, а не 32к контекст за раз передавая потом результат обработки кусочков на итоговый шаг обработки. Для экономии памяти. Но это страдания, когда ОЗУ 32gb, при ваших 64gb уже не актуальны)