Перейти до основного вмісту

LLiMa інтерфейс командного рядка.

Використовуйте llima у командному рядку на Modalix, щоб керувати попередньо скомпільованими моделями та виконувати просте тестування в середовищі виконання. Це корисно для перевірки того, чи модель завантажується, чи приймає вона запити та чи генерує вихідні дані, перш ніж інтегрувати її з прямими API Neat Framework або кінцевими точками сервера Neat GenAI.

Керівник відділу моделювання.​

LLiMa містить менеджер моделей, доступ до якого здійснюється через llima CLI. Він дозволяє здійснювати пошук, завантаження, перегляд списку, видалення та запуск попередньо скомпільованих моделей безпосередньо з командного рядка. За замовчуванням моделі зберігаються в /media/nvme/llima/models. Щоб використовувати іншу директорію для моделей, встановіть LLIMA_MODELS_PATH.

Перегляньте доступні моделі:

modalix:~$ llima search
modalix:~$ llima search qwen

Завантажте модель за назвою, без зазначення префіксу організації simaai/:

modalix:~$ llima pull Qwen3-VL-4B-Instruct-GPTQ-a16w4

Артефакти моделі завантажуються одночасно, причому завантаження найбільших артефактів відбувається першим. Тимчасовий. HTTP у разі виникнення помилок спроби повторюються автоматично. Завантаження для однієї й тієї ж моделі виконуються послідовно, і скасування завантаження зберігає всі артефакти, які вже були завантажені та перевірені.

Перелік і видалення локально встановлених моделей:

modalix:~$ llima list
modalix:~$ llima rm Qwen3-VL-4B-Instruct-GPTQ-a16w4

Запуск LLiMa.​

Використовуйте llima run як просте середовище виконання для початкової перевірки моделі на Modalix.

У режимі командного рядка історія чату ввімкнена за замовчуванням. Кожен запит і відповідь зберігаються як контекст для наступного кроку, доки ви не очистите їх за допомогою clear history. Зображення, надіслані разом із запитом, також зберігаються як частина цієї історії. Команда clear history видаляє надіслані запити, відповіді та всі зображення. Налаштований системний запит залишається активним, доки ви не видалите його командою clear system або не заміните командою set system.

modalix:~$ llima run <model> [options]
АргументОпис.
modelІдентифікатор або шлях до моделі (наприклад, Qwen3-VL-8B-Instruct-a16w4).
--stt_model_pathШлях до файлів моделі для перетворення мовлення на текст (необов’язково).

Щоб переглянути всі доступні варіанти, виконайте команду llima run -h.

Щоб вимкнути автоматичне вивантаження вбудовувань і залишити таблиці в DRAM, виконайте SIMA_LLIMA_RUN_EMBEDDING_OFFLOAD=off llima run <model>.

Приклади

modalix:~$ llima run Qwen3-VL-4B-Instruct-GPTQ-a16w4

Інтерактивні команди​

Після запуску llima run у режимі командного рядка, використовуйте ці команди в командному рядку:

КомандаОпис.
add image <file>Додайте зображення до поточного контексту запиту.
set system <prompt>Встановіть системне повідомлення.
clear systemОчистіть системне повідомлення, історію чату та зображення.
clear historyВидалити надіслані запити, відповіді та всі зображення, зберігши системний запит.
print historyРоздрукувати історію чату.
set audio <file>Вкажіть аудіофайл, який потрібно транскрибувати, як запит.
set language <lang>Вкажіть мовну мітку, яка використовуватиметься для транскрипції.
set lora <name>Використовуйте ваги LoRA, що містяться в папці npy_files.
unset loraПоверніть LoRA модель до базової версії.
enable-thinkingУвімкніть режим обмірковування та очистіть історію чату.
disable-thinkingВимкніть режим обмірковування та очистіть історію чату.
quitЗавершити.
helpВивести список доступних команд.

Створіть застосунок за допомогою Neat.​

Після перевірки вашої моделі за допомогою llima run, перегляньте GenAI Model, щоб використовувати її через стандартні API-інтерфейси або безпосередньо з програми, написаної на C++ або Python.