Это небольшая демонстрационная модель. Проверяйте факты и численные результаты.
Как разместить и как это работает
Загрузите llm-chat.html в папку сайта и откройте его адрес по HTTPS. Веб-сервер раздаёт страницу, а модель отвечает в браузере посетителя. Серверу не нужны Python, PHP, Node.js или видеокарта. Сохраняйте файл в UTF-8; рекомендуемый HTTP-заголовок: Content-Type: text/html; charset=utf-8.
Библиотека загружается с jsDelivr, а при его недоступности с unpkg. Файлы модели загружаются с Hugging Face. Текст вопросов и ответов код этого примера не отправляет на сервер. Если кеш браузера недоступен, модель загружается без сохранения для следующего запуска. Это позволяет использовать процессорный режим и по HTTP. Доступный кеш ускоряет повторную загрузку; браузер может очистить его. Для загрузки страницы и библиотек по-прежнему может потребоваться интернет.
Автоматический режим выбирает WebGPU при его доступности, иначе использует процессор. Если драйвер или память не позволяют запустить модель на WebGPU, выберите «Процессор · CPU» и загрузите её повторно. В истории запроса сохраняются до четырёх последних пар сообщений; при превышении лимита контекста старые пары исключаются. Слишком длинный отдельный вопрос нужно сократить.
CUDA в HTML подключать не требуется. WebGPU использует графический интерфейс браузера; для него нужны поддерживаемая видеокарта, драйвер и аппаратное ускорение браузера. На сайте требуется HTTPS; локальный адрес http://127.0.0.1 также подходит. Даже в режиме WebGPU движок использует WebAssembly и оперативную память при подготовке модели. Сообщение Aborted() означает аварийную остановку и само по себе не доказывает нехватку памяти.
Кнопка остановки сначала запрашивает завершение генерации. Если вычисления не реагируют в течение двух секунд, фоновый поток завершается принудительно, после чего модель нужно загрузить заново. Вычислительные ресурсы освобождаются также при закрытии вкладки.
Используются Qwen3-0.6B в формате ONNX и Transformers.js 3.8.1. Режим дополнительных рассуждений отключён для более коротких ответов.