WebLLM یک موتور اجرای درونمرورگری برای مدلهای زبانی بزرگ با عملکرد بالا است که با استفاده از شتابدهی سختافزاری WebGPU، محاسبات را مستقیماً در مرورگر انجام میدهد. این پروژه کاملاً با API OpenAI سازگار است و امکان استفاده از همان API برای مدلهای متنباز محلی را با قابلیتهایی مانند استریم، حالت JSON و فراخوانی توابع (در حال توسعه) فراهم میکند. WebLLM از مدلهای متنوعی مانند Llama 3، Phi 3، Gemma، Mistral، Qwen و بسیاری دیگر پشتیبانی میکند و امکان ادغام مدلهای سفارشی در قالب MLC را نیز دارد. این پروژه به عنوان یک بستهی npm در دسترس است و میتوان آن را به برنامههای وب سفارشی پیوند داد؛ همچنین از کار با Web Worker و Service Worker برای بهینهسازی عملکرد UI پشتیبانی میکند. قابلیت تولید JSON ساختاریافته نیز در بخش WebAssembly کتابخانهی مدل برای دستیابی به عملکرد بهینه پیادهسازی شده است. کاربران میتوانند از طریق پلاگینهای کروم نیز از WebLLM در مرورگرها استفاده کنند. این پروژه همراه با MLC LLM است و امکان استقرار جهانی مدلهای زبانی در محیطهای سختافزاری مختلف را فراهم میکند.