Jit-Roy/weellm: WeeLLM is a layer-streaming inference engine for large diffusion models (FLUX.2, Z-Image-Turbo, SDXL, SD1.5) that runs on under 4GB VRAM with zero quantization, streaming one transformer layer at a time directly from Hugging Face safetensors files.
WeeLLM is a layer-streaming inference engine for large diffusion models (FLUX.2, Z-Image-Turbo, SDXL, SD1.5) that runs on under 4GB VRAM with zero quantization, streaming one trans...