Text-to-Image
Diffusers
Safetensors
English
Chinese
QwenImage21Pipeline
bitsandbytes
int8
image-generation
image-editing
rgba
8-bit precision
Instructions to use ixim/Image21-INT8 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use ixim/Image21-INT8 with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("ixim/Image21-INT8", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Draw Things
- DiffusionBee
|
Download cards/modelscope.md from ixim/Image21-INT8: direct link, hf CLI and curl.
- Browser
- Download file 5.32 kB
-
https://huggingface.co/ixim/Image21-INT8/resolve/main/cards/modelscope.md
- Command line
-
hf download hf://ixim/Image21-INT8/cards/modelscope.md
-
curl -L -o modelscope.md https://huggingface.co/ixim/Image21-INT8/resolve/main/cards/modelscope.md
5.32 kB
| license: other | |
| license_name: qwen-research | |
| license_link: LICENSE | |
| base_model: Qwen/Qwen-Image-2.1 | |
| base_model_relation: quantized | |
| library_name: diffusers | |
| pipeline_tag: text-to-image | |
| language: | |
| - zh | |
| - en | |
| tags: | |
| - diffusers | |
| - bitsandbytes | |
| - int8 | |
| - image-generation | |
| - image-editing | |
| - rgba | |
| # Image21-INT8 | |
| **Built with Qwen。** 由 **iximbox** 制作的 | |
| [Qwen-Image-2.1](https://modelscope.cn/models/Qwen/Qwen-Image-2.1) | |
| 社区 INT8 量化衍生版本,面向 Diffusers / Python 推理,不属于 Qwen 官方发布。 | |
| ## 量化说明 | |
| 基模型固定版本:`b3179ad355be050328e483a9dfdd9e60cd62adfa`(Hugging Face)。 | |
| 两平台官方权重经过 SHA256 一致性核验。 | |
| 生成 Transformer 与 Qwen3-VL 文本编码器中适用的线性层采用 | |
| **bitsandbytes LLM.int8**,离群值阈值为 **6.0**。这属于混合精度推理: | |
| 离群值计算使用浮点精度,VAE、归一化、嵌入、视觉编码器、输出头及排除的 | |
| 条件投影层保留浮点精度。具体覆盖范围见两个组件的量化 JSON 报告。 | |
| 未进行微调,无需校准数据集。此模型不是全链路 W8A8、FP8 或 GGUF 模型。 | |
| 体积减小不等于推理加速,速度以实际测评为准。 | |
| ## 安装与使用 | |
| 测试环境为 Python 3.13、PyTorch 2.10.0+cu128 和 RTX 5090。 | |
| `requirements.txt` 固定了本次验证使用的官方 Diffusers 提交及主要依赖。 | |
| ```bash | |
| pip install torch==2.10.0 torchvision==0.25.0 --index-url https://download.pytorch.org/whl/cu128 | |
| pip install -r requirements.txt | |
| ``` | |
| ```python | |
| import torch | |
| import sys | |
| from modelscope import snapshot_download | |
| model_dir = snapshot_download("iximbox/Image21-INT8") | |
| sys.path.insert(0, model_dir) # 仓库附带、可查看的 scripts/runtime.py | |
| from scripts.runtime import load_int8_pipeline | |
| pipe = load_int8_pipeline(model_dir, local_files_only=True) | |
| image = pipe( | |
| prompt='一张咖啡馆海报,清晰写着“慢下来,喝杯咖啡”,暖色摄影', | |
| width=1024, height=1024, num_inference_steps=40, | |
| true_cfg_scale=1.0, use_kv_cache=True, | |
| generator=torch.Generator("cpu").manual_seed(42), | |
| ).images[0] | |
| image.save("output.png") | |
| ``` | |
| 加载时会自动读取已保存的量化配置,无需再次指定量化参数。 | |
| 图像编辑请使用与源图独立的种子(如源图为 42 时编辑用 1000042), | |
| 从 `output_resolution=1024` 起步。下文 2048px 部分为历史证据,不是通用推荐。 | |
| 透明图生成使用官方 RGBA 提示词格式,并保存为 PNG 以保留透明通道。 | |
| 在固定版本环境下请使用仓库附带的加载函数:它依次加载并卸载两个 INT8 组件, | |
| 同时在 CPU 卸载时移动量化层的辅助张量。仅调用 `enable_model_cpu_offload()` | |
| 会在本次测试的软件组合中留下 INT8 CUDA 张量。该加载函数不修改权重或量化方式。 | |
| ## 可视化 Web 应用 | |
| 另行开源的 [IMGEN](https://github.com/iXimNet/IMGEN) 支持使用 BF16、INT8 和 INT4 模型进行生图与改图。安装与使用说明见其 GitHub 仓库。 | |
| ## 随模型发布的非正式测评报告 | |
| **本次测评由社区发布者自行开展,仅供参考,不代表 Qwen、Hugging Face、ModelScope 及其团队的任何官方评价。** 结果来自单一软硬件配置下的少量自选样本,不属于标准榜单成绩,也不构成质量、速度或显存需求的保证。 | |
| {{EVALUATION_ZH}} | |
| **观察到的限制:** 两种精度的 1024px 毛衣改色均有明显过度锐化和对比度变化,所检查的中文海报均添加了多余页脚文字,2048px 雪林背景替换在两种精度中也均未达到目标。下文保留这些失败结果。像素差异仅反映偏移,不能等同于语义质量;本次不提供官方分数、盲测偏好、OCR、CLIP 或 FID 成绩。大量多图参考、其他显卡/注意力后端及 ComfyUI 兼容性不在本次测评范围内。 | |
| {{SAMPLES_ZH}} | |
| {{AUDIT_ZH}} | |
| ### 测量方法与指标详情 | |
| 1024px 主评测包含七类用例,每类两个种子;成年女性肖像专项与 2048px 改图组单独统计。每种精度使用独立进程,前一进程退出后再启动下一进程,并记录 PID、GPU 进程列表、启动时零分配及逐图 CUDA 基线。两种精度均使用仓库附带的 CPU 卸载辅助函数。 | |
| 成对调用采用相同输入、提示词、CPU 随机数生成器、种子、尺寸、40 步、CFG=1 和 KV 缓存。计时组各执行一次完整设置预热,不计入结果;先运行 BF16,再运行 INT8,每个用例/种子计时一次,未估计置信区间;桌面后台活动未严格控制,单次耗时仅供参考。耗时包含编码、去噪、解码和 CPU 传输,不包含模型加载及图片写盘。显存为进程内 PyTorch CUDA 已分配/保留峰值,不是整卡占用,也不能等同于最低显卡容量;仅在 RTX 5090 上实测。 | |
| {{EVALUATION_DETAILS_ZH}} | |
| ## 许可证与修改声明 | |
| 权重沿用 [Qwen Research License Agreement](LICENSE),仅用于非商业研究与评测; | |
| 商业使用需向原许可方另行申请。再分发须保留原协议、归属及修改说明。 | |
| 详见 [Notice](Notice) 和 [CHANGES.md](CHANGES.md)。 | |
| 原始模型:[ModelScope](https://modelscope.cn/models/Qwen/Qwen-Image-2.1) | | |
| [Hugging Face](https://huggingface.co/Qwen/Qwen-Image-2.1)。 | |