EditorIA on-device models
Modelos ONNX para inferencia local en Android. Las fotografías no se envían a este repositorio ni a ningún servicio remoto.
Archivos
lama_fp32.onnx- Big-LaMa completo en FP32. Lo usa Borrar objeto.
- 208044816 bytes.
- SHA-256
1faef5301d78db7dda502fe59966957ec4b79dd64e16f03ed96913c7a4eb68d6. - Apache-2.0.
big-lama-512-fp16.onnx- Big-LaMa con convoluciones y pesos FP16, interfaz y Fourier FP32.
- 109398440 bytes.
- SHA-256
188770e3c5296a3c95b5d97903d4cf61b1229f77cc9e9a81af27b8bc80352376. - Apache-2.0.
realesr-general-x4v3.onnx- 4866417 bytes.
- SHA-256
1940a93ee08283a0a7286183186357b1688fe9fa8ede74604b424586aaddf112. - BSD-3-Clause.
realesr-general-wdn-x4v3.onnx- 4868759 bytes.
- SHA-256
5073c57599850fe59320473ab5e07a91ac7de3af916ef44d5eef2218c7d0b33a. - BSD-3-Clause.
sd15-clip-vocab.json- Vocabulario CLIP, copiado sin cambios.
- 1059962 bytes.
- SHA-256
e089ad92ba36837a0d31433e555c8f45fe601ab5c221d4f607ded32d9f7a4349. - MIT.
sd15-clip-merges.txt- Merges del tokenizador CLIP, copiado sin cambios.
- 524619 bytes.
- SHA-256
9fd691f7c8039210e0fced15865466c65820d09b63988b0174bfe25de299051a. - MIT.
sd15-text-encoder-fp16.onnx- Codificador de texto de Stable Diffusion 1.5. Pesos FP16, entrada y salida
FP32. Entrada
input_idsint64[1, 77], salidalast_hidden_state[1, 77, 768]. - 246305776 bytes.
- SHA-256
46490b84e43717eef9b235fb9de6659da846a576ee544b46cc826b177e617136. - MIT. Son los pesos del codificador de texto CLIP incluidos en el checkpoint.
- Codificador de texto de Stable Diffusion 1.5. Pesos FP16, entrada y salida
FP32. Entrada
sd15-vae-decoder-fp16.onnx- Solo el decodificador VAE. Los pesos grandes se guardan en FP16 y se
convierten a FP32 antes de cada convolución. Entrada
latent_sample, salidasample, ambas FP32. No incluye la escala 0.18215: la aplica la app. - 99174193 bytes.
- SHA-256
97062d589ee6d828521951ba3b7eaf5d4fa0e4ce85292804dc41c352ac277a47. - CreativeML OpenRAIL-M.
- Solo el decodificador VAE. Los pesos grandes se guardan en FP16 y se
convierten a FP32 antes de cada convolución. Entrada
sd15-unet-int8-lcm.onnx- UNet de Stable Diffusion 1.5 con el LoRA LCM de 4 pasos ya fusionado.
Pesos INT8 con
DequantizeLinear; activaciones, entradas y salida en FP32. Entradassample,timestepyencoder_hidden_states. Salidaout_sample. Alto y ancho del latente son dinámicos (48 o 64). - 864392265 bytes.
- SHA-256
b8a84f1bdd6f518d42b1af06fb687ff0f5709850ad9329c5a5484c3b2ed2266d. - CreativeML OpenRAIL-M.
- UNet de Stable Diffusion 1.5 con el LoRA LCM de 4 pasos ya fusionado.
Pesos INT8 con
Procedencia
- LaMa: https://github.com/advimman/lama
- Exportación Big-LaMa ONNX de referencia: https://huggingface.co/Carve/LaMa-ONNX
- Real-ESRGAN: https://github.com/xinntao/Real-ESRGAN
- Checkpoint de Stable Diffusion 1.5, archivo
v1-5-pruned-emaonly.safetensors, y tokenizador CLIP de ese mismo repositorio: https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-v1-5 - LoRA fusionado en el UNet,
pytorch_lora_weights.safetensors: https://huggingface.co/latent-consistency/lcm-lora-sdv1-5 - Licencia CreativeML OpenRAIL-M, texto del 22 de agosto de 2022 publicado con
Stable Diffusion:
https://github.com/CompVis/stable-diffusion/blob/main/LICENSE
La copia que acompaña a este repositorio es
LICENSE-OPENRAIL-M.txt.
El tokenizador y el codificador de texto salen de CLIP (OpenAI, MIT). El decodificador VAE y el UNet salen del checkpoint de Stable Diffusion 1.5 y se distribuyen bajo CreativeML OpenRAIL-M. El UNet además incorpora los pesos del LoRA LCM; al ser un derivado de Stable Diffusion 1.5, conserva las restricciones de uso de OpenRAIL-M.
Big-LaMa fue validado numéricamente contra el ONNX FP32: error absoluto medio
0.013547, error medio relativo 0.000098.
El código y los pesos conservan sus licencias originales.