Falcon-7B OpenVINO (INT8)
OpenVINO IR conversion of tiiuae/falcon-7b with weight-only INT8 quantization, produced on CPU-only Kaggle with optimum-cli (fully offline, token-free).
- Base model:
tiiuae/falcon-7b(FalconForCausalLM, 7.0B params, Apache-2.0) - Task:
text-generation - Precision: weights INT8 (NNCF), activations FP16/FP32 as traced
- Converted with:
optimum-intel 2.2.0,openvino 2026.4.1,transformers 5.16.1 - Contents:
openvino_model.xml/.bin,openvino_tokenizer.xml/.bin,openvino_detokenizer.xml/.bin, tokenizer assets, configs
Usage
optimum-intel
from optimum.intel import OVModelForCausalLM
from transformers import AutoTokenizer
model = OVModelForCausalLM.from_pretrained("Nekodeus/falcon-7b-openvino")
tok = AutoTokenizer.from_pretrained("Nekodeus/falcon-7b-openvino")
inputs = tok("The capital of France is", return_tensors="pt")
print(tok.decode(model.generate(**inputs, max_new_tokens=32)[0]))
OpenVINO GenAI
ov::genai::LLMPipeline pipe("path/to/Nekodeus/falcon-7b-openvino", "CPU");
Reproduce
optimum-cli export openvino \
--model tiiuae/falcon-7b \
--task text-generation \
--weight-format int8 \
falcon-7b-openvino
- Downloads last month
- 20