Falcon-7B OpenVINO (INT8)

OpenVINO IR conversion of tiiuae/falcon-7b with weight-only INT8 quantization, produced on CPU-only Kaggle with optimum-cli (fully offline, token-free).

  • Base model: tiiuae/falcon-7b (FalconForCausalLM, 7.0B params, Apache-2.0)
  • Task: text-generation
  • Precision: weights INT8 (NNCF), activations FP16/FP32 as traced
  • Converted with: optimum-intel 2.2.0, openvino 2026.4.1, transformers 5.16.1
  • Contents: openvino_model.xml/.bin, openvino_tokenizer.xml/.bin, openvino_detokenizer.xml/.bin, tokenizer assets, configs

Usage

optimum-intel

from optimum.intel import OVModelForCausalLM
from transformers import AutoTokenizer

model = OVModelForCausalLM.from_pretrained("Nekodeus/falcon-7b-openvino")
tok = AutoTokenizer.from_pretrained("Nekodeus/falcon-7b-openvino")
inputs = tok("The capital of France is", return_tensors="pt")
print(tok.decode(model.generate(**inputs, max_new_tokens=32)[0]))

OpenVINO GenAI

ov::genai::LLMPipeline pipe("path/to/Nekodeus/falcon-7b-openvino", "CPU");

Reproduce

optimum-cli export openvino \
  --model tiiuae/falcon-7b \
  --task text-generation \
  --weight-format int8 \
  falcon-7b-openvino
Downloads last month
20
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support