Spaces:
Running on Zero
Running on Zero
File size: 953 Bytes
314dd56 25be645 41afbd4 06e4857 41afbd4 06e4857 25be645 2a0ccb8 41afbd4 314dd56 8888f77 2a0ccb8 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 | import gradio as gr
import spaces
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
# 1. Modeli ve Tokenizer'ı standart yöntemle yüklüyoruz (CPU'da bekliyor)
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
@spaces.GPU
def generate_response(prompt):
# 2. İstek geldiğinde veriyi ve modeli RTX 6000'e (cuda) taşıyoruz
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
model.to("cuda")
# 3. Üretimi tetikliyoruz
outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7, do_sample=True)
# 4. Sistemin senin prompt'unu tekrar etmesini engelleyip sadece cevabı alıyoruz
response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
return response
demo = gr.Interface(fn=generate_response, inputs="text", outputs="text")
demo.launch() |