benim-api / app.py
ghosttech's picture
Update app.py
41afbd4 verified
Raw
History Blame Contribute Delete
953 Bytes
import gradio as gr
import spaces
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
# 1. Modeli ve Tokenizer'ı standart yöntemle yüklüyoruz (CPU'da bekliyor)
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
@spaces.GPU
def generate_response(prompt):
# 2. İstek geldiğinde veriyi ve modeli RTX 6000'e (cuda) taşıyoruz
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
model.to("cuda")
# 3. Üretimi tetikliyoruz
outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7, do_sample=True)
# 4. Sistemin senin prompt'unu tekrar etmesini engelleyip sadece cevabı alıyoruz
response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
return response
demo = gr.Interface(fn=generate_response, inputs="text", outputs="text")
demo.launch()