File size: 953 Bytes
314dd56
25be645
41afbd4
06e4857
41afbd4
 
 
 
 
06e4857
25be645
2a0ccb8
41afbd4
 
 
 
 
 
 
 
 
 
314dd56
8888f77
2a0ccb8
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
import gradio as gr
import spaces
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Qwen/Qwen2.5-0.5B-Instruct"

# 1. Modeli ve Tokenizer'ı standart yöntemle yüklüyoruz (CPU'da bekliyor)
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

@spaces.GPU
def generate_response(prompt):
    # 2. İstek geldiğinde veriyi ve modeli RTX 6000'e (cuda) taşıyoruz
    inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
    model.to("cuda")
    
    # 3. Üretimi tetikliyoruz
    outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7, do_sample=True)
    
    # 4. Sistemin senin prompt'unu tekrar etmesini engelleyip sadece cevabı alıyoruz
    response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
    return response

demo = gr.Interface(fn=generate_response, inputs="text", outputs="text")
demo.launch()