YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

TinyChat-0.1B

TinyChat 是一个轻量级的大语言模型,采用现代化的 Transformer 架构设计。

模型特性

  • 参数量: 约 0.1B (100M)
  • 架构: Decoder-only Transformer
  • 注意力机制: Grouped Query Attention (GQA)
  • 位置编码: Rotary Position Embedding (RoPE)
  • 归一化: RMSNorm
  • 激活函数: SiLU (Swish)
  • 词汇表大小: 6,400
  • 最大序列长度: 1,024 tokens

模型配置

- Layers: 12
- Hidden Size: 768
- Attention Heads: 16 (Query) / 4 (Key-Value)
- FFN Hidden Size: 3,072
- Dropout: 0.1

使用方法

安装依赖

pip install transformers torch

加载模型

from transformers import AutoTokenizer, AutoModelForCausalLM

# 加载模型(需要设置 trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    "tutututu1998/TinyChat-0.1B",
    trust_remote_code=True
)

# 加载 tokenizer
tokenizer = AutoTokenizer.from_pretrained(
    "tutututu1998/TinyChat-0.1B",
    trust_remote_code=True
)

# 生成文本
inputs = tokenizer("你好,", return_tensors="pt")
outputs = model.generate(
    **inputs,
    max_length=50,
    temperature=0.7,
    do_sample=True
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

批量生成

texts = ["你好,", "今天天气", "人工智能"]
inputs = tokenizer(texts, return_tensors="pt", padding=True)
outputs = model.generate(**inputs, max_length=50)

for i, output in enumerate(outputs):
    print(f"输入 {i+1}: {texts[i]}")
    print(f"输出 {i+1}: {tokenizer.decode(output, skip_special_tokens=True)}")
    print("-" * 50)

使用 KV Cache 加速推理

# 首次生成
inputs = tokenizer("你好,", return_tensors="pt")
outputs = model.generate(
    **inputs,
    max_length=50,
    use_cache=True  # 启用 KV cache
)

技术细节

Grouped Query Attention (GQA)

TinyChat 使用 GQA 来减少 KV cache 的内存占用:

  • Query heads: 16
  • Key-Value heads: 4
  • 每个 KV head 被 4 个 Query heads 共享

Rotary Position Embedding (RoPE)

使用 RoPE 实现位置编码,参数:

  • Base frequency (theta): 1,000,000
  • 支持长度外推

训练信息

[在此添加训练数据集、训练步数、超参数等信息]

限制与注意事项

  • 这是一个小型模型(0.1B 参数),能力有限
  • 主要用于教学和研究目的
  • 可能存在常见的语言模型问题(如幻觉、重复等)

许可证

[添加你的许可证信息]

引用

如果你使用了这个模型,请引用:

@misc{tinychat2024,
  author = {Your Name},
  title = {TinyChat: A Lightweight Language Model},
  year = {2024},
  publisher = {HuggingFace},
  howpublished = {\url{https://huggingface.co/your-username/TinyChat-0.1B}}
}

联系方式

[添加你的联系方式或 GitHub 链接]

Downloads last month
7
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support