cisimcik-4b

English Türkçe

cisimcik-4b

cisimcik-4b, Türkçe öncelikli data ile cisimcik-base modelinin 5 aşamada post-train'lenmiş halidir. Hibrit düşünme ve tool kullanımı destekler ve sadece yazı input'u kabul eder.

  • 4,2 milyar parametre. Qwen3.5 hibrit mimarisi (Gated DeltaNet + full attention).
  • Hibrit düşünme. Düşünme modu açıkken model her turda düşünüp düşünmeyeceğine (reasoning) kendisi karar verir.
  • Tool kullanımı, chat template üzerinden ve Qwen3.5'in XML biçiminde.
  • Apache 2.0 lisansıyla açık kaynak olarak yayınlandı.

Hızlı başlangıç

pip install "transformers>=5.17" torch
# isteğe bağlı, NVIDIA GPU'larda daha hızlı Gated DeltaNet kernel'leri:
pip install flash-linear-attention
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

tok = AutoTokenizer.from_pretrained("cisimcik/cisimcik-4b")
model = AutoModelForCausalLM.from_pretrained("cisimcik/cisimcik-4b", dtype=torch.bfloat16)
model = model.to("cuda" if torch.cuda.is_available() else "cpu").eval()

messages = [{"role": "user", "content": "Bir manav 3 kg elmayı 75 TL'ye satıyor. 8 kg elma alan biri 50 TL indirim alırsa kaç TL öder?"}]
prompt = tok.apply_chat_template(messages, add_generation_prompt=True, tokenize=False, enable_thinking=True)
inputs = tok(prompt, return_tensors="pt", add_special_tokens=False).to(model.device)
out = model.generate(**inputs, max_new_tokens=4096, do_sample=True, temperature=0.6, top_p=0.95, top_k=20)

text = tok.decode(out[0, inputs["input_ids"].shape[1]:], skip_special_tokens=True)
reasoning, _, answer = text.rpartition("</think>")
print(answer.strip())

Düşünme. enable_thinking=True ile yanıtta önce düşünce, sonra </think>, sonra cevap gelir. Model bir turda düşünmeye gerek görmezse düşünce kısmı boş kalır. enable_thinking=False ile düşünmeyi atlayarak cevap verir.

Sampling. Qwen'in önerdiği ayarları kullanıyoruz: Düşünme açıkken temperature 0.6, top_p 0.95, top_k 20. Düşünme kapalıyken temperature 0.7, top_p 0.8, top_k 20.

Donanım. Ağırlıklar bf16'da yaklaşık 8,4 GB: 12 GB veya üzeri belleğe sahip herhangi bir GPU ya da 16 GB RAM'li bir CPU yeterlidir. flash-linear-attention kurulu değilse Gated DeltaNet katmanları transformers'ın PyTorch uygulamasını kullanır. Bu doğru sonuç verir ama uzun prompt'larda daha yavaştır.

Araç çağırma

Araçları chat template'e verin:

tools = [{
    "type": "function",
    "function": {
        "name": "hava_durumu",
        "description": "Bir şehrin güncel hava durumunu verir.",
        "parameters": {"type": "object", "properties": {"sehir": {"type": "string"}}, "required": ["sehir"]},
    },
}]
messages = [{"role": "user", "content": "İzmir'de şu an hava nasıl?"}]
prompt = tok.apply_chat_template(messages, tools=tools, add_generation_prompt=True, tokenize=False, enable_thinking=False)

Tool kullanımı şu şekilde görünür:

<tool_call>
<function=hava_durumu>
<parameter=sehir>
İzmir
</parameter>
</function>
</tool_call>

Benchmark sonuçları

cisimcik-4b kıyaslama tablosu

Dosyalar

Dosya İçerik
model-0000*-of-00002.safetensors ağırlıklar (bf16)
config.json, generation_config.json Qwen3_5ForCausalLM config'i ve durdurma token'ları
tokenizer*.json, vocab.json, merges.txt Qwen3.5 tokenizer'ı ve chat template (düşünme, araçlar)

Lisans

Bu depodaki ağırlıklar Apache License 2.0 ile yayımlanmıştır (bkz. LICENSE ve NOTICE). Model, Qwen/Qwen3.5-4B-Base © 2026 Alibaba Cloud, Apache License 2.0 lisanslı modelin değiştirilmiş bir sürümüdür.

Atıf

@misc{cisimcik4b2026,
  title  = {cisimcik-4b: a Turkish-first chat model},
  author = {cisimcik},
  year   = {2026},
  url    = {https://huggingface.co/cisimcik/cisimcik-4b}
}
Downloads last month
823
Safetensors
Model size
4B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 3 Ask for provider support

Model tree for cisimcik/cisimcik-4b

Finetuned
(2)
this model
Quantizations
1 model

Dataset used to train cisimcik/cisimcik-4b

Evaluation results