Bilgisayarlı Görü Türkçe BPE Tokenizer
Bu tokenizer, bilgisayarlı görü alanındaki Türkçe soru-cevap kayıtlarından sıfırdan eğitilmiş özel bir Byte-Level BPE tokenizer'dır.
Veri seti
Tokenizer eğitiminde Ödev 1 kapsamında hazırlanan bilgisayarlı görü veri setinin ham metinleri kullanılmıştır.
- Eğitim corpus'u: 2 benzersiz metin
- Alan: Bilgisayarlı görü
- Dil: Türkçe
- Veri biçimleri: Soru-cevap ve konuşma kayıtları
Tokenizer özellikleri
- Algoritma: Byte-Level BPE
- İstenen vocabulary boyutu: 8000
- Gerçek vocabulary boyutu: 306
- Minimum token frekansı: 2
- Maksimum dizi uzunluğu: 512
- Normalizasyon: Unicode NFC
- Pre-tokenizer: ByteLevel
- Decoder: ByteLevel
Özel tokenlar
<pad>: padding<unk>: bilinmeyen token<bos>: metin başlangıcı<eos>: metin sonu<|system|>: sistem mesajı<|user|>: kullanıcı mesajı<|assistant|>: asistan mesajı
Kullanım
from transformers import AutoTokenizer
repo_id = "kiyran/bilgisayarli-goru-bpe-tokenizer"
tokenizer = AutoTokenizer.from_pretrained(
repo_id
)
text = "Bilgisayarlı görü nedir?"
encoding = tokenizer(
text,
add_special_tokens=True
)
print(encoding["input_ids"])
print(
tokenizer.convert_ids_to_tokens(
encoding["input_ids"]
)
)
Önemli not
Bu tokenizer, mevcut Qwen3 modelinin tokenizer'ının doğrudan yerine kullanılmamalıdır. Tokenizer'ın vocabulary yapısına göre yeni bir modelin embedding katmanı oluşturulmalı veya model bu tokenizer ile yeniden eğitilmelidir.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support