Bilgisayarlı Görü Türkçe BPE Tokenizer

Bu tokenizer, bilgisayarlı görü alanındaki Türkçe soru-cevap kayıtlarından sıfırdan eğitilmiş özel bir Byte-Level BPE tokenizer'dır.

Veri seti

Tokenizer eğitiminde Ödev 1 kapsamında hazırlanan bilgisayarlı görü veri setinin ham metinleri kullanılmıştır.

  • Eğitim corpus'u: 2 benzersiz metin
  • Alan: Bilgisayarlı görü
  • Dil: Türkçe
  • Veri biçimleri: Soru-cevap ve konuşma kayıtları

Tokenizer özellikleri

  • Algoritma: Byte-Level BPE
  • İstenen vocabulary boyutu: 8000
  • Gerçek vocabulary boyutu: 306
  • Minimum token frekansı: 2
  • Maksimum dizi uzunluğu: 512
  • Normalizasyon: Unicode NFC
  • Pre-tokenizer: ByteLevel
  • Decoder: ByteLevel

Özel tokenlar

  • <pad>: padding
  • <unk>: bilinmeyen token
  • <bos>: metin başlangıcı
  • <eos>: metin sonu
  • <|system|>: sistem mesajı
  • <|user|>: kullanıcı mesajı
  • <|assistant|>: asistan mesajı

Kullanım

from transformers import AutoTokenizer

repo_id = "kiyran/bilgisayarli-goru-bpe-tokenizer"

tokenizer = AutoTokenizer.from_pretrained(
    repo_id
)

text = "Bilgisayarlı görü nedir?"

encoding = tokenizer(
    text,
    add_special_tokens=True
)

print(encoding["input_ids"])
print(
    tokenizer.convert_ids_to_tokens(
        encoding["input_ids"]
    )
)

Önemli not

Bu tokenizer, mevcut Qwen3 modelinin tokenizer'ının doğrudan yerine kullanılmamalıdır. Tokenizer'ın vocabulary yapısına göre yeni bir modelin embedding katmanı oluşturulmalı veya model bu tokenizer ile yeniden eğitilmelidir.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support