QuitérIA 2.0

QuitérIA 2.0 reúne dois classificadores BERT para apoiar a análise feminista de proposições legislativas brasileiras. Ambos foram ajustados a partir de neuralmind/bert-base-portuguese-cased e devem apoiar — não substituir — a validação humana por organizações parceiras.

Subpasta Tarefa Classes
tema Classificação de tema 10
favorabilidade Classificação de favorabilidade aos direitos das mulheres 2

Os modelos são independentes e compartilham este repositório apenas para distribuição e versionamento. É necessário informar explicitamente subfolder ao carregá-los.

Rótulos

Os artefatos retornam rótulos técnicos (LABEL_n). A interpretação correta é:

Tema

Rótulo Tema
LABEL_0 Direitos Sexuais e Reprodutivos
LABEL_1 Educação e Cultura
LABEL_2 Família, Parentalidade e Relações Civis
LABEL_3 Igualdade e Antidiscriminação
LABEL_4 Infância e Adolescência
LABEL_5 LGBTQIAPN+
LABEL_6 Participação Política e Institucionalidade
LABEL_7 Saúde
LABEL_8 Trabalho, Economia, Cuidado e Proteção Social
LABEL_9 Violências de Gênero

O modelo de tema é de classificação de rótulo único. Para obter a distribuição de todas as classes, use top_k=None ou aplique softmax aos logits.

Favorabilidade

Rótulo Significado
LABEL_0 Favorável aos direitos das mulheres
LABEL_1 Desfavorável aos direitos das mulheres

LABEL_1 é a classe positiva na base de treinamento. A probabilidade dessa classe deve ser persistida para auditoria. O corte usado na avaliação do modelo foi 0.2254; ele pode ser calibrado para o contexto de uso, mas não deve ser confundido com o limiar padrão de argmax (0.5).

Formato de entrada

Os dois classificadores foram treinados com a mesma representação textual:

Partido: {partido}; Genero: {genero}; UF: {uf}; Conteúdo: {inteiro_teor_limpo_ou_ementa}

Conteúdo é o inteiro teor com marcação limpa; quando ele não está disponível, usa-se a ementa. O texto é truncado em 512 tokens. Para resultados consistentes com o treinamento, reproduza esse formato, use dados do primeiro autor da proposição e não ultrapasse esse limite.

Como usar

import torch
from transformers import AutoModelForSequenceClassification, AutoTokenizer

repo_id = "azmina/quiteria-2.0"

def load(subfolder: str):
    tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
    model = AutoModelForSequenceClassification.from_pretrained(
        repo_id,
        subfolder=subfolder,
    ).eval()
    return tokenizer, model

tema_tokenizer, tema_model = load("tema")
favor_tokenizer, favor_model = load("favorabilidade")

text = (
    "Partido: PT; Genero: F; UF: SP; "
    "Conteúdo: Estabelece medidas de proteção à saúde das mulheres."
)

with torch.inference_mode():
    inputs = tema_tokenizer(text, truncation=True, max_length=512, return_tensors="pt")
    scores = torch.softmax(tema_model(**inputs).logits[0], dim=-1)

label_index = int(scores.argmax())
print(f"LABEL_{label_index}", float(scores[label_index]))

Treinamento e avaliação

Os modelos foram ajustados com resumos e inteiros teores de proposições em tramitação, rotulados manualmente durante quatro anos e meio por equipe e organizações parceiras. A divisão estratificada utilizada contém 2.527 projetos de treino, 282 de validação e 313 de teste.

Na base de teste, o classificador de temas obteve acurácia de 0.82 e F1 macro de 0.71. O desempenho varia por classe: a menor cobertura histórica ocorre em Infância e Adolescência (F1 0.31), Participação Política e Institucionalidade (F1 0.59) e Igualdade e Antidiscriminação (F1 0.67).

Para favorabilidade, o modelo obteve F1 de 0.92 na classe favorável e 0.67 na classe desfavorável, com AUC de 0.85 na base de teste.

Limitações e uso responsável

  • As predições devem passar por validação humana antes de decisões editoriais ou políticas de alto impacto.
  • A classificação de tema é de uma única classe e pode não representar todos os assuntos presentes numa proposição.
  • Desempenho pode variar com mudanças no perfil das proposições, nos textos de entrada e na distribuição de classes.
  • Registre versão/revisão do modelo, entrada e probabilidades para permitir auditoria e recalibração.

Estrutura do repositório

.
├── favorabilidade
│   ├── config.json
│   ├── model.safetensors
│   ├── tokenizer.json
│   └── tokenizer_config.json
└── tema
    ├── config.json
    ├── model.safetensors
    ├── tokenizer.json
    └── tokenizer_config.json
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support