O vocabulário que você precisa antes do Módulo 0.1
Este curso pressupõe que você consegue ler um script em Python e já fez ao menos uma chamada a um LLM. Se algum desses pontos ainda não estiver firme, esta introdução apresenta as cinco ideias que os demais módulos usam sem repetir a explicação. Ela é gratuita e curta, para que o curso principal possa ir direto ao método.
1 · Defina o fluxo de trabalho antes do juiz
Um juiz só consegue inspecionar uma fronteira que você definiu. Comece por um trabalho recorrente e escreva seu contrato de fluxo de trabalho: quem age, quais contexto e política limitam a ação, qual resultado observável importa e qual exceção devolve o controle a uma pessoa. Isso evita confundir uma resposta fluente com um sistema útil.
Trabalho: ____________________
Responsável pela ação: ____________________
Contexto: ____________________
Ação permitida: ____________________
Resultado observável: ____________________
Falha / exceção: ____________________
Responsável humano: ____________________
Evidência preservada: ____________________
qual campo do contrato impede que “texto bem escrito” vire o critério de sucesso?
2 · Uma chamada LLM e seu registro de execução
Uma chamada LLM é uma função: você envia um prompt (as mensagens de entrada), e o modelo retorna o texto de saída. Essa é a forma mais simples da operação. Um registro de execução é a versão registrada dessa chamada — a entrada, a saída e os dados necessários para investigar problemas e medi-la: quanto tempo levou (latência), quantos tokens usou, quais chamadas de ferramenta aconteceram, qual contexto foi recuperado. Toda avaliação deste curso usa esses registros. Sem registro de execução, não há avaliação.
# a chamada de LLM mais simples e seu registro de execução
out = llm.chat(messages=[{"role": "user", "content": "Summarize the meeting"}])
trace = {
"input": "Summarize the meeting",
"output": out.text,
"latency_ms": out.latency,
"tokens": out.usage,
}
# os juízes do curso leem campos como esses — por isso os registros vêm primeiro
3 · RAG em duas linhas
RAG (Retrieval-Augmented Generation) significa: antes do modelo responder, seu código busca contexto relevante (pedaços de documentos, uma base de conhecimento, mensagens anteriores) e o coloca no prompt. O modelo então responde fundamentado nesse contexto em vez de apenas de memória. A maioria dos problemas de "alucinação" são na verdade problemas de "a recuperação não deu ao modelo o que ele precisava". Vários módulos avaliam exatamente isto: se a resposta é de fato sustentada pelo contexto recuperado.
4 · O Python que você verá
Você não precisa ser especialista em Python, mas precisa conseguir ler a linguagem com segurança. O curso usa um subconjunto pequeno e consistente; se você reconhecer os elementos abaixo, conseguirá acompanhar todos os labs:
- Funções e argumentos —
def judge(case, llm):e argumentos nomeados como--threshold 0.7. - Dataclasses — uma estrutura tipada, por exemplo
@dataclass class Verdict: passed; evidence; confidence. Pense nela como um conjunto de campos nomeados. - Dicionários e listas — o registro é um dicionário; um conjunto de dados é uma lista de dicionários.
- Executando um script —
python some_lab.py --input samples/. Cada laboratório funciona offline, sem chave de API.
Se statistics.median, random.seed ou um laço for ainda forem novidade, reserve algum tempo para estudar os fundamentos de Python antes de prosseguir.
5 · Juiz, gate e avaliação — as palavras que o curso usa
Três termos recorrem e não são intercambiáveis:
- Um juiz é código que inspeciona uma saída e retorna um veredito + evidência + confiança. (Módulo 0.3.)
- Um gate é uma decisão que bloqueia ou permite um lançamento com base no veredito de um juiz. (Módulo 0.5.)
- Uma avaliação é a prática mais ampla de medir a qualidade de forma sistemática — registros de execução, conjuntos de referência e desvios. (Trilha EVAL.)
Esse é todo o vocabulário. O restante do curso se apoia nessas cinco ideias — contrato de fluxo de trabalho, chamada e registro de execução, RAG, o subconjunto de Python e juiz/gate/avaliação — sem repetir a explicação.
o que é um registro de execução e por que o curso começa por ele?
"juiz", "gate" e "avaliação" — defina cada termo em uma linha
onde o juiz fica no contrato de fluxo de trabalho?
- Defina trabalho, ação, exceção, responsabilidade humana e resultado observável antes de escrever um juiz.
- Uma chamada LLM é uma função; o registro de execução contém os campos de que um juiz precisa. Sem registro, não há avaliação.
- RAG = buscar contexto no prompt para que a resposta seja fundamentada; a maioria da "alucinação" é um problema de recuperação.
- Leia Python confortavelmente (funções, dataclasses, dicts, rodar um script) — esse é o patamar.
- Juiz (inspeciona) · gate (bloqueia ou permite) · avaliação (mede sistematicamente). Todo o curso segue o ciclo gerar → julgar → gate → tentar novamente.