ANEXO I
MATRIZES DE REFERÊNCIA DE LÍNGUA PORTUGUESA E MATEMÁTICA DO SAEB 2º ANO
    
APÊNDICES
APÊNDICE 1
PROCEDIMENTOS PARA CALIBRAÇÃO DOS ITENS QUE COMPÕEM OS TESTES QUE AVALIAM A ALFABETIZAÇÃO
Na avaliação da Alfabetização do Saeb, a calibração dos itens pode ser realizada por dois métodos: o método de grupos múltiplos com o uso da base clone, ou o método de calibração com parâmetros fixos.
O método de grupos múltiplos com base clone (https://download.inep.gov.br/avaliacao\_da\_alfabetizacao/documentos\_tecnicos/bases\_ clones\_facilitacao\_equalizacao\_medidas.pdf) utiliza uma base de dados simulada criada para servir como grupo de referência no processo de equalização das medidas da avaliação de Alfabetização ao longo do tempo. Seu objetivo é simplificar a aplicação do método de fixação dos parâmetros dos itens comuns, procedimento amplamente utilizado pelo Inep em avaliações baseadas na Teoria de Resposta ao Item (TRI).
Na prática, a base clone reproduz uma amostra fictícia de respostas geradas a partir dos parâmetros originais dos itens calibrados na escala de referência. Ela substitui o uso de bases reais de aplicações anteriores - tradicionalmente utilizadas como referência nos modelos de grupos múltiplos da TRI - e, com isso, elimina a necessidade de transformações adicionais nos parâmetros dos itens, mantendo todos os resultados diretamente na escala original de calibração.
O segundo método, que vem sendo amplamente utilizado nas avaliações do Saeb, é a calibração com parâmetros fixos (Fixed Item Parameter Calibration - FIPC) (Klein & Ricarte, 2025). Esse método permite colocar diferentes aplicações de teste em uma mesma escala, garantindo a comparabilidade dos resultados ao longo do tempo e entre grupos distintos de estudantes.
O método FIPC parte de um conjunto de itens âncora, cujos parâmetros de discriminação, dificuldade e acerto ao acaso foram previamente estimados em uma calibração de referência. Esses itens funcionam como pontos fixos na escala e são mantidos constantes durante o processo de estimação dos novos itens. Assim, os novos itens são ajustados de forma coerente com a métrica original, dispensando a necessidade de reestimar todos os parâmetros simultaneamente.
A estimação dos parâmetros é feita com base no modelo logístico de três parâmetros (3PL), que considera a probabilidade de acerto ao acaso. O processo de estimação dos parâmetros utiliza-se o pacote mirt, do software R, que aplica o algoritmo de maximização da verossimilhança pelo método EM. Essa abordagem produz resultados equivalentes aos obtidos pelo método de grupos múltiplos com base clone, mas com maior simplicidade operacional, pois requer apenas as respostas dos novos itens e os parâmetros fixados dos itens âncora.
Independentemente do método adotado, grupos múltiplos ou FIPC, é necessário definir especificações técnicas para garantir a comparabilidade entre as diferentes edições da avaliação.
Na função mirt.model do software R, as distribuições a priori devem ser definidas conforme os seguintes parâmetros:
PRIOR = (1-itens, a1, lnorm, 0.530628251, 0.5), (1-itens, g, expbeta, 5, 17)
Essas especificações indicam que o parâmetro de discriminação (a1) segue uma distribuição log-normal, e o parâmetro de acerto ao acaso (g) segue uma distribuição beta exponencial, o que contribui para uma estimação mais estável e coerente com os valores esperados do modelo 3PL.
Na função mirt, também é necessário definir o número e o intervalo dos pontos de quadratura, utilizados para aproximar a distribuição da proficiência dos respondentes. Os valores recomendados são:
quadpts = 61,
technical = list(theta\_lim = c(-6.0, 6.0), NCYCLES = 500)
Essas configurações asseguram maior precisão na estimação, cobrindo adequadamente o intervalo de proficiência dos estudantes e favorecendo a convergência do algoritmo de maximização da verossimilhança.
A calibração dos itens, seja pelo método de grupos múltiplos com base clone ou pelo método FIPC, garante a continuidade da escala de proficiência e a comparabilidade das estimativas entre edições da avaliação, assegurando a coerência psicométrica necessária para o monitoramento do desempenho dos estudantes ao longo do tempo.
APÊNDICE 2
SINTAXE DA ESTIMAÇÃO DAS PROFICIÊNCIAS DOS ALUNOS DA ALFABETIZAÇÃO
A nota (proficiência) do aluno participante da avaliação de Alfabetização é estimada utilizando o modelo de três parâmetros (3PL) da TRI, a nota representa seu o nível de conhecimento demonstrado nas respostas aos itens. Como não é possível obter esse valor por uma fórmula simples, utiliza-se um método estatístico específico da TRI.
O Inep adota o método EAP (Expected a Posteriori) para estimar as proficiências em suas avaliações. Esse método combina as respostas do participante com uma distribuição a priori (normal, com média 0 e desvio padrão 1) que reflete a proficiência esperada do grupo de referência.
A proficiência é o valor esperado da distribuição a posteriori deq(parâmetro que representa a proficiência do aluno no modelo 3PL), calculada com base nas respostas e nos parâmetros dos itens (discriminação, dificuldade e acerto ao acaso). Essa abordagem torna a estimação mais precisa.
A precisão da proficiência é avaliada por meio do desvio padrão a posteriori, que indica o grau de confiança da estimativa, quanto menor o desvio padrão, mais precisa é a nota estimada.
Com isso, o método EAP permite calcular proficiências consistentes e comparáveis entre os alunos participantes e as edições diferentes da avaliação de alfabetização, assegurando a estabilidade e a validade psicométrica das medidas de proficiência.
Na estimação da proficiência do participante da avaliação é necessário definir especificações técnicas para garantir a comparabilidade entre as diferentes edições da avaliação.
Na função fscores do software R, é fundamental definir a média e o desvio-padrão da distribuição a priori utilizada pelo método EAP, a fim de garantir a comparabilidade dos resultados. Caso esses parâmetros não sejam especificados, o software R aplicará valores padrão que podem divergir da distribuição desejada, comprometendo a comparabilidade das estimativas definidas no momento da criação da escala.
A distribuição a priori deve ser definida da seguinte forma:
fscores(nome\_modelo, method = "EAP", mean=0, cov=1)
APÊNDICE 3
MONTAGEM DOS CADERNOS DE TESTE E SUAS FORMAS DE APLICAÇÃO
Montagem
Para montar os cadernos de prova, deve ser utilizada a metodologia denominada Blocos Incompletos Balanceados (BIB), permitindo que um grande número de itens seja aplicado ao conjunto de alunos avaliados, sem que cada aluno precise responder a todos eles. Após os itens serem elaborados e revisados pedagógica e linguisticamente, o processo de montagem dos cadernos de prova é iniciado com a seleção dos itens e a montagem de blocos de itens. A seleção e a distribuição de itens para a composição dos blocos devem ser orientadas por critérios pedagógicos, que considerem as habilidades da matriz de referência, o nível de dificuldade dos itens, a adequação dos temas e dos textos que compõem os suportes dos itens ao público avaliado, comandos e opções dos itens tecnicamente bem construídos.
Devem ser contemplados, na montagem dos cadernos de teste, itens com parâmetros na escala Saeb para as disciplinas de Língua Portuguesa e Matemática, garantindo que os blocos estejam balanceados em termos da sua dificuldade. Para o teste de Língua Portuguesa, adicionalmente, deve ser garantida a presença de itens próximos ao ponto 743, limiar na escala que define o Indicador Criança Alfabetizada (ICA). Sempre que possível, na seleção de itens comuns entre edições da avaliação, é importante tentar manter a posição original dos itens dentro dos blocos.
Os testes na área de Língua Portuguesa devem ser montados a partir de três blocos iniciais (Blocos A, B e C) contendo oito itens objetivos, mais 7 blocos de 4 itens (Blocos 01 a 07) que vão ser rodiziados entre os blocos iniciais e 3 blocos com 2 itens de escrita de palavra ditada (Blocos i, ii e iii) e um bloco final com um item de produção textual (Texto); totalizando 52 itens de resposta selecionada e 7 itens de resposta construída. Esses blocos devem ser apresentados em 21 modelos de cadernos, compostos por 16 itens de múltipla escolha cada um, formados por 3 blocos: 1 bloco com 8 itens (A, B ou C) e 2 blocos com 4 itens cada (1 ao 7) e 2 itens de escrita de palavra ditada, mais um item de produção textual. A Figura 1 apresenta o esquema de montagem dos 21 modelos de cadernos de prova. Esta montagem permite que, em cada turma, o bloco inicial seja comum e de aplicação totalmente mediada, enquanto os sete blocos que compõem a seção seguinte do teste sejam de aplicação parcialmente mediada e rodiziados na turma.
Figura 1: Esquema de montagem dos cadernos de prova de Língua Portuguesa para o 2º ano

Para os testes de Matemática, devem ser montados 7 blocos contendo 9 itens de múltipla escolha e 7 blocos com 1 item de resposta construída cada, totalizando 63 itens de múltipla escolha e 7 itens de resposta construída. Os itens devem ser apresentados em 21 modelos de cadernos, cada um composto por 3 blocos: 2 blocos com 9 itens cada (múltipla escolha) e 2 blocos com 2 itens de resposta construída, combinados de maneira única, conforme ilustrado na Figura 2.
Figura 2: Esquema de montagem dos cadernos de prova de Matemática para o 2º

Cada estudante responde apenas a um caderno de Língua Portuguesa com 19 itens, sendo 16 de múltipla escolha e 3 de resposta construída (escrita); e a um caderno de Matemática com 20 itens, sendo 18 de múltipla escolha e 2 de resposta construída.
APLICAÇÃO
Os cadernos de teste são individuais, um para cada área do conhecimento, e devem ser aplicados em dias distintos. A aplicação dos testes de Língua Portuguesa do 2º Ano do Ensino Fundamental deve ocorrer de forma mediada, considerando as diferentes versões dos modelos de caderno de prova. Os três primeiros blocos (A, B e C) são de aplicação totalmente mediada, de forma que, em cada turma, os estudantes respondem a apenas um desses blocos e de maneira totalmente mediada. Os sete blocos da seção seguinte do teste são de aplicação parcialmente mediada e distribuídos em rodízio na turma. A aplicação dos testes de Matemática aos estudantes do 2º Ano do Ensino Fundamental deve ocorrer de forma mediada, considerando as diferentes versões dos modelos de caderno de prova. Isso porque, no 2º ano, o que se objetiva avaliar através dos testes de Língua Portuguesa é, justamente, o domínio do princípio alfabético, de habilidades de leitura e de produção escrita dos estudantes. No teste de Matemática, por sua vez, objetiva-se avaliar o domínio de habilidades relativas ao letramento matemático. Por esta razão, é importante que a aplicação dos testes seja conduzida pelos aplicadores. Mas, isso deve ocorrer de forma padronizada para todos os entes federados e escolas que estão participando da avaliação.
O aplicador, além de treinamento adequado à aplicação de testes na etapa da alfabetização, deve contar com instrumento específico para orientá-lo no momento da aplicação. Este instrumento deve orientar todo o procedimento, indicando exatamente como o teste deve ser conduzido, ou seja, o que deve ser feito nas fases de preparação, execução e consolidação da aplicação; o que deve ser lido e o que não deve ser lido; bem como, o que pode e o que não pode ser respondido pelo aplicador durante a prova. Todos os estudantes da turma devem resolver os itens ao mesmo tempo, guiados pelo aplicador. Após a aplicação, cabe ao aplicador o preenchimento dos cartões resposta dos estudantes.
Os aplicadores devem possuir ensino superior completo, preferencialmente graduação em Pedagogia ou em Licenciaturas de áreas afins, além de experiência no magistério nos anos iniciais do Ensino Fundamental e experiência comprovada em avaliações externas de alunos ou sistemas de ensino ou concursos públicos ou vestibulares. Ressalta-se que não podem atuar como aplicadores os professores da escola avaliada, a fim de assegurar a imparcialidade do processo.
Quanto à duração da aplicação do teste, o tempo total de aplicação do instrumento de Língua Portuguesa precisa ser de até 1 hora e 50 minutos, sendo: até 1 hora e 5 minutos destinados à aplicação das questões objetivas, 15 minutos de intervalo e até 30 minutos dedicados à realização das questões abertas. O instrumento de Matemática deve ser aplicado em até 1 hora e 15 minutos, sendo: até 30 minutos destinados à aplicação do primeiro bloco, 15 minutos de intervalo e até 30 minutos destinados à aplicação do segundo bloco.
Os estados, por meio das instituições aplicadoras contratadas, devem se empenhar para oferecer, em parceria com os sistemas de ensino, atendimento especializado aos alunos com deficiência ou outras necessidades educacionais especiais nas avaliações. Em relação à aplicação dos testes para os estudantes com deficiência ou transtornos do desenvolvimento, deve haver um tempo adicional de no mínimo 20 minutos de aplicação.
APÊNDICE 4
PROCEDIMENTO PARA O CÁLCULO DO PESO NA BASE DE DADOS
Na aplicação do sistema estadual de avaliação na Alfabetização, embora a avaliação se destine a cobrir 100% dos alunos elegíveis, perdas durante a coleta incentivaram a utilização de um processo de ponderação para preservar a representatividade estatística. A ideia é expandir hierarquicamente os pesos dos participantes, garantindo que a soma final dos pesos coincida com a população-alvo (no caso, os estudantes previstos). Esse mecanismo atua em cinco níveis interconectados - turma, escola, estrato, município e unidade federativa (UF).
Os cálculos dos pesos e dos resultados agregados são feitos utilizando microdados dos estudantes, que contêm as informações sobre participação, medida de proficiência e o valor do peso final atribuído a cada aluno.
 
Obs.: todos os alunos sem participação efetiva recebem peso zero.
 
Por exemplo: se há uma escola em que uma turma inteira não foi avaliada, mas estava prevista, o peso auxiliar será responsável por compensar essa não participação no nível k+1(escola). Os níveis estão descritos a seguir:
· k=1: turma;
· k=2: escola;
· k=3: estrato do censo (município, dependência administrativa, localização);
· k=4: município/dependência administrativa;
· k=5: UF.
E o peso auxiliar para a expansão de turmas para escolas é o seguinte:
 
Em seguida, o peso é expandido para o nível da escola, multiplicando o peso do aluno na turma pelo peso auxiliar 1, obtendo então o peso do aluno na escola:

Essa lógica de compensação por meio dos pesos auxiliares se repete para os níveis subsequentes, garantindo assim que a expansão dos pesos se iguale sempre à contagem de estudantes previstos.
  
Se um estrato não tiver participantes (ex.: um município em que nenhuma escola rural estadual tenha participado), o peso temporário será zero - com a compensação ocorrendo posteriormente, no agregado de município.
        
A robustez desse método está na compensação hierárquica: unidades não respondentes têm seu déficit absorvido por níveis superiores, preservando agregados nacionais.
APÊNDICE 5
SINTAXE PARA ENVIO DOS DADOS DAS AVALIAÇÕES ESTADUAIS E DISTRITAL AO INEP
ORIENTAÇÕES PARA PREENCHIMENTO DO LAYOUT "DICIONÁRIO DE DADOS - AVALIAÇÕES ESTADUAIS"
O presente Apêndice tem por objetivo orientar as unidades da federação quanto ao correto preenchimento e envio ao Instituto Nacional de Estudos e Pesquisas Educacionais Anísio Teixeira (Inep) dos dados resultantes das avaliações estaduais e distrital de alfabetização, em conformidade com o layout denominado "Dicionário de Dados - Avaliações Estaduais".
1\. Estrutura e Finalidade do Arquivo
O arquivo de layout padroniza a estrutura de informações que deverão ser encaminhadas ao Inep, garantindo integridade, comparabilidade e rastreabilidade dos dados.
Cada linha do arquivo representa um estudante avaliado, e cada coluna corresponde a uma variável padronizada pelo Inep, conforme especificado no dicionário.
O dicionário define para cada variável:
· Nome do campo (variável);
· Tipo de dado (numérico, caractere, data, lógico);
· Tamanho máximo do campo;
· Descrição e significado;
· Regras de preenchimento;
· Exemplo ilustrativo;
· Observações específicas, quando aplicáveis.
2\. Estrutura do Layout e Guias do Arquivo
O Dicionário de Dados da Avaliação Estadual é composto pelas seguintes abas:
1\. Lista de Tabelas - Relaciona todas as tabelas que compõem o dicionário, funcionando como índice para navegação.
2\. TB\_N96A\_CADERNO - Contém informações sobre os cadernos de prova aplicados, identificando suas versões, estrutura e finalidade.
3\. TB\_N96B\_BLOCO - Define os blocos de itens que integram os cadernos, detalhando a quantidade de itens dentro do bloco e sua organização interna.
4\. TB\_N96C\_CADERNO\_BLOCO - Estabelece a relação entre cada caderno e os blocos que o compõem, permitindo mapear a composição completa da prova.
5\. TB\_N96D\_ITEM - Reúne informações descritivas dos itens da avaliação (questões), incluindo identificação, tipo e características técnicas.
6\. TB\_N96E\_QUESITO\_ITEM - Apresenta os quesitos ou atributos específicos de cada item, servindo de apoio para análise pedagógica e estatística.
7\. TB\_N96F\_CONCEITO - Define os conceitos e categorias utilizados para interpretação dos resultados, funcionando como referência de classificação.
8\. TB\_N96G\_ITEM\_BLOCO - Relaciona os itens aos blocos nos quais estão inseridos, garantindo rastreabilidade da montagem da prova.
9\. TB\_N72\_RESULTADO - Consolida os resultados individuais dos participantes, contendo variáveis de desempenho e indicadores pedagógicos.
10\. TB\_N81\_ALUNO - Reúne os dados cadastrais dos estudantes avaliados identificados conforme dados do Censo Escolar, permitindo análises demográficas e contextuais.
11\. TB\_N58\_ALUNO\_RESPOSTA - Registra as respostas fornecidas pelos estudantes a cada item, possibilitando estudos de desempenho e análises psicométricas.
12\. TB\_N73\_RESULTADO\_UF - Apresenta os resultados agregados por Unidade da Federação, permitindo comparações regionais e nacionais.
3\. Regras Gerais de Preenchimento
1\. Campos obrigatórios: todos os campos marcados como obrigatórios devem ser preenchidos. Omissões ou inconsistências impedirão a validação do arquivo.
2\. Identificadores únicos: cada estudante deve possuir um identificador exclusivo (mesmo código do Censo Escolar) dentro da UF e do ano da aplicação.
3\. Datas: devem seguir o formato ISO YYYY-MM-DD.
4\. Campos numéricos: devem utilizar ponto (.) como separador decimal e não devem conter separadores de milhar.
5\. Códigos de UF, município e escola: devem corresponder exatamente aos códigos do Censo Escolar do ano de referência.
6\. Participação: todos os estudantes elegíveis devem ser listados, mesmo os ausentes, com o campo TP\_PARTICIPACAO devidamente preenchido.
7\. Proficiência: deve ser informada no campo PROFICIENCIA\_SAEB, calculada conforme metodologia descrita no Apêndice 2 desta Instrução Normativa.
8\. Peso amostral: deve seguir o procedimento do Apêndice 4, informado no campo PESO\_FINAL.
4\. Validação e Envio dos Dados
Antes do envio ao Inep, as Secretarias Estaduais e o Distrito Federal deverão:
· Verificar a consistência interna dos dados utilizando os validadores automáticos fornecidos pelo Inep;
· Garantir que todos os campos obrigatórios estejam preenchidos corretamente;
· Assegurar que o número total de registros corresponda ao número de estudantes previstos;
· Encaminhar o arquivo final via ambiente seguro do Inep, dentro do prazo definido em regulamento específico.
Os arquivos enviados fora do padrão, com campos ausentes, formatos incorretos ou inconsistências de integridade, serão devolvidos para correção.
5\. Observação Final
Este layout e suas orientações integram o conjunto normativo da presente Instrução Normativa, devendo ser observados integralmente por todos os sistemas estaduais e distrital de avaliação.
Alterações futuras de estrutura, nomenclatura ou formato serão comunicadas oficialmente pelo Inep, mediante nova versão do dicionário de dados.