Cinco questões reais, inéditas, no estilo da prova CCA-F para Gestão de Contexto e Confiabilidade (15% da prova). Tente responder você mesmo antes de revelar a explicação — é assim que você realmente encontra as lacunas no seu conhecimento.
Pratique o conjunto completo filtrado por domínio na AICert Study →
Questão 1
A ferramenta lookup_order retorna um JSON com 47 campos por pedido (metadados da transportadora, centro de fulfillment, peso, dimensões, códigos aduaneiros etc.). O agente normalmente precisa apenas de order_id, status, total, refundable_amount e tracking_url. Após muitas chamadas em uma sessão longa, o agente começa a esquecer compromissos anteriores do cliente. Qual é a correção mais apropriada?
- A. Projetar a resposta da ferramenta para os cinco campos relevantes antes que ela entre no histórico, para que respostas verbosas parem de consumir contexto de forma desproporcional.
- B. Aumentar o max_tokens do modelo para que o payload completo de 47 campos sempre caiba.
- C. Trocar para um modelo menor que seja mais eficiente com entradas longas.
- D. Parar de chamar lookup_order após o terceiro turno e confiar na memória do modelo sobre resultados anteriores.
Ver resposta e explicação
Resposta correta: A
Saídas de ferramenta verbosas acumulam-se e expulsam informações críticas anteriores. Cortar a resposta para apenas os campos que o agente realmente usa é o padrão recomendado.
- Aumentar o max_tokens do modelo: max_tokens controla o tamanho da saída, não a capacidade de entrada; não resolve o inchaço de resultados de ferramentas no contexto.
- Trocar para um modelo menor: Modelos menores não são intrinsecamente melhores com entradas longas, e mudar o tamanho do modelo não corrige o problema subjacente de campos irrelevantes consumindo tokens.
- Parar de chamar lookup_order: Pular chamadas de ferramentas necessárias produz dados desatualizados ou fabricados e prejudica a qualidade da resolução; o caminho correto é tornar cada chamada mais barata em tokens.
Compartilhar esta questão no LinkedIn →
Questão 2
Um coordenador de pesquisa agrega saídas de cinco subagentes em uma entrada de 60 páginas para o subagente de síntese. Após revisão, o relatório omite consistentemente achados dos subagentes cujas saídas ficam no meio da entrada agregada, enquanto achados do primeiro e do último subagente aparecem bem representados. Qual mitigação aborda diretamente o efeito subjacente?
- A. Colocar um resumo estruturado de achados-chave no início da entrada agregada para que o modelo encontre afirmações importantes em uma posição de alta confiabilidade.
- B. Reduzir a temperatura do modelo para 0 para que ele não pule trechos.
- C. Embaralhar aleatoriamente a ordem das saídas dos subagentes a cada execução.
- D. Pedir ao agente de síntese para 'ler com atenção' no prompt do sistema.
Ver resposta e explicação
Resposta correta: A
O efeito 'perdido no meio' significa que modelos atendem de forma confiável ao início e ao fim de entradas longas. Trazer um resumo de achados-chave para o início garante que as afirmações mais importantes fiquem em uma posição de alta atenção.
- Reduzir a temperatura do modelo para 0: A temperatura afeta a aleatoriedade da amostragem, não a dinâmica de atenção posicional que causa omissões no meio do contexto.
- Embaralhar aleatoriamente a ordem: A ordem aleatória apenas muda quais achados se perdem; não corrige o viés estrutural de atenção.
- Pedir ao agente para 'ler com atenção': Instruções vagas não anulam o viés posicional e não substituem engenharia estrutural de prompt.
Compartilhar esta questão no LinkedIn →
Questão 3
Um engenheiro percebe que o agente de suporte envia apenas as duas mensagens mais recentes do usuário à API a cada turno para economizar tokens. Agora o agente frequentemente contradiz compromissos anteriores e pede ao cliente informações já fornecidas. Qual é a causa raiz mais provável?
- A. O histórico completo da conversa não está sendo passado nas requisições subsequentes, de modo que o modelo não consegue manter coerência conversacional.
- B. A temperatura do modelo está muito alta.
- C. O modelo precisa ser retreinado com dados de suporte ao cliente.
- D. O prompt do sistema é longo demais e está expulsando as mensagens do usuário.
Ver resposta e explicação
Resposta correta: A
Claude é stateless entre chamadas de API; a aplicação precisa incluir o histórico completo da conversa para que o modelo raciocine sobre turnos anteriores. Enviar apenas as duas últimas mensagens descarta a fonte da verdade.
- A temperatura do modelo está muito alta: A temperatura controla a aleatoriedade da amostragem, não a memória; mesmo com temperatura 0 o modelo não consegue lembrar de turnos que não foram incluídos na entrada.
- O modelo precisa ser retreinado: Modelos fundacionais não são retreinados por cliente; este é um erro arquitetural do lado da aplicação.
- O prompt do sistema é longo demais: Um prompt de sistema longo não apaga as mensagens do usuário; as mensagens nunca foram enviadas.
Compartilhar esta questão no LinkedIn →
Questão 4
Um coordenador de pesquisa rodando por 90 minutos começa a produzir resumos que referenciam 'padrões típicos da indústria' em vez dos nomes específicos de concorrentes e valores de receita descobertos antes pelo subagente de análise de documentos. A síntese ainda afirma alta confiança. Qual combinação de técnicas aborda mais diretamente essa degradação?
- A. Persistir achados-chave (nomes literais, valores, datas) em um arquivo scratchpad e recarregá-lo no contexto após a compactação; delegar varreduras verbosas de documentos a subagentes que retornem apenas resumos estruturados.
- B. Aumentar a verbosidade do prompt do sistema para lembrar o modelo de não generalizar.
- C. Desativar a delegação de subagentes e fazer o coordenador ler todos os documentos-fonte diretamente.
- D. Confiar na confiança autorreportada do modelo para decidir quando rebuscar fontes.
Ver resposta e explicação
Resposta correta: A
A degradação de contexto em sessões longas leva a generalidades vagas. Dois primitivos corretos são um scratchpad persistente com fatos literais e delegação a subagentes que isole exploração verbosa para que o coordenador permaneça focado.
- Aumentar a verbosidade do prompt do sistema: Adicionar mais instruções não resolve a degradação causada pela erosão de contexto; pode até piorá-la consumindo mais tokens.
- Desativar a delegação de subagentes: Fazer o coordenador ler tudo diretamente é exatamente o padrão que causa a degradação; a delegação a subagentes é a mitigação, não o problema.
- Confiar na confiança autorreportada: A confiança autorreportada é um proxy não confiável para precisão, especialmente quando o modelo já está derivando para respostas vagas.
Compartilhar esta questão no LinkedIn →
Questão 5
Um cliente escreve: 'Quero falar com um supervisor humano agora. Não quero um bot tentando me ajudar.' O agente tem ferramentas para consultar o pedido e processar reembolso. Qual é o comportamento correto?
- A. Chamar imediatamente escalate_to_human com o contexto da conversa; não tentar investigar antes nem dissuadir o cliente.
- B. Pedir ao cliente que descreva o problema primeiro; escalar apenas se o pedido parecer complexo após triagem.
- C. Tranquilizar o cliente de que o agente provavelmente consegue ajudar e tentar um reembolso antes de escalar.
- D. Usar análise de sentimento para confirmar que o cliente está realmente irritado antes de escalar.
Ver resposta e explicação
Resposta correta: A
Um pedido explícito do cliente por um humano é um gatilho categórico de escalonamento que deve ser respeitado imediatamente, sem investigação prévia.
- Pedir ao cliente que descreva o problema primeiro: Isso ignora o pedido explícito e prejudica a confiança; pedidos explícitos por humanos não são decisão de triagem.
- Tentar um reembolso antes de escalar: Agir no caso após o cliente pedir um humano viola o pedido explícito e arrisca fazer a coisa errada.
- Usar análise de sentimento para confirmar: O sentimento é um proxy não confiável; um pedido verbal explícito supera qualquer sentimento inferido.
Compartilhar esta questão no LinkedIn →
Quer mais? Nosso banco grátis tem centenas de questões de Gestão de Contexto e Confiabilidade. Pratique todas →
