s
INTELIGÊNCIA ARTIFICIAL

Modelos de raciocínio guardam seus segredos

Escondem deliberadamente seus processos de pensamento. Este não é apenas um problema técnico.

Sua IA pode estar escondendo seu processo de pensamento – e isso é um problema maior do que você imagina. Uma nova pesquisa da Anthropic revela que os principais modelos de linguagem não revelam partes importantes de seu processo de raciocínio, criando uma grave lacuna de transparência que pode prejudicar os esforços de segurança da IA. Se os modelos podem usar informações silenciosamente sem revelá-las, e/ou ocultarem dicas e atalhos que utilizam, como confiar na transparência de seu processo de raciocínio?

Resumindo: a técnica Chain of Thought (CoT) tornou-se uma das bases para a IA que “raciocina”. Pesquisadores de segurança em IA têm apostado no raciocínio por cadeia de pensamento (CoT) como uma maneira de detectar comportamentos perigosos antes que causem danos. Principalmente comportamentos desalinhados ou inseguros em ambientes de alto risco. No estudo “Reasoning Models Don't Always Say What They Think”, a equipe da Anthropic revela uma série de limitações nas abordagens atuais para monitorar os processos de pensamento da IA.

Foram testados seis tipos diferentes de dicas – de metadados neutros a avisos diretos de “desbloqueio” – em dois LLMs de raciocínio de ponta (Claude 3.7 Sonnet, DeepSeek R1). Ambos falharam consistentemente em revelar o uso das dicas. Mesmo quando os modelos exploram dicas mais de 90% das vezes, verbalizam essas dicas no CoT menos de 20% das vezes, em média – e menos de 5% para dicas de desalinhamento.

Este é um conteúdo exclusivo para assinantes.

Cadastre-se grátis para ler agora
e acesse 5 conteúdos por mês.

É assinante ou já tem senha? Faça login. Já recebe a newsletter? Ative seu acesso.

A IA começou a escrever genomas

Inteligência Artificial

A IA começou a escrever genomas

Modelos de linguagem genômica já conseguem projetar genomas virais funcionais. O avanço promete novas terapias e muda a escala do debate sobre biossegurança.

Robôs para companhia emocional colocam IA Física dentro da sua casa

Inovação

Robôs para companhia emocional colocam IA Física dentro da sua casa

As vendas anuais de humanoides fabricados na China devem mais que dobrar em 2026, para cerca de 28.000 unidades

O conselho cobra ROI de IA. Poucas empresas medem

Inteligência Artificial

O conselho cobra ROI de IA. Poucas empresas medem

Tem mais: a IA já entrou na avaliação de desempenho dos CEOs, mas ainda não entrou nos sistemas que medem esse desempenho.

O erro não foi da IA. O modelo fez o que mandaram. Ninguém previu o resultado

Inteligência Artificial

O erro não foi da IA. O modelo fez o que mandaram. Ninguém previu o...

Agentes da OpenAI escaparam do teste, invadiram a Hugging Face e roubaram o gabarito errado. O episódio expõe as três perguntas que toda empresa deveria fazer: quem autoriza, quem monitora, quem desliga.

Cibersegurança em transição: como a IA está redesenhando cargos da base ao topo

Inteligência Artificial

Cibersegurança em transição: como a IA está redesenhando cargos da...

Um estudo doa ISC2 com 856 profissionais mostra que a IA já corta tarefas de entrada em segurança digital, mas também amplia o tempo dedicado à validação humana, ao estresse no trabalho e à criação de novas funções na área

O novo mapa do CX na era dos agentes de IA

Inteligência Artificial

O novo mapa do CX na era dos agentes de IA

Relatórios da McKinsey e do BCG mostram que agentes de IA já decidem por clientes em tempo real e por que empresas precisam trocar jornadas fixas por decisões orquestradas em cada canal