The Shift

A IA não vai morar em um lugar só

A tendência mais visível da IA para 2027 está nas vitrines: PCs, celulares e novos equipamentos desenhados em torno da inteligência artificial. Por baixo dela acontece uma mudança maior. A IA está se distribuindo entre o dispositivo, a borda, o data center e a nuvem, conforme o que cada tarefa exige em custo, latência, privacidade e continuidade.

Para as empresas, isso traz uma consequência. Não bastará decidir qual IA usar. Será preciso decidir onde vale a pena executá-la.

Os sinais se acumulam. Em 21 de setembro de 2026, o Google abriu a pré-venda dos Googlebooks, laptops construídos em torno do Gemini Intelligence, a partir de US$ 899. Em 10 de setembro, a Qualcomm detalhou uma nova arquitetura de NPU projetada para agentes que funcionam continuamente no dispositivo. A Nvidia vende o DGX Spark como um computador de mesa para executar modelos e agentes localmente. E a Apple liberou em 14 de setembro o iOS 27, que distribui a IA entre modelos no aparelho e o Private Cloud Compute.

CADASTRE-SE GRÁTIS PARA ACESSAR 5 CONTEÚDOS MENSAIS

Já recebe a newsletter? Ative seu acesso

Ao cadastrar-se você declara que está de acordo
com nossos Termos de Uso e Privacidade.

Cadastrar

A nuvem continua central. Modelos de fronteira, treinamento e tarefas computacionalmente pesadas seguirão exigindo infraestrutura centralizada. O que muda é a divisão do trabalho: uma parte crescente dele pode acontecer em outros lugares.

Três forças empurram a indústria nessa direção: custo, latência e privacidade. Uma quarta, especialmente importante para empresas, começa a aparecer: continuidade operacional. Todas ganham peso à medida que a IA deixa de ser acionada algumas vezes por dia e agentes passam a trabalhar continuamente.

Nem todo pensamento precisa virar um token

O custo ajuda a entender por que esse movimento está acontecendo agora.

Usar um chatbot algumas vezes por dia é uma coisa. Manter um agente observando informações, chamando ferramentas, consultando bancos de dados, verificando resultados e repetindo essas operações continuamente é outra.

Imagine um agente encarregado de verificar determinadas fontes a cada dez minutos, comparar o que encontrou com informações anteriores e publicar uma mensagem no Slack somente quando houver uma mudança relevante. Na nuvem, cada ciclo pode gerar novas chamadas ao modelo. O mesmo vale para agentes que acompanham código, documentos, máquinas, câmeras ou outros fluxos de informação. Quanto mais persistente o agente, maior pode ser o volume de inferência.

É aí que o processamento local começa a mudar a equação. Em vez de pagar a um provedor a cada nova inferência, uma empresa pode executar parte dessas operações em hardware que já comprou. Parte da conta variável da IA pode migrar para capacidade própria.

A Nvidia tornou esse argumento parte da proposta comercial do DGX Spark. A empresa afirma que desenvolvedores que rodam agentes em hardware próprio, com o NemoClaw orquestrando a execução, mantêm o contexto sensível no dispositivo e deixam de pagar por token a um provedor de inferência. Baseado no GB10 Grace Blackwell Superchip, o equipamento combina memória unificada e a pilha de software da Nvidia para executar modelos e workloads de IA localmente. A empresa também oferece configuração guiada para conectar várias unidades em cluster.

Os computadores da Apple apontam na mesma direção por outro caminho. Macs já executam localmente modelos abertos e conseguem absorver workloads que, em outras configurações, dependeriam de infraestrutura remota. O processamento local pode reduzir gastos com tokens e manter dados na própria máquina.

Isso não torna o hardware próprio automaticamente mais barato do que consumir IA como serviço. A máquina custa dinheiro, usa energia, precisa ser administrada e não executa todos os modelos. Modelos de fronteira continuam muito além da capacidade da maioria dos equipamentos pessoais.

A questão é o custo marginal. Depois de comprar o hardware, executar mais uma pequena inferência localmente não gera uma nova cobrança por milhares ou milhões de tokens. Para agentes que repetem tarefas continuamente, essa diferença se acumula.

Quanto mais a IA trabalha sem que alguém precise chamá-la, maior o incentivo para que nem todo pensamento seja comprado da nuvem.

O dispositivo começa a ser construído em torno da IA

O Googlebook foi anunciado em 12 de maio de 2026. As entregas começam em 4 de outubro nos Estados Unidos e em 5 de outubro em outros seis países. O Brasil não está entre eles. O Google diz ter desenhado a categoria para que o Gemini Intelligence faça parte da própria experiência da máquina.

O Magic Pointer é um exemplo. Em vez de copiar algo da tela, abrir um chatbot, colar o conteúdo e formular uma pergunta, o usuário movimenta o cursor e dá ao Gemini o contexto do que está vendo. O Rambler faz algo semelhante com voz: transforma fala desestruturada em conteúdo organizado no lugar em que o usuário está digitando. O Create My Widget permite descrever em linguagem natural o widget que se deseja criar. E o ambiente de desenvolvimento Antigravity já vem instalado.

A mudança parece pequena, mas é conceitualmente importante. A IA fica disponível no ponto da interface onde o trabalho acontece, sem exigir que o usuário vá até ela.

Integração, porém, não equivale necessariamente a processamento local. Todos os modelos trazem NPUs capazes de inferência no aparelho, mas o Google não detalha quais recursos rodam na máquina e quais dependem da nuvem. Cada Googlebook vem com 12 meses de assinatura de ferramentas avançadas de IA e armazenamento em nuvem.

Quando a inferência também migra para o aparelho, o hardware precisa acompanhar. A Qualcomm apresentou em 10 de setembro uma nova arquitetura da Hexagon NPU desenhada para IA agêntica. A companhia argumenta que agentes precisam de mais do que executar um grande modelo: mantêm contexto, lidam com múltiplas ferramentas, executam tarefas simultâneas e permanecem ativos por longos períodos.

A nova arquitetura aumenta em 50% o subsistema de memória compartilhada da NPU, para manter mais dados necessários à execução dos modelos próximos ao processamento e reduzir acessos à memória externa. Também foi projetada para modelos Mixture-of-Experts e suporta precisões de INT2 a FP16. Para modelos INT4, a Qualcomm afirma entregar até 50% mais desempenho no prefill. São números do próprio fabricante, que, no anúncio de 10 de setembro, não detalhou o tamanho absoluto dessa memória nem o consumo de energia da nova NPU. A direção da arquitetura, porém, é reveladora: o processador móvel está sendo redesenhado para manter mais trabalho agêntico no dispositivo.

O segundo problema é a distância

Toda vez que uma aplicação depende de um modelo remoto, existe uma viagem. A informação sai do dispositivo, atravessa a rede, chega ao data center, é processada e volta.

Para uma pergunta a um chatbot, alguns segundos são aceitáveis. Para um agente integrado ao sistema operacional, a uma câmera, a uma linha industrial, a um veículo ou a óculos, essa latência pode ser parte do problema. Quanto mais a IA precisa perceber o ambiente e reagir a ele, maior a vantagem de processar perto do lugar onde o dado é produzido.

Esse princípio é anterior à IA Generativa. A visão computacional trabalha com ele há anos.

Fabiano Sabatini Quintas, Diretor de Alianças e Head de Edge AI da Intel para a América Latina, descreve uma arquitetura que a empresa chama de Edge to Cloud. Em vez de escolher entre processamento local e nuvem, a aplicação pode atravessar diferentes camadas: dispositivo, edge, data center e cloud.

Ele conta que clientes de visão computacional costumam prototipar no próprio notebook. Quando funciona, migram para um mini PC; quando a escala cresce, para o servidor; quando há sites remotos, para a nuvem. Segundo Quintas, a escolha é determinada por latência, segurança e custo. São praticamente os mesmos vetores que agora aparecem na IA Generativa.

A visão computacional já fez essa viagem

Uma câmera não produz perguntas ocasionais. Produz dados continuamente. Multiplique isso por centenas ou milhares de câmeras e transportar tudo apenas para descobrir o que merece atenção pode se tornar caro, lento ou operacionalmente inadequado.

A Intel atua nesse mercado há anos com o OpenVINO, toolkit para otimizar e executar modelos de IA em diferentes tipos de hardware. Quintas cita aplicações de reconhecimento de pessoas, objetos e placas, reconhecimento facial, segurança bancária e onboarding. Em instalações com muitas câmeras, parte do processamento acontece em servidores locais; em outros casos, chega à nuvem.

Na indústria, a lógica fica ainda mais concreta. Ainda há fábricas em que pessoas fazem inspeção visual de qualidade. Sistemas de visão computacional podem acompanhar os produtos na linha, identificar defeitos e separar itens fora do padrão. Segundo Quintas, parceiros da Intel já operam sistemas desse tipo em escala.

A visão computacional criou uma economia de IA em que nem sempre faz sentido mover todo o dado para a nuvem. Os agentes criam um problema semelhante por outro caminho. No lugar de um fluxo contínuo de imagens, podem gerar um fluxo contínuo de inferências. Agentes e IA Generativa podem estender essa decisão a uma variedade muito maior de workloads: documentos, voz, código, bancos de dados, aplicativos, sensores e ferramentas.

Agentes não significam necessariamente edge

O crescimento dos agentes não implica que eles deixarão os data centers para morar nos dispositivos. Questionado se agentes trabalham mais na borda, Quintas corrige a premissa: “A maioria dos agentes hoje funcionam dentro de Cloud.”

A explicação que vem depois pesa mais do que a negativa. O trabalho de um agente vai além de chamar um modelo generativo. Ele acessa bancos de dados, conecta sistemas empresariais, valida informações, executa regras de negócio e conversa com sistemas legados.

A carga computacional de um agente é, portanto, heterogênea. Um LLM pode realizar parte do raciocínio. CPUs podem assumir orquestração e aplicações; NPUs, modelos menores e tarefas contínuas; GPUs, inferências mais pesadas. A divisão varia conforme o workload. Algumas tarefas ficam no dispositivo, outras num servidor local, outras na cloud.

A Intel tem interesse comercial evidente nessa leitura, porque CPUs estão no centro de seu negócio. Os números de Quintas devem ser lidos como afirmações da companhia. Segundo ele, um workload generativo pode demandar algo próximo de oito GPUs por CPU, enquanto workloads agênticos podem chegar a duas GPUs por CPU, ou até uma para uma, dependendo da aplicação. A justificativa é o peso da orquestração dos dados.

O argumento arquitetural vale mais do que a proporção: medir a infraestrutura de um agente só pela capacidade exigida pelo modelo deixa de fora boa parte do trabalho que o sistema faz. Com agentes, decidir onde cada parte do trabalho acontece ganha peso.

Privacidade muda a conta outra vez

Quanto mais útil se torna a IA, mais sensíveis tendem a ser os dados de que ela precisa.

Um chatbot sabe aquilo que decidimos contar a ele. Um agente integrado ao dispositivo pode ter acesso à tela, documentos, mensagens, calendário, câmera, microfone e localização. Um relógio acrescenta sensores corporais. Óculos enxergam o que o usuário vê. Dentro de uma empresa, agentes lidam com código-fonte, contratos, propriedade intelectual e comunicações internas. Quanto mais contextual a IA, maior sua utilidade e maior o problema de enviar esse contexto continuamente a servidores de terceiros.

A arquitetura da Apple mostra como a indústria tenta resolver essa tensão. A terceira geração dos Apple Foundation Models, apresentada em 8 de junho de 2026 e desenvolvida pela Apple em colaboração com o Google, reúne cinco modelos: dois rodam no dispositivo e três no Private Cloud Compute.

O mais capaz da família, o AFM 3 Cloud Pro, roda em GPUs da Nvidia hospedadas no Google Cloud. Foi a primeira vez que a Apple estendeu o Private Cloud Compute a infraestrutura de terceiros, com a promessa de manter as mesmas garantias de privacidade. A companhia afirma que os dados pessoais usados nas solicitações não são armazenados nem ficam acessíveis à própria Apple, e publicou a documentação de segurança da arquitetura para análise externa.

Para esta discussão, o que interessa é o desenho: dispositivo quando possível, nuvem quando necessário. E o caso da Apple mostra que, mesmo para uma empresa que controla chip, sistema operacional e aparelho, a nuvem necessária hoje inclui Google e Nvidia.

Há ainda um quarto fator: continuar funcionando

Para empresas, o processamento local tem uma vantagem que costuma ficar em segundo plano quando se discute latência: resiliência.

Quintas dá o exemplo do varejo. Dentro de uma loja, certas aplicações precisam responder em tempo real e não podem parar porque a conexão com a nuvem ficou instável. Se a loja perder a conexão, diz, ela precisa continuar operando.

Nesses casos, processar localmente vai além de economizar tokens ou reduzir latência: permite manter a operação mesmo sem conexão com a nuvem. A mesma lógica vale para fábricas, veículos, sistemas de segurança e equipamentos em locais remotos. Quanto mais a IA participa de uma operação física, mais importante se torna saber o que acontece quando a conexão cai. A vantagem do edge, aqui, está em permitir que decisões aconteçam perto do dado e independentemente de uma conexão externa.

“Dispositivo” começa a significar muito mais do que PC

No mundo descrito pela Intel, o dispositivo pode ser um mini PC numa loja, um servidor ao lado de uma linha de produção ou uma máquina processando imagens de câmeras. Para a Qualcomm, smartphone, PC, fone ou óculos. Para a Nvidia, uma pequena máquina Blackwell sobre a mesa.

A expressão on-device AI fica pequena para descrever a mudança. O que está surgindo é uma arquitetura distribuída de IA.

O CEO da Qualcomm, Cristiano Amon, tem descrito uma IA distribuída por smartphones, PCs, wearables, carros e outros equipamentos. Nessa visão, telefone, PC, wearables e óculos funcionam como nós de um mesmo sistema, cada um com seus sensores e sua capacidade, enquanto processamento local, edge e nuvem assumem tarefas diferentes.

No ambiente corporativo, a mesma lógica aparece de outra forma. Nos bancos, segundo Quintas, a análise começa por separar o que é workload de GPU, de CPU e de NPU. Só então se define a camada adequada: nuvem, data center, agência ou PC. A infraestrutura passa a ser escolhida pedaço a pedaço da IA.

E isso pode mexer na economia da infraestrutura

Uma das grandes apostas da indústria é que agentes farão a inferência crescer muito mais rápido do que o uso de chatbots. Um sistema que trabalha continuamente em nome de uma pessoa ou empresa pode produzir muito mais operações do que outro que espera perguntas. Essa expectativa sustenta a corrida por data centers, GPUs, memória, redes e energia.

A conta, porém, depende de uma variável: o lugar onde essa nova inferência vai acontecer.

Se um agente executa centenas de operações por dia inteiramente na nuvem, seu crescimento aparece como mais tokens consumidos e mais demanda nos data centers. Se parte delas migra para um Mac, PC, smartphone, câmera, carro, servidor de edge ou DGX Spark, o mesmo crescimento produz outra distribuição do gasto.

Uma parcela continua comprando tokens. Outra compra chips, memória, armazenamento, NPUs, GPUs e dispositivos.

Isso ajuda a explicar por que empresas em posições tão diferentes da cadeia chegam ao mesmo problema. A Nvidia, principal fornecedora do hardware de IA nos data centers, colocou a arquitetura Blackwell numa máquina compacta para desenvolvedores. A Qualcomm redesenha sua NPU para agentes persistentes, multimodais e de baixa latência. A Apple controla chip, dispositivo e sistema operacional, desenvolve seus modelos em colaboração com o Google e distribui o processamento entre o aparelho e o Private Cloud Compute, que agora inclui servidores de terceiros. O Google pôs o Gemini Intelligence no centro de uma nova categoria de computador. E a Intel tenta ocupar todas as camadas, com CPU, GPU e NPU, do PC à cloud.

Todas mantêm a nuvem no centro. A aposta comum é que a IA será grande demais para morar em um único lugar.

Os próximos sinais

Agentes aumentam o volume de inferência. O custo incentiva executar localmente tarefas frequentes e menores. A latência favorece o processamento perto de onde a ação acontece. A privacidade desencoraja enviar continuamente dados sensíveis a terceiros. E operações físicas exigem continuar funcionando quando a conexão falha. Nenhum desses fatores tira a nuvem do centro. Juntos, porém, fazem a IA se espalhar para muito além dela.

O primeiro teste começou em 22 de setembro de 2026, no Snapdragon Summit, em Maui, onde a Qualcomm apresentou sua próxima geração de plataformas móveis premium, que leva a nova Hexagon NPU aos smartphones. Em 4 de outubro, os primeiros Googlebooks chegam às lojas nos Estados Unidos. Em outubro, a nova Siri, ainda em beta, passa a falar português, e o usuário brasileiro poderá ver na prática como a Apple divide o trabalho entre aparelho e nuvem.

Durante anos, a indústria mediu quanto compute a IA exigiria. A nova disputa é sobre onde esse compute vai ficar.


ENTREVISTA

Na era dos agentes, a conta da IA volta para a CPU

O mercado aprendeu a associar inteligência artificial a GPU. Para Fabiano Sabatini, Diretor de Alianças e Head de Edge AI da Intel para a América Latina, a leitura é parcial. Treinar grandes modelos exige GPU, mas a maior parte do uso corporativo é inferência, e aí a conta muda. “90% dos workloads de inferência rodam em CPU, afirma. Segundo ele, a CPU permite executar essas cargas de forma otimizada e segura, e escalar mais rápido. O percentual é da própria Intel, que tem na CPU o centro de seu negócio. A chegada dos agentes de IA, segundo ele, empurra esse equilíbrio ainda mais para o lado da CPU.

A distinção importa porque define custo e escala. Tratar de IA apenas pelo treinamento, resume, é “estar olhando só um pedaço da história”. O restante depende do que ele chama de “computação heterogênea”, a combinação de CPU, GPU e NPU distribuída da borda à nuvem, em que cada carga roda no processador mais adequado.

Com os agentes, o argumento ganha peso. Segundo Sabatini, o agente passa a maior parte do tempo orquestrando: acessa bancos de dados, aplica regras de negócio e conecta sistemas legados, tarefas que pesam sobre a CPU.

A vantagem que a Intel tenta explorar é a portabilidade. O mesmo software roda do notebook ao servidor e à nuvem “sem precisar ficar fazendo recode”: um cliente pode prototipar no próprio notebook, passar a um mini PC, subir ao servidor e chegar à nuvem sem trocar o código. Migrar para uma GPU de terceiros ou para a arquitetura ARM, ao contrário, exige reescrever software e lidar com licenças. A escolha entre CPU, GPU e NPU, diz, se faz “de acordo com a necessidade de latência, de segurança, do custo”. A empresa entrega isso pelos parceiros, na nuvem com o Xeon 6 e na borda via fabricantes de hardware, e sustenta parte do ecossistema de software sem vender software: contribui com o kernel Linux, criou o OpenCV e mantém o toolkit OpenVINO, de visão computacional.

A Intel é uma das maiores empresas de software mesmo sem vender software.

A aposta mais madura está em visão computacional. A parceria da Intel com a WEG, anunciada em novembro de 2024, materializa o argumento: sistemas de visão e robôs autônomos levados ao chão de fábrica. Num dos casos, uma cimenteira que perdia sacos danificados no transporte passou a detectá-los automaticamente e ganhou 4% de eficiência operacional.

A tecnologia de visão já é muito melhor do que a visão humana.

Dentro da visão computacional, o segmento que mais escala é segurança e vigilância, que já avança para os VLMs, modelos generativos aplicados a vídeo. A base é transversal: cidades, varejo, saúde e o próprio banco, em onboarding e segurança de agências, recorrem à mesma tecnologia.

No setor financeiro, o trabalho da Intel é, diz Sabatini, “muito mais consultivo”. Segundo a Pesquisa Febraban de Tecnologia Bancária 2026, 83% das transações do setor em 2025 passaram por canais digitais, e os investimentos em tecnologia devem chegar a R$ 50,4 bilhões em 2026. A Intel entra em todas as camadas, da nuvem à agência, e ajuda a mapear quais cargas são de GPU, quais de CPU e quais de NPU antes de definir a arquitetura, com o portfólio chegando pelo parceiro com quem o banco já se relaciona.

É nesse ponto que a tese se fecha. A vantagem competitiva não está em comprar mais GPU, e sim em alocar cada carga no processador certo, da borda à nuvem, e escalar sem desperdício.