Use transfer learning. Faça fine-tuning do modelo existente no novo conjunto de dados do domĂnio.
Por quĂȘ: Reaproveita representaçÔes aprendidas, reduz o tempo de treinamento e a necessidade de dados em comparação com a construção de um modelo do zero.
Escolha um modo de inferĂȘncia do SageMaker para o formato da carga de trabalho.
LatĂȘncia baixa e estĂĄvel â tempo real. TrĂĄfego em picos/ocioso â serverless. Carga Ăștil grande (â€1 GB) ou trabalho longo (â€1 h) com quase tempo real â assĂncrono. Bulk offline â batch transform.
Corretude da classificação de imagem/binĂĄria â acurĂĄcia. Detalhamento de classes â matriz de confusĂŁo. Classes desbalanceadas â F1, precisĂŁo, recall. Independente de limiar â AUC.
Por quĂȘ: A acurĂĄcia engana em dados desbalanceados; a matriz de confusĂŁo mostra contagens de TP/FP/TN/FN; F1 equilibra precisĂŁo e recall.
Overfitting. Mitigue com mais dados, regularização, early stopping, dropout ou modelo mais simples.
Por quĂȘ: Grande diferença entre treinamento e teste significa que o modelo memorizou ruĂdo em vez de aprender padrĂ”es.
Escolha o serviço de IA gerenciado para uma tarefa de propĂłsito Ășnico.
NLP/sentimento/entidades â Comprehend. Fala para texto â Transcribe. Texto para fala â Polly. Tradução â Translate. Chatbot/UI de voz â Lex. Imagem/vĂdeo â Rekognition. Extração de texto de Doc/PDF â Textract. RecomendaçÔes â Personalize. PrevisĂŁo â Forecast.
Construa uma aplicação de IA generativa na AWS sem gerenciar a infraestrutura do modelo.
Amazon Bedrock - acesso totalmente gerenciado a modelos de fundação (Anthropic Claude, Meta Llama, Amazon Titan, Stability, AI21, Mistral, Cohere) via uma Ășnica API.
Por quĂȘ: A contagem de tokens, nĂŁo a contagem de solicitaçÔes, impulsiona o preço do Bedrock. Se um documento longo exceder a janela de contexto, fragmente-o ou escolha um modelo com janela maior.
Escolha o estilo de saĂda: determinĂstico vs criativo.
Temperatura baixa (~0.0-0.3) â determinĂstico, repetĂvel. Temperatura alta (~0.7-1.0) â criativo, variado. Use 0 para classificação ou sentimento para obter rĂłtulos consistentes.
Alucinação. Mitigue com RAG (baseado em fatos recuperados), Bedrock Guardrails, temperatura mais baixa e revisĂŁo humana de saĂdas de alto risco.
Alimente busca semùntica, clustering ou recuperação RAG sobre texto ou dados multimodais.
Use um modelo de embedding (por exemplo, Titan Embeddings, Cohere Embed) para converter conteĂșdo em vetores densos. Armazene e consulte em um DB vetorial.
Por quĂȘ: Embeddings capturam o significado semĂąntico para que itens semelhantes se aproximem no espaço vetorial (similaridade de cosseno / produto escalar).
Por quĂȘ: Esforço e custo aumentam a cada passo. Pare no primeiro que atenda ao requisito.
AplicaçÔes de Modelos de Fundação
Aumente um modelo de fundação com dados privados da empresa (PDFs, documentos, conteĂșdo S3) sem fine-tuning.
Crie uma base de conhecimento do Amazon Bedrock. O Bedrock lida com ingestĂŁo, fragmentação, embedding e recuperação (RAG) no momento da inferĂȘncia.
Por quĂȘ: Mais barato e rĂĄpido de atualizar do que fine-tuning. Mudanças nos dados de origem â ressincronize a KB; sem retreinamento.
Fluxo de trabalho multi-etapas que combina raciocĂnio LLM com chamadas a APIs externas, bancos de dados ou serviços AWS.
Amazon Bedrock Agents - orquestra raciocĂnio LLM, invocação de ferramentas/API e sĂntese de resultados em um Ășnico tempo de execução gerenciado.
Por quĂȘ: Os Agents planejam etapas, chamam ferramentas e juntam os resultados em uma resposta final sem que vocĂȘ precise escrever o loop de orquestração.
Escolha um banco de dados vetorial para embeddings.
RAG gerenciado â Bedrock Knowledge Bases (lida com o armazenamento vetorial automaticamente). DB vetorial personalizado â OpenSearch Service (k-NN), Aurora PostgreSQL com pgvector, Neptune Analytics ou RDS para PostgreSQL com pgvector.
Restrinja tĂłpicos de LLM, filtre conteĂșdo prejudicial, mascare PII ou bloqueie padrĂ”es de injeção de prompt.
Amazon Bedrock Guardrails. Configure tĂłpicos negados, filtros de conteĂșdo (Ăłdio, violĂȘncia, sexual, insultos), filtros de palavras, filtros de informaçÔes sensĂveis e verificaçÔes de fundamentação contextual.
Por quĂȘ: Aplicado tanto a entradas quanto a saĂdas; funciona em qualquer modelo Bedrock e em seus prĂłprios modelos personalizados.
Determine a parcela de responsabilidade de segurança da empresa para uma implantação de IA generativa.
Matriz de Escopo de Segurança de IA Generativa da AWS. Escopo 1 (aplicativo de consumo, menor responsabilidade) â Escopo 5 (modelo auto-treinado, maior responsabilidade).
Por quĂȘ: Construir e treinar um modelo do zero em dados privados coloca a responsabilidade mĂĄxima de segurança na empresa.
Partes interessadas ou reguladores exigem uma explicação de como o modelo chega às suas previsÔes.
Use modelos interpretĂĄveis quando possĂvel (ĂĄrvores de decisĂŁo, regressĂŁo linear/logĂstica). Para modelos complexos, use Partial Dependence Plots, importĂąncia de caracterĂsticas SHAP via SageMaker Clarify, ou SageMaker Model Cards.
Por quĂȘ: PDPs mostram o efeito marginal de cada caracterĂstica; SHAP atribui contribuição por previsĂŁo; cartĂ”es de modelo capturam a histĂłria completa para auditoria.
A saĂda da IA generativa pode reproduzir material protegido por direitos autorais ou ser apresentada como trabalho autoral humano.
Risco de plĂĄgio / infração de IP. Mitigue com requisitos de citação, rastreamento de proveniĂȘncia de conteĂșdo, marca d'ĂĄgua onde suportado, revisĂŁo humana e polĂticas claras de divulgação de conteĂșdo de IA.
Segurança, Conformidade e Governança para SoluçÔes de IA
O aplicativo do modelo de fundação deve manter prompts e respostas na rede AWS - sem saĂda pĂșblica para a internet.
Bedrock com endpoints VPC (PrivateLink) para a API de tempo de execução. Bloqueie endpoints pĂșblicos do Bedrock com SCPs no nĂvel da organização.
Capture a atividade do Bedrock para monitoramento, depuração, auditoria e conformidade.
Dois serviços complementares. CloudTrail = quem/quando/de-onde para cada chamada de API (identidade, timestamp, IP de origem). Registro de invocação de modelo Bedrock = a carga Ăștil real de prompt/resposta, escrita para CloudWatch Logs ou S3. Habilite ambos.
Por quĂȘ: O CloudTrail captura apenas metadados; o registro de invocação captura conteĂșdo. A conformidade frequentemente exige ambos.
Descobrir e classificar PII ou outros dados sensĂveis armazenados no S3 (corpus de treinamento, logs de modelo).
Amazon Macie - descoberta de dados sensĂveis impulsionada por ML para S3.
Por quĂȘ: Use o Macie para encontrar dados que precisam de mascaramento, exclusĂŁo ou criptografia KMS antes que acabem em um modelo ou em suas saĂdas.
Por quĂȘ: O conhecimento incorporado nos pesos do modelo nĂŁo pode ser mascarado de forma confiĂĄvel na inferĂȘncia; apenas o retreinamento sem esses dados o remove.
Decida o que a AWS protege versus o que o cliente protege para uma carga de trabalho de IA.
Modelo de Responsabilidade Compartilhada da AWS: AWS = segurança DA nuvem (hardware, hypervisor, regiÔes). Cliente = segurança NA nuvem (dados, IAM, chaves KMS, rede, configuração de aplicativo).