Choisir un modĂšle de fondation Bedrock pour un cas d'utilisation.
Raisonnement Ă contexte long + utilisation d'outils â Claude (Sonnet/Opus). Chat optimisĂ© en termes de coĂ»ts â Claude Haiku ou Titan Text Lite. Code â Claude ou Llama. Embeddings â Titan Embeddings V2 ou Cohere Embed. GĂ©nĂ©ration d'images â Titan Image, Stable Diffusion ou Nova Canvas. Poids ouverts avec contrĂŽle de l'auto-hĂ©bergement â Llama, Mistral ou Custom Model Import.
Pourquoi: Aucun modÚle unique n'est le meilleur en termes de coût, de latence, de capacité et de conditions de licence. Faites correspondre la classe de modÚle au goulot d'étranglement.
Référence
La source de la base de connaissances (KB) est constituée de FAQ courtes et autonomes ou de descriptions de produits (~100 à 500 mots chacune).
Découpage en chunks de taille fixe avec la taille de token par défaut (300) et un chevauchement (20%).
Pourquoi: Les unités autonomes ne bénéficient pas du découpage conscient des limites. La taille fixe est la plus simple et la moins chÚre.
Référence
Les documents contiennent des changements de sujet naturels au sein des paragraphes ; les divisions de taille fixe interrompent les phrases en plein milieu d'une idée.
Découpage sémantique. Les bases de connaissances Bedrock regroupent des phrases consécutives dont les embeddings sont proches, et effectuent des divisions aux frontiÚres de sens.
Pourquoi: PrĂ©serve les idĂ©es cohĂ©rentes Ă l'intĂ©rieur d'un chunk â rĂ©cupĂ©ration plus propre, meilleure qualitĂ© de rĂ©ponse.
Référence
Manuels techniques longs avec des références croisées entre les sections ; les questions nécessitent une synthÚse à travers un document.
Découpage hiérarchique. Bedrock construit des chunks parents (grands) + enfants (petits) ; récupÚre sur les embeddings des enfants, renvoie le contexte parent.
Pourquoi: Les petits chunks permettent une récupération précise ; le contexte parent préserve les références croisées et les détails environnants.
Référence
Les fichiers source sont pré-découpés en chunks ou chaque fichier est intentionnellement une seule unité logique.
Aucune stratégie de découpage. Chaque fichier devient un chunk dans la base de connaissances (KB).
Référence
La source PDF contient du texte + des diagrammes ; les utilisateurs posent des questions qui nécessitent de comprendre les diagrammes.
Activer l'analyse avancée de Bedrock KB avec un modÚle de fondation (Claude/Nova) comme parseur. Les diagrammes et les tableaux sont décrits via la vision, puis intégrés.
Pourquoi: L'analyse par défaut est textuelle uniquement. L'analyse multimodale convertit le contenu visuel en texte descriptif avant l'intégration.
Référence
Choisir Titan Embeddings G1 ou V2.
V2 prend en charge des dimensions configurables (256/512/1024) et surpasse G1 sur les benchmarks multilingues. G1 est fixe à 1536. Choisir V2 pour les cas d'utilisation limités en stockage ou non-anglais ; G1 uniquement pour la compatibilité héritée.
Référence
Catalogue de 500 000 produits : titres courts (50 mots) + spécifications longues (500 mots). Optimiser la qualité de recherche + le coût.
IntĂ©grer chaque Ă©lĂ©ment une fois (champs combinĂ©s ou sĂ©parĂ©s). Utiliser Titan Embeddings V2 avec des dimensions rĂ©duites (256 ou 512) pour le coĂ»t ; intĂ©grer la requĂȘte et le document avec le mĂȘme modĂšle.
Pourquoi: MĂ©langer les modĂšles d'embedding ou ignorer la normalisation perturbe la recherche de similaritĂ©. Des dimensions infĂ©rieures rĂ©duisent le coĂ»t de stockage et de requĂȘte avec une perte de qualitĂ© marginale.
Référence
Choisir un magasin vectoriel pour les bases de connaissances Bedrock.
Configuration par dĂ©faut / la plus rapide â Amazon OpenSearch Serverless (autogĂ©rĂ©). Sous-ms avec mises Ă jour frĂ©quentes de schĂ©ma + jointures relationnelles â Aurora PostgreSQL avec pgvector. Client Pinecone / MongoDB Atlas / Redis existant â le conserver. KB minuscule (<10 000 documents) optimisĂ©e en termes de coĂ»ts â Aurora pgvector ou Neptune Analytics.
Pourquoi: OpenSearch Serverless est la valeur par défaut la plus simple. Aurora pgvector l'emporte lorsque vous avez besoin de transactions ou de jointures sur les métadonnées.
Référence
La base de connaissances (KB) renvoie des documents sémantiquement pertinents, mais ils proviennent de versions obsolÚtes/de mauvaise région.
Ajouter des mĂ©tadonnĂ©es aux fichiers source (`version`, `region`, `effective_date`) et appliquer des filtres de mĂ©tadonnĂ©es au moment de la requĂȘte via `retrievalConfiguration.vectorSearchConfiguration.filter`.
Pourquoi: La pure similarité vectorielle ignore la récence et l'autorité. Le filtrage des métadonnées réduit le pool de candidats avant le classement.
Référence
RAG manque les requĂȘtes contenant des identifiants exacts (SKU, codes d'erreur, numĂ©ros de rĂ©glementation) car la recherche sĂ©mantique surpondĂšre le texte de sens similaire.
Activer la recherche hybride sur la base de connaissances (sémantique + mot-clé/BM25). Combine la similarité vectorielle avec la correspondance lexicale pour les ID, les codes et les noms propres.
Référence
Top-k=5 récupÚre 5 chunks mais le plus pertinent est souvent classé 3Úme ou 4Úme.
Augmenter `numberOfResults` Ă 20, puis activer un modĂšle de reranking (Cohere Rerank ou Amazon Rerank) pour rĂ©organiser par pertinence par rapport Ă la requĂȘte originale.
Pourquoi: La similaritĂ© d'embedding â pertinence de la tĂąche. Les rerankers Ă encodeur croisĂ© voient la requĂȘte + le chunk ensemble et les notent prĂ©cisĂ©ment.
Référence
Les questions des utilisateurs sont conversationnelles, en plusieurs parties, ou contiennent des pronoms/suivis ; la qualité de récupération de la base de connaissances (KB) diminue.
Activer la reformulation des requĂȘtes de la base de connaissances (KB) Bedrock. Le modĂšle réécrit les requĂȘtes complexes en plusieurs sous-requĂȘtes ciblĂ©es avant la rĂ©cupĂ©ration.
Référence
Les documents source S3 sont mis à jour fréquemment ; la base de connaissances (KB) doit toujours refléter les derniÚres versions sans synchronisation manuelle.
Configurer la source de donnĂ©es de la base de connaissances (KB) pour une synchronisation automatisĂ©e via les notifications d'Ă©vĂ©nements S3 â EventBridge â StartIngestionJob, ou utiliser la synchronisation planifiĂ©e de la KB. Ăviter de dĂ©pendre du bouton "Sync" manuel de la console.
Référence
Le modÚle QA à document long hallucine sur les questions dont les réponses se trouvent au milieu du document.
Ne pas passer des documents entiers dans le prompt - découper en chunks + récupérer via RAG afin que seuls les chunks pertinents atteignent le modÚle. Si le document entier est obligatoire, utiliser un modÚle avec une forte capacité de rappel de contexte long (Claude Sonnet 200K) et placer la question aprÚs le document.
Pourquoi: La plupart des LLM présentent une dégradation du rappel "perdu au milieu". RAG contourne ce problÚme ; le placement aide lorsque RAG n'est pas disponible.
Choisir la personnalisation la moins chÚre qui répond aux exigences de qualité.
Essayer dans l'ordre : (1) ingĂ©nierie de prompt, (2) RAG avec base de connaissances (KB), (3) fine-tuning, (4) prĂ©-entraĂźnement continu, (5) Custom Model Import. S'arrĂȘter Ă la premiĂšre qui satisfait les exigences.
Pourquoi: L'effort et le coût continu augmentent à chaque étape. Le fine-tuning + Provisioned Throughput est beaucoup plus cher que RAG.
Référence
Fine-tuner un modÚle Bedrock avec des exemples de tùches étiquetés.
Fichier JSONL dans S3 avec un exemple par ligne : `{"prompt": "...", "completion": "..."}` (ou équivalent au format chat pour la famille de modÚles).
Pourquoi: Chaque famille de modÚles (Titan, Claude, Llama) a un schéma spécifique ; vérifier la documentation de fine-tuning du modÚle avant de formater.
Référence
Adapter un modÚle de fondation à un vocabulaire spécialisé (juridique, médical, scientifique) en utilisant de nombreux textes de domaine non étiquetés.
Pré-entraßnement continu sur le corpus de domaine non étiqueté. Différent du fine-tuning d'instructions (qui nécessite des paires prompt-complétion).
Pourquoi: Le pré-entraßnement continu met à jour la compréhension du langage ; le fine-tuning d'instructions enseigne le comportement de la tùche. Forme de données différente, objectif différent.
Référence
Les données d'interaction client pour le fine-tuning contiennent des noms, des e-mails, des numéros de téléphone.
Nettoyer ou tokeniser les PII avant de télécharger l'ensemble de données d'entraßnement vers S3. Une fois que les poids absorbent les PII, le filtrage de sortie ne peut pas les masquer de maniÚre fiable.
Pourquoi: Le modÚle fine-tuné peut régurgiter des fragments de données d'entraßnement. Le nettoyage au niveau de la couche de données est la seule atténuation durable.
Référence
Apporter un modÚle Llama ou Mistral auto-fine-tuné et le servir via l'API unifiée de Bedrock.
Importation de modÚle personnalisé (Custom Model Import). Télécharger les poids vers S3, les enregistrer auprÚs de Bedrock, les invoquer via le runtime Bedrock avec IAM et logging unifiés.
Pourquoi: Permet de réutiliser les Guardrails, les bases de connaissances (KB) et les Agents Bedrock sur vos propres poids sans avoir à déployer des points de terminaison SageMaker.
Référence
Déployer un modÚle Bedrock fine-tuné en production.
Acheter un dĂ©bit provisionnĂ© (Provisioned Throughput). Les modĂšles personnalisĂ©s (fine-tunĂ©s, prĂ©-entraĂźnĂ©s en continu, importĂ©s) ne peuvent pas ĂȘtre invoquĂ©s Ă la demande.
Référence
Une application Claude à fort trafic atteint les quotas par région pendant les pics ; besoin d'un débit plus élevé sans acheter de débit provisionné (Provisioned Throughput).
Profils d'inférence inter-régions. Bedrock route les invocations à travers plusieurs régions de maniÚre transparente pour augmenter les quotas TPM/RPM effectifs.
Pourquoi: Les quotas à la demande d'une seule région plafonnent pendant les pics ; les profils inter-régions multiplient approximativement les quotas sans modification du code de l'application au-delà de l'utilisation de l'ARN du profil d'inférence.
Référence
Les utilisateurs de l'APAC constatent une latence significativement plus élevée que les utilisateurs US/EU sur une application Bedrock déployée en us-east-1.
DĂ©ployer des points de terminaison Bedrock rĂ©gionaux dans ap-northeast-1 / ap-southeast-1 / ap-south-1 (lĂ oĂč le modĂšle est GA). Router les utilisateurs via la politique de latence ou de gĂ©olocalisation de Route 53.
Pourquoi: Le temps d'aller-retour des LLM domine pour les contextes longs ; le RTT trans-Pacifique seul est de 150 Ă 250 ms.
Référence
Une application réglementée par la HIPAA doit résumer des informations de santé protégées (PHI) avec Bedrock.
Utiliser uniquement des modÚles de fondation éligibles HIPAA (selon la liste des services éligibles HIPAA). Signer un BAA avec AWS. Chiffrer les prompts/réponses avec des clés KMS gérées par le client. Désactiver la journalisation des invocations de modÚle ou la restreindre à un compartiment S3 privé avec un accÚs restreint.
Référence
Décider quelles données peuvent transiter vers Bedrock en fonction de leur sensibilité (publique / confidentielle / restreinte).
Public â non restreint. Confidentiel â uniquement via les points de terminaison VPC + clĂ©s de chiffrement gĂ©rĂ©es par le client (CMK) + journalisation des invocations dans des compartiments privĂ©s. Restreint (secrets commerciaux, PHI/PCI rĂ©glementĂ©es) â bloquer entiĂšrement l'accĂšs Ă Bedrock ou utiliser un rĂ©gime de conformitĂ© Ă©ligible Ă Bedrock + rĂ©diger avant l'invocation.
Une organisation multi-comptes souhaite que le Compte A partage un modÚle Bedrock personnalisé avec le Compte B sans copier les poids.
Partage de modÚle personnalisé via AWS RAM. Le propriétaire partage l'ARN du modÚle personnalisé ; les comptes consommateurs l'invoquent via le runtime Bedrock standard avec des principaux IAM inter-comptes sur la politique de ressource.
Pourquoi: Ăvite les coĂ»ts de fine-tuning redondants et centralise le cycle de vie du modĂšle. RAM contrĂŽle qui peut consommer la ressource partagĂ©e.
Référence
Besoin d'un modÚle tiers de niche (par exemple, un LLM spécialisé dans la santé) qui ne figure pas dans le catalogue Bedrock standard.
Amazon Bedrock Marketplace. S'abonner au modÚle depuis le catalogue Marketplace, le déployer sur un point de terminaison Bedrock, l'invoquer via l'API runtime standard.
Pourquoi: Unifie la facturation tierce, IAM, KMS et l'observabilité avec les modÚles Bedrock de premiÚre partie.
Référence
Une application de recherche Ă fort volume rĂ©-intĂšgre les mĂȘmes documents Ă chaque rafraĂźchissement de requĂȘte ; le coĂ»t d'embedding domine.
Pré-calculer les embeddings lors de l'ingestion de documents, stocker le vecteur dans DynamoDB ou OpenSearch indexé par l'ID du document + le hachage du contenu. Ré-intégrer uniquement lorsque le hachage du contenu change.
Pourquoi: L'embedding rĂ©pĂ©tĂ© du mĂȘme texte est le coĂ»t Ă©vitable le plus courant. Un cache basĂ© sur le hachage permet un saut en O(1).
Droit à l'oubli GDPR sur un modÚle fine-tuné : un utilisateur demande la suppression de ses PII des données d'entraßnement.
Supprimer les enregistrements du corpus d'entraßnement, puis fine-tuner un nouveau modÚle de base à partir de zéro. Il n'est pas possible de nettoyer de maniÚre fiable les données des poids existants - le filtrage de sortie n'est pas suffisant.
Pourquoi: Une fois que les poids absorbent les données d'entraßnement, le masquage à l'inférence n'est pas fiable. La voie défendable est le ré-entraßnement complet sans les enregistrements concernés.
Une base de connaissances (KB) partagée dessert plusieurs équipes ; chaque équipe ne doit voir que ses propres documents.
Ătiqueter chaque chunk avec les mĂ©tadonnĂ©es `tenant_id` / `team_id` / `clearance` lors de l'ingestion. Au moment de la requĂȘte, dĂ©finir `retrievalConfiguration.vectorSearchConfiguration.filter` aux valeurs autorisĂ©es de l'appelant Ă partir de la session IAM ou du contexte de l'application.
Pourquoi: La similarité vectorielle ignore le contrÎle d'accÚs ; le filtrage des métadonnées est la seule isolation durable par tenant dans une base de connaissances (KB) partagée.
Référence
Un client de l'UE exige que les prompts et les embeddings de la base de connaissances (KB) ne quittent jamais eu-west-1.
DĂ©ployer Bedrock + KB + compartiment source S3 en eu-west-1. Ăpingler les invocations via l'ARN du profil d'infĂ©rence ciblĂ© sur eu-west-1 ; SCP `aws:RequestedRegion` refuser sur d'autres rĂ©gions pour `bedrock:*`.
Référence