Une référence concise des modèles d'architecture évalués par l'examen AI-901. Lisez de haut en bas ou sautez à une section.
Identifier les concepts et les capacités de l'IA
Un modèle d'approbation de prêt ne doit pas désavantager les personnes en fonction du sexe ou de l'origine ethnique.
Appliquer le principe d'IA responsable d'équité : évaluer et atténuer les biais au sein des groupes démographiques.
Pourquoi: L'équité vise un traitement équitable ; ne la confondez pas avec la fiabilité (résultats cohérents) ou la confidentialité (protection des données).
Un modèle de conduite autonome doit se comporter de manière cohérente et échouer en toute sécurité dans des conditions inattendues.
Appliquer la fiabilité et la sécurité : tests rigoureux, surveillance et garde-fous pour les cas extrêmes.
Pourquoi: La fiabilité et la sécurité concernent un comportement cohérent et évitant les dommages en cas d'incertitude, et non les personnes auxquelles se rapportent les données.
Une application de santé traite des données personnelles et doit les protéger contre l'exposition ou l'utilisation abusive.
Appliquer la confidentialité et la sécurité : protéger les données personnelles, contrôler l'accès et respecter le consentement.
Pourquoi: Ce principe couvre la confidentialité et la protection des données ; l'équité et l'inclusivité concernent les personnes que le système sert.
Une solution doit autonomiser et engager les personnes, quelles que soient leurs capacités ou leur origine.
Appliquer l'inclusivité : concevoir de manière à ce que tout le monde en bénéficie, y compris les personnes handicapées.
Pourquoi: L'inclusivité concerne l'accessibilité et la portée générales ; l'équité concerne spécifiquement les résultats impartiaux.
Les utilisateurs doivent comprendre comment un système d'IA prend ses décisions et quelles sont ses limites.
Appliquer la transparence : expliquer comment le système fonctionne, son objectif, ses capacités et ses limitations.
Pourquoi: La transparence rend le système compréhensible ; la responsabilité concerne qui en est responsable.
Une propriété et une gouvernance claires sont nécessaires pour que quelqu'un réponde du comportement d'un système d'IA.
Appliquer la responsabilité : les personnes conçoivent, construisent et opèrent au sein d'un cadre de gouvernance et restent redevables.
Pourquoi: La responsabilité attribue une responsabilité humaine ; la transparence n'explique que le système, elle n'attribue pas la propriété.
Expliquer comment un modèle d'IA générative produit un paragraphe cohérent à partir d'une invite.
Un grand modèle de langage prédit le token suivant de manière répétée en utilisant des modèles appris à partir d'un texte d'entraînement massif.
Pourquoi: Les modèles génératifs génèrent du nouveau contenu via la prédiction probabiliste de tokens ; ils ne récupèrent pas les réponses stockées textuellement.
Choisir un modèle : l'un a besoin d'un chat à grand volume et peu coûteux, l'autre a besoin d'un raisonnement complexe en plusieurs étapes.
Faire correspondre le modèle à la tâche - un modèle plus petit/plus rapide pour le chat de routine, un modèle de raisonnement plus grand pour les tâches difficiles.
Pourquoi: Plus grand n'est pas toujours mieux ; la capacité, le coût et la latence sont des compromis, alors choisissez en fonction des besoins de la charge de travail.
Décider comment consommer un modèle : point de terminaison standard géré ou capacité dédiée.
Utiliser un déploiement standard (à l'usage) pour une charge variable, ou un débit provisionné pour des performances élevées et prévisibles en volume constant.
Pourquoi: Le provisionnement réserve de la capacité pour une latence constante ; le standard facture par token et est le plus simple pour commencer.
La sortie est trop répétitive ; vous voulez des réponses plus créatives et variées.
Augmenter le paramètre de temperature ; le diminuer vers 0 pour une sortie déterministe et ciblée.
Pourquoi: La temperature contrôle le caractère aléatoire de la sélection des tokens ; élevée = créative, basse = cohérente.
Les réponses sont coupées au milieu d'une phrase, ou vous devez plafonner la longueur et le coût de la sortie.
Ajuster le paramètre max tokens (longueur maximale de complétion) pour définir le plafond de la réponse.
Pourquoi: Max tokens limite la longueur de la sortie ; cela ne modifie pas la créativité - c'est la temperature ou le top-p.
Vous souhaitez limiter les choix de tokens à l'ensemble le plus probable sans une temperature dure.
Utiliser top-p (échantillonnage de noyau) pour restreindre l'échantillonnage au plus petit ensemble de tokens dont les probabilités s'additionnent à p.
Pourquoi: Top-p réduit le pool de candidats par masse de probabilité ; ajustez-le ou la temperature, généralement pas les deux de manière agressive.
Une charge de travail doit rédiger des textes marketing et des résumés à partir d'invites.
Il s'agit d'une charge de travail d'IA générative - création de contenu à partir d'instructions en langage naturel.
Pourquoi: Les charges de travail génératives produisent du nouveau contenu ; l'analyse de texte n'extrait que des informations à partir d'un texte existant.
Un système doit planifier des étapes, appeler des tools et agir vers un objectif avec une supervision minimale.
Il s'agit d'une charge de travail d'IA agentic - un LLM-driven agent qui raisonne, utilise des tools et entreprend des actions.
Pourquoi: Agentic ajoute l'autonomie et l'utilisation de tools en plus de la génération ; l'IA générative simple ne fait que retourner du contenu.
Une charge de travail extrait des avis clients le sentiment, les expressions clés et les entités nommées.
Il s'agit d'une charge de travail d'analyse de texte (NLP).
Pourquoi: L'analyse de texte interprète le texte existant ; elle ne génère pas de nouvelle prose comme une charge de travail générative.
Une charge de travail doit transcrire les appels et lire les réponses à voix haute.
Il s'agit d'une charge de travail de speech - reconnaissance speech-to-text et synthèse text-to-speech.
Pourquoi: Speech couvre l'audio en entrée/sortie ; computer vision gère les images, pas l'audio.
Une charge de travail doit détecter des objets et lire du texte à partir de photographies.
Il s'agit d'une charge de travail de computer vision - classification d'images, détection d'objets et OCR.
Pourquoi: Computer vision interprète les images ; l'extraction d'informations à partir de documents est une tâche connexe mais distincte.
Une charge de travail doit extraire des champs comme les dates, les totaux et le fournisseur à partir de factures numérisées.
Il s'agit d'une charge de travail d'extraction d'informations / de données (document understanding).
Pourquoi: L'extraction extrait des champs structurés des documents ; l'OCR générique ne retourne que du texte brut, pas des champs étiquetés.
Vous avez besoin des principaux sujets d'un bloc de texte sans tout lire.
Utiliser l'extraction de phrases clés (keywords) pour faire ressortir les termes les plus importants.
Pourquoi: L'extraction de phrases clés liste les termes saillants ; la détection d'entités classe plutôt les choses nommées comme les personnes ou les lieux.
Vous devez identifier les personnes, les organisations, les lieux et les dates mentionnés dans le texte.
Utiliser la reconnaissance d'entités nommées (entity detection) pour classer ces entités.
Pourquoi: Entity detection étiquette les choses nommées ; l'analyse de sentiment évalue plutôt le ton émotionnel.
Vous voulez savoir si les avis sont positifs, négatifs ou neutres.
Utiliser l'analyse de sentiment pour évaluer l'opinion exprimée dans le texte.
Pourquoi: Sentiment mesure le ton ; la summarization condense le contenu, elle ne juge pas la polarité.
Vous avez besoin d'un court résumé d'un long rapport.
Utiliser la text summarization (extractive ou abstractive) pour condenser le document.
Pourquoi: La summarization raccourcit tout en préservant le sens ; l'extraction de phrases clés ne liste que les termes, pas un résumé lisible.
Distinguer la conversion de l'audio en texte de la conversion du texte en audio.
La speech recognition (speech-to-text) transcrit l'audio ; la speech synthesis (text-to-speech) génère de l'audio parlé.
Pourquoi: La reconnaissance est audio d'entrée→texte ; la synthèse est l'inverse - ne pas intervertir les deux directions.
Implémenter des solutions d'IA à l'aide de Microsoft Foundry
Vous avez besoin d'un seul endroit pour découvrir les modèles, les déployer et créer des applications d'IA sur Azure.
Utiliser le portail Microsoft Foundry - il héberge le catalogue de modèles, les déploiements, le playground et les outils d'agent.
Pourquoi: Foundry est le hub unifié ; les services Azure AI individuels existent, mais Foundry est l'endroit où vous composez et déployez des solutions.
Votre application doit s'authentifier auprès du modèle déployé.
Utiliser l'URL de l'endpoint du déploiement avec une clé API ou une credential Microsoft Entra ID (Azure AD).
Pourquoi: L'authentification par clé est la plus simple ; Entra ID est plus sécurisée et évite d'intégrer des secrets dans le code.
Vous voulez un assistant IA qui suit les instructions et utilise des tools, construit sans beaucoup de code.
Créer un single agent dans le portail Foundry - définir ses instructions, son modèle et ses tools (l'Agent Service).
Pourquoi: Le constructeur d'agent du portail configure le comportement et les tools de manière déclarative ; vous n'écrivez pas la boucle d'orchestration manuellement.
Votre agent doit toujours citer ses sources et refuser les requêtes hors sujet.
Encoder ces règles dans les instructions de l'agent (sa guidance au niveau système).
Pourquoi: Les instructions de l'agent dirigent un comportement cohérent à travers les tours, similaire à un system prompt pour un modèle de chat simple.
Votre agent doit répondre à partir des documents de votre entreprise, pas seulement de ses données d'entraînement.
Donner à l'agent un knowledge/grounding tool (par exemple, la recherche de fichiers ou Azure AI Search) afin qu'il récupère vos données.
Pourquoi: Grounding/RAG fournit un contexte actuel et privé ; sans cela, le modèle peut halluciner ou utiliser des connaissances obsolètes.
Vous avez besoin d'une application personnalisée pour piloter un agent Foundry par programme.
Construire une application client agent avec le Foundry SDK - créer un thread, ajouter des messages, exécuter l'agent, lire les réponses.
Pourquoi: Le SDK expose les threads, les exécutions et les messages afin que votre application puisse intégrer l'agent dans n'importe quel workflow.
Vous avez besoin d'une application qui classifie les images et en lit le texte imprimé.
Construire une application de vision en utilisant Azure AI Vision (analyse d'images et OCR) accessible via Foundry.
Pourquoi: Azure AI Vision fournit une analyse d'images et une OCR prêtes à l'emploi ; vous n'avez pas besoin d'entraîner un modèle pour les tâches courantes.
Vous devez ajouter les connaissances FAQ privées de votre entreprise aux réponses du modèle, avec un effort minimal.
Grounding le modèle avec retrieval (RAG) sur vos documents plutôt que par fine-tuning.
Pourquoi: RAG injecte des données actuelles au moment de la requête et est plus simple/moins cher ; le fine-tuning modifie le comportement, pas la fraîcheur des connaissances.
Vous devez bloquer les sorties de texte et d'image dangereuses ou inappropriées d'un modèle déployé.
Activer les filtres Azure AI Content Safety sur le déploiement pour détecter et bloquer le contenu dangereux.
Pourquoi: Content Safety applique les garde-fous d'IA responsable au moment de l'exécution ; le modèle de base seul n'est pas garanti sûr.