Premièrement, donner des conclusions qui peuvent être utilisées pour la prise de décisions
Le côté de la plateforme doit examiner si les services Web et API, les processus de travail, les bases de données, les caches, le stockage d'objets, la récupération vectorielle, la résolution de documents et la surveillance des journaux sont séparés. Le côté du modèle dépend de l'utilisation de la fin du cloud API, des petits modèles locaux ou du raisonnement multimodèle. Les pics sont enregistrés en même temps, la taille du fichier de téléchargement unique, le volume croissant de documents, la fréquence des mises à jour des connaissances, le nombre de nœuds de travail et le temps de réponse acceptable.
Quelles conditions faut-il définir avant de porter un jugement?
La même question peut avoir des réponses différentes dans différentes phases d'activité, de données et de projet. Il est suggéré de vérifier les conditions suivantes et d'intégrer les conclusions communes sur le web dans leurs propres projets.
Ordre d ' avancement suggéré
Premièrement, nous serons clairs sur la cible et la frontière.
b) Rassembler les données de référence des utilisateurs, des tâches, des documents, des interfaces et du temps de réponse.
Validation Dépendance des clés
La plateforme, le traitement des connaissances et le raisonnement du modèle seront utilisés séparément.
Élaboration de résultats évaluables
Les tests de pression et de capacité sont effectués à l'aide de fichiers réels et de workflows.
Assurez-vous de décider de la prochaine étape avec les résultats réels.
Spécifications de production basées sur les retards P95, les files d'attente, les ressources et les résultats d'échec.
Comment le comprenez-vous dans le business réel?
Une entreprise comptant 30 utilisateurs internes, mais avec un volume important de flux de travail quotidiens et multi-étapes importés en format PDF, l'analyse des connaissances et les tâches back-office peuvent être plus exigeantes en ressources que des centaines d'utilisateurs qui ne posent que des questions et des réponses occasionnelles. Si le raisonnement du modèle local est demandé, des tests distincts devraient être effectués sur différents modèles, longueurs de contexte, co-élimination et isolation, et un serveur de démonstration ne peut pas être considéré comme une configuration de production directement.
La fosse la plus facile à monter.
Estimation uniquement par le nombre d'utilisateurs enregistrés, sans tâches réelles et sans charge de document
Le déploiement réussi de Diffy équivaut à la réalisation des capacités de production
Pas de croissance des files d'attente, bases de données, disques et indices vectoriels surveillés
Comment devrions-nous finir par recevoir et confirmer?
L'acceptation et l'inspection doivent être effectuées dans l'environnement cible avec des questions et réponses convenues et posées, des téléchargements de documents, des mises à jour des connaissances et des tâches de travail, l'enregistrement des réponses P50, P95, l'attente en file d'attente, le taux d'erreur, les ressources du processeur, de la mémoire, du disque et du modèle, et la restauration complète de sauvegarde, l'alarme de disque, le redémarrage du service et l'exercice de retour de version.
En se préparant à communiquer avec les fournisseurs ou les équipes internes, il est recommandé d'apporter les processus actuels, des échantillons représentatifs, des systèmes existants, des délais de planification et des niveaux budgétaires. Premièrement, les éléments inconnus sont clairement marqués, et la décision est alors prise d'utiliser des diagnostics, PoC, des projets à fourchette fixe ou des recherches et développements en cours, qui sont généralement plus fiables qu'une demande directe de prix et de durée sans frontières.