首页 / 常见问题 / AI数字员工、多智能体、安全与企业智能搜索
QUESTION & ANSWER

AI可观测性和Agent可观测性需要记录什么?

除了服务是否在线,还要把一次业务任务中的用户、Agent、模型、提示、知识检索、工具调用、状态变化、错误、人工修改、延迟、Token成本和最终结果关联起来。目标不是无限保存聊天内容,而是让问题可以复现、版本可以比较、成本可以解释。敏感日志必须脱敏、分权和设定保留期限。

直接回答

先给出可以用于决策的结论

传统监控能发现接口超时或服务器异常,却无法解释“为什么这次Agent给出了错误结果”。AI可观测性需要记录模型与提示版本、检索到的知识及版本、工具参数和返回、任务状态、重试、人工接管以及业务结果,再用统一任务ID串联。对于多Agent,还要看到任务在不同Agent之间如何移交。企业应根据数据敏感度决定保存原文、摘要、哈希或脱敏字段,避免为了排障制造新的隐私风险。

DECISION FACTORS

判断前需要确认哪些条件

同一个问题在不同企业、数据和项目阶段下可能有不同答案。建议先核对以下条件,再把网上的通用结论代入自己的项目。

应用是问答、RAG、Agent还是多Agent系统是否需要重现知识、工具和业务状态线上质量与业务结果由谁标注日志内容、权限和保留期限是否合规
ACTION STEPS

建议按什么顺序推进

01

先明确目标与边界

定义高价值任务和必须回答的排障问题。

02

验证关键依赖

统一用户、会话、任务、版本和工具调用标识。

03

形成可评审成果

建立质量、成本、延迟、安全和人工介入看板。

04

用真实结果决定下一步

把线上问题转为固定评测并进入发布门禁。

PRACTICAL EXAMPLE

放到实际业务中如何理解

示例用于说明判断方法

客服Agent错误承诺退款。完整追踪应说明用户身份、问题、命中的政策版本、模型和提示版本、是否调用订单接口、客服如何修改以及最终工单结果,从而判断问题来自过期知识、检索、提示、权限还是业务规则。 示例不代表特定客户业绩,实际结论需要结合企业自己的业务量、样本、系统和责任边界验证。

COMMON RISKS

最容易踩的坑

只采集Token数量和接口错误

保存全部敏感原文却没有访问控制

日志与模型、知识和代码版本无法关联

ACCEPTANCE

最终应该怎样验收或确认

选择任意一次关键任务,运营人员应能重建主要调用链、定位具体版本、看到工具和人工动作,并统计成功率、严重错误、人工介入、延迟和完整成本。告警还应能够引导暂停或回退。

准备与供应商或内部团队沟通时,建议带上当前流程、代表性样本、现有系统、计划时间和预算等级。先把未知项明确标注,再决定采用诊断、PoC、固定范围项目或持续研发,通常比直接索要一个缺少边界的价格和工期更可靠。

你的项目条件与上面的示例不同?

可以先整理业务目标、现有系统、样本与计划时间,再由顾问结合实际边界给出初步判断。

联系项目顾问