TikTok站点可靠性工程师Salman Munaf表示,AI Agent已从简单的LLM调用进化为分布式系统,构建时需运用分布式系统思维。其核心观点包括:AI Agent作为外部系统协调器,改变了系统边界和风险面。影响行动的上下文(状态)易过期、冲突,应将记忆视为可失效且附带来源信息的缓存。无害模型若具备执行不安全操作的能力,将变得危险。需全面记录AI Agent的决策依据和动作,而非仅依赖日志。AI Agent作为概率性协调器,其规划、行动、观察等步骤均跨越系统边界,每一步都需持久化并明确事务边界。针对工具调用失败,需设置请求ID、幂等键及状态查询机制,并通过限制重试次数、设置指数退避等避免重试风暴。此外,要为AI Agent设定权限、预算和费率限制,完善可观测性,确保能约束、观察其行为并从错误中恢复,明确系统对其犯错的容忍度。
