跳转到主要内容
Fugen Services logo

人工智能与自动化

在您设定的限制内完成工作的代理

代理是一个能够调用您工具的模型——查找信息、创建记录、发送消息——并决定下一步调用哪个工具。这对无法通过脚本处理的多步骤工作而言确实有用。同时,这也是语言模型从生成文本转为在您业务中执行操作的关键点,这改变了"谨慎"的含义。

参考报价

起价 £15,000

开发前以书面形式确定固定价格。

获取报价+44 7488 265083

此方案解决的问题

演示令人印象深刻,但生产环境中的失败却乏味:一个陷入循环的代理、一个自信地调用错误工具的代理、一个因开发时最易用而拥有数据库写入权限的代理。这些都是权限和设计问题,而非模型问题。

您将获得的服务

范围明确、功能单一的工具

每个工具只执行一项任务,验证其输入,并仅拥有所需的最小权限。不会提供通用的“执行SQL”工具——这正是代理可能删除数据的方式。

不可逆操作的审批关卡

任何花费资金、联系客户或删除数据的操作均需人工确认。代理提出方案;人工批准执行。这是最重要的设计决策。

循环与成本限制

每项任务的步骤数、实际耗时和令牌消耗均设置硬性上限,并在模型外强制执行。代理无权自行决定任务完成与否。

完整的审计追踪

每一步均记录:被询问的内容、做出的决策、调用的工具及其参数、返回的结果。若缺少此项,代理将无法审计,在大多数受监管工作中无法使用。

部署前的评估

使用真实任务的测试集(已知正确结果)对每次提示或模型变更进行测试。若缺少此项,无法判断变更是改善还是悄然破坏了系统。

优雅失败机制

当代理无法完成任务时,它会说明情况并移交已完成的工作,而非编造看似合理的结果。升级是功能而非缺陷。

我们的工作方式

  1. 精确定义任务

    一项任务,并明确其完成标准。范围定为“协助运营”的代理会失败;范围定为“核对这两份报告并标记差异”的代理则会成功。

  2. 设计工具接口

    提供最少的工具集,每个工具仅拥有最小权限。在开发前进行审查。

  3. 构建评估集

    使用真实任务(已知结果)构建测试集,需在代理开发前完成。

  4. 优先构建审计日志

    可观测性不是为代理后期添加的——若无此项,你无法进行调试。

  5. 影子模式

    代理提出每个操作,人工逐一批准,持续至对其效果建立信心。

  6. 谨慎扩大自主权

    先放开低风险操作的审批,基于成功率逐步扩展。不可逆操作可永久保留审批机制,且通常应如此。

您应当期待什么

  • 无需人工干预即可完成多步骤任务
  • 任何不可逆操作均需获得批准
  • 所有决策均可通过审计日志重建
  • 提示词与模型变更需基于固定评估集进行测量

构建于

  • Mistral
  • Anthropic Claude
  • OpenAI
  • TypeScript
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Temporal
  • RabbitMQ
  • Model Context Protocol
  • LangGraph

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

AI 代理开发 — your questions

包括那些大多数机构在页面上忽略的成本问题。

单一用途的代理(配备3-4个工具、批准闸口和审计日志)通常需£15,000至£35,000。运行成本取决于使用量,但通常较低——模型本身的费用不高,大部分成本在于模型周边的工程开发。

聊天机器人回答问题;代理执行任务。聊天机器人会告诉客户退货政策,而代理会查询订单、核实资格、创建退货并预约取件。后者需要权限、限制和审计轨迹,而这些才是大部分工作量所在。

有四个保障措施,且无一依赖于对模型的信任:工具仅能执行狭义的已验证操作、不可逆操作需经批准闸口、代码中对步骤数和支出设置硬性限制,以及完整的审计日志以便追溯错误。我们的设计基于模型偶尔会出错的假设,因为它确实会出错。

对于有明确边界且人工介入不可逆步骤的任务,是的——我们已构建并运行此类系统。对于开放式自主权限的重要系统,尚未成熟,若情况如此,我们会坦诚相告,而非向您推销一个最终被束之高阁的试点项目。

您需要约束它,而非消除幻觉。事实应通过工具从您的系统中获取,而非依赖模型记忆;输出需在使用前通过模式验证;任何无法验证的内容将升级为人工处理而非直接执行。任何供应商承诺零幻觉的,都不理解这项技术。

无论哪个模型在您的评估集上表现最佳,都通过一个适配器接入,以便随时更换。实践中,我们通常使用 Mistral 或 Claude 进行工具调用。关键在于选择应基于您的任务进行衡量,并且可逆,因为领先榜单每隔几个月就会变动。

与亲自构建过此类系统的人交谈

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.