人工智能与自动化
为现有产品添加 AI,无需破坏其稳定性
您已拥有一个产品,而 AI 显然能在其中发挥作用:总结长记录、起草首次回复、从用户输入中提取结构、基于您的文档回答问题。这类功能通常只需一周即可完成。而让它变得廉价、快速、安全且不依赖单一供应商,则是剩余的工作。
此方案解决的问题
简单粗暴的集成方式是在请求处理程序中直接调用 API。这会导致速度缓慢,UI 卡顿;没有成本上限,异常月份会产生令人不快的账单;没有备选方案,供应商的故障就是您的故障;且与单一供应商的 SDK 耦合,切换意味着重写。
您将获得的服务
供应商无关层
一个内部接口,其背后配备适配器,以便随时更换模型或供应商。在这个领域,性价比领先者每隔几个月就会变动,这项设计能快速收回成本。
流式响应
令牌在生成时即流式传输至界面。等待十秒时带有加载动画会让人觉得系统故障;而十秒内逐字显示文本则不会。
真正有约束力的成本控制
按用户和租户设置配额、每次请求的令牌上限,以及支出告警。这些控制在您的代码中强制执行,而非依赖供应商的仪表板,以防止失控循环导致数千英镑的意外账单。
安全场景下的缓存
相同提示词通过缓存提供,并在供应商支持时使用提示词缓存。在重复性工作负载中,这通常能将成本削减一半以上。
结构化输出,验证无误
当功能需要 JSON 时,模式会在使用前强制执行并验证,若不匹配则重试。用正则表达式解析模型生成的文本,是这类功能在生产环境中崩溃的常见原因。
评估集
二十到五十条真实输入及对应输出,在每次提示词或模型变更时运行。若缺少此项,"优化提示词"便沦为猜测,且回归问题可能悄无声息地流入生产环境。
我们的工作方式
选择合适的功能点
在大语言模型能真正发挥价值且错误可恢复的场景。对于无法满足条件的功能,我们会直接提出反对意见。
原型构建与基准测试
基于您的真实输入,测试两到三种模型与提示词组合,评估质量、延迟及每次调用成本。
构建抽象层
提供商适配器、流式传输、重试机制、超时控制、配额管理及缓存。
集成至产品
包含加载、错误及空状态的完整功能,行为合理可靠。
评估与调优
基于评估集迭代提示词,直至质量与成本均达到预期。
分阶段发布
先向部分用户发布,在观察使用情况与成本后再推广至全量用户。
您应当期待什么
- 已上线的AI功能,不会拖累产品其他部分的性能
- 每租户的成本上限,不可超出
- 可通过配置切换供应商,无需重写代码
- 提示词变更可被量化测量而非凭猜测
构建于
- Mistral
- OpenAI
- Anthropic Claude
- Vercel AI SDK
- TypeScript
- Node.js
- Python
- PostgreSQL
- pgvector
- Redis
- Next.js
- Server-Sent Events
Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.
大语言模型(LLM)集成 — your questions
包括那些大多数机构在页面上忽略的成本问题。
通常,现有代码库中一个定义明确的功能开发费用为 £6,000 至 £15,000,其中包括抽象层、成本控制和评估集。模型本身的使用费用通常较低——主要成本在于工程实现。
在你的评估集中表现最佳的模型,通常不是最贵的那一个。一个设计良好的中端模型在特定任务上,经常能以极低成本匹敌前沿模型。这正是基准测试步骤的意义所在,也是适配器的价值所在。
集成方案内置超时、重试机制,并在必要时切换至第二供应商。若无合理备选方案,功能会显式降级——明确显示“服务不可用,请重试”——而非挂起或抛出 500 错误。
按请求设置 token 上限、按用户和租户设置配额、缓存重复提示词,并设置支出提醒。所有控制均在应用层实施,因为供应商仪表板只会在问题发生后才通知你。
在我们使用的 API 套餐中不会,且我们会为你选择的供应商确认具体条款并以书面形式提供。若你的客户需要合同保证,这是采购问题,我们会协助你妥善记录——最好在发布前解决,而非等客户询问后再处理。
可以,这正是该服务的常规情况。我们遵循代码库中已有的约定,而非引入另一种风格,且集成通过功能开关实施,可随时关闭而无需部署。

