Noveum
面向在生产环境中运行 AI Agent 的工程团队的 Agent 评估与修复平台
追踪失败根因、生成修复方案并提交PR,让Agent质量持续提升。

核心功能
NovaTrace可观测性
开源SDK捕获每次LLM调用、工具调用和Agent步骤,每个span记录token、成本和延迟,与OpenTelemetry对齐。
112个校准评分器
覆盖幻觉、RAG质量、工具使用、安全等15个类别,含36个语音专用评分器,自动对生产trace采样打分。
NovaPilot自动修复
将失败追溯到根因后生成候选修复方案,经过回测和端到端模拟验证,再作为pull request提交供审核。
NovaSynth合成测试
用合成用户通过真实SIP电话和LiveKit音频压力测试Agent,模拟愤怒客户、插话、噪音等真实场景。
多框架原生集成
深度集成LangChain、LangGraph、LiveKit、Pipecat和CrewAI,覆盖聊天、语音和多步骤工作流架构。
企业级部署控制
支持本地部署、VPC或自带ClickHouse,提供SSO/SAML和RBAC,trace数据留在自己的基础设施内。
产品特色
- 01
不只是发现问题,而是直接给修复方案
大多数可观测性工具停在“你的Agent出问题了”这一步。Noveum多了NovaPilot,能把失败定位到根因、生成修复、回测验证,然后提交PR。这个闭环是它比较特别的地方。
- 02
语音Agent评测做得比较细
市面上专做语音Agent评测的平台不多。NovaSynth用合成用户打真实SIP电话,36个语音评分器能检测发音错误、静默、打断和STT/LLM/TTS全链路延迟,转录文本看不出来的问题也能抓到。
- 03
开源SDK,不锁定数据
NovaTrace SDK是Apache 2.0开源的,与OpenTelemetry对齐。不想用了,trace数据可以自己带走。对担心供应商锁定的团队来说这点挺重要。
应用场景
✅ 语音Agent调试
在真实通话中测试语音Agent,用36个语音评分器为对话打分,发布前通过模拟验证修复效果。
✅ 聊天Agent质量保障
把生产环境的聊天trace自动转化为可运行的评估,不需要手动构建数据集或挑选评分器。
✅ 工作流Agent监控
对多步骤Agent的工具调用、路由决策和端到端结果进行评估,发现步骤之间产生的故障。
✅ 受监管行业部署
金融服务、电信和房地产团队在本地或用自有ClickHouse运行,trace数据不出自己的基础设施。
✅ 从Langfuse等工具迁移
把可观测性、评估和自动修复整合到一个平台,不用在多个工具之间手动传数据。
常见问题
解答您关于"Noveum"的常见疑问,让您更好地使用这款AI工具
-
有免费档,每月2500积分,不需要信用卡。约100分钟语音测试或833条trace分析。Pro版69美元/月起。
-
Langfuse偏可观测性,告诉你哪里出错了。Noveum在可观测性基础上加了自动修复:NovaPilot生成修复方案并提交PR,不需要手动把trace复制到其他AI工具里分析。
-
原生集成LangChain、LangGraph、LiveKit、Pipecat和CrewAI,也支持OpenAI和Anthropic SDK以及自定义Agent。
-
在官网注册获得免费积分,安装开源SDK(Python或TypeScript),几行代码接入现有Agent就能开始追踪。
-
支持本地部署、VPC或自带ClickHouse,trace数据完全留在自己的基础设施内。SOC 2 Type II认证进行中,符合GDPR。
-
规则型评分器免费,LLM评分器1积分/条,NovaSynth语音测试25积分/分钟,文本对话10积分/次,NovaPilot分析3积分/条trace。
-
可以。NovaSynth通过Twilio、Plivo或Vobiz发起真实SIP电话,模拟各种真实场景,用36个语音评分器打分。
-
有。MyOperator用Noveum把呼叫成功率从84%提升到95%以上,DarGlobal AI工程团队反馈部署和维护开销明显减少。
立即体验“Noveum”
Noveum.ai是面向生产环境AI Agent的评估与修复平台。开源SDK捕获每次LLM和工具调用,112个校准评分器自动打分,NovaPilot将失败追溯根因并生成修复PR。支持聊天、语音和多步骤工作流Agent,通过SOC 2 Type II认证。

