
点击查看大图
全面介绍
✨ LLMRTC Docs:构建实时语音与视觉 AI 应用的开源利器
LLMRTC 是一款开源的 TypeScript SDK,旨在帮助开发者轻松构建高性能、低延迟的实时语音与视觉 AI 应用。它巧妙地将 WebRTC 的强大实时音视频传输能力,与大语言模型(LLM)、语音转文字(STT)和文字转语音(TTS)技术融合,并通过一个统一且不依赖特定厂商的 API 接口对外提供服务,让您能够更灵活地接入多种 AI 服务,专注于打造卓越的产品体验。
💡 LLMRTC 亮点速览
- 🚀 实时语音与视觉: 享受亚秒级延迟的双向音频流,支持语音活动检测(VAD)和打断(Barge-in),让交互自然流畅。同时支持发送摄像头画面或屏幕截图,赋能视觉感知 AI。
- 🤝 提供商中立: 自由切换和组合来自 OpenAI、Anthropic、Google Gemini、AWS Bedrock 等云服务提供商,甚至本地模型。例如,可以用 Claude 处理 LLM,Whisper 做 STT,ElevenLabs 生成 TTS。
- 🛠️ 强大的工具调用: 通过 JSON Schema 定义工具,模型可以智能调用并与您的应用无缝衔接。
- 🎭 灵活的对话剧本: 构建多阶段对话流程,支持自定义提示词、工具和多种过渡类型(如工具调用、意图、关键词、LLM 决策等)。
- ⚡ 高效的流式传输管道: 响应在生成完成前即可开始播放,利用句子边界检测确保 TTS 在自然停顿处开始,极大减少感知延迟。STT → LLM → TTS 全流程流式处理。
- 🔭 可观测性与钩子: 提供 20 多个钩子点用于日志记录、调试和自定义行为,内置指标跟踪 TTFT、token 计数和持续时间,轻松集成现有监控系统。
- 🛡️ 会话弹性: 自动重连与指数退避机制,即使网络中断也能保留对话历史,并在提供商故障时优雅降级。
🧩 LLMRTC 架构概览
LLMRTC 主要由三个核心包构成:
@llmrtc/llmrtc-core: 提供共享的基础类型、编排器、工具和钩子。@llmrtc/llmrtc-backend: Node.js 服务器端,负责 WebRTC、VAD 以及所有提供商的集成。@llmrtc/llmrtc-web-client: 浏览器端 SDK,用于音频/视频捕获和播放。
🌍 支持的 AI 提供商
LLMRTC 提供了广泛的 AI 服务集成,无论是云端还是本地部署,都能满足您的需求。
云服务提供商
- OpenAI: 支持 GPT-4o、GPT-4 Turbo 等 LLM,Whisper STT,TTS-1 TTS,以及 GPT-4o 视觉能力。
- Anthropic: 支持 Claude 3 系列(Sonnet/Haiku/Opus)LLM,及其视觉能力。
- Google Gemini: 支持 Gemini 1.5、Gemini Pro LLM,及其 Gemini Vision 视觉能力。
- AWS Bedrock: 支持 Claude、Llama 等多种 LLM,以及其视觉能力(因模型而异)。
- OpenRouter: 接入超过 100 种 LLM 模型。
- ElevenLabs: 提供高质量多语言 TTS 服务。
本地提供商
- Ollama: 支持 Llama、Mistral 等本地 LLM,以及 LLaVA 视觉模型。
- LM Studio: 支持任何 GGUF 格式的本地 LLM。
- Faster-Whisper: 高速本地 Whisper STT 模型。
- Piper: 丰富的本地 TTS 语音选择。
🎯 典型应用场景
- 🗣️ 语音助手: 创建类似 Siri/Alexa 的智能助手,集成领域特定工具,如查询订单、预约服务、控制设备等。
- 📞 客户支持: 利用多阶段对话剧本,引导客户完成身份验证、问题分流和解决方案提供,并与 CRM 系统无缝集成。
- 👀 多模态智能体: 结合语音与视觉,构建屏幕感知的助手。用户可以共享屏幕或摄像头,并就所见内容提问。
- 💡 设备端 AI: 结合 Ollama、Faster-Whisper 和 Piper 等本地模型,实现完全离线运行,无需云端依赖,节省 API 成本,并保护用户隐私。
👩💻 卓越的开发者体验
- 📝 TypeScript 优先: 全面支持 TypeScript,提供完整的类型安全和 IntelliSense 智能提示。
- ✅ 工具验证: 借助 JSON Schema 自动验证 LLM 参数,在执行前捕获格式错误。
- 🧠 智能错误处理: 自动重试机制,并能区分可重试和不可重试的错误。
- 🧱 完备的类型定义: 每个提供商、钩子和事件都拥有清晰的类型定义。
☁️ 生产环境部署建议
在生产环境中部署 WebRTC 应用,通常需要一个 TURN 服务器以确保在 NAT/防火墙后的可靠连接。
推荐: Metered 的 OpenRelay 项目提供了一个免费的全球 TURN 服务器网络,每月 20GB 的 TURN 流量足够大多数应用使用。
您可以轻松配置 LLMRTC 服务器来集成 Metered TURN 服务:
const server = new LLMRTCServer({
providers: { llm, stt, tts },
metered: {
appName: 'your-app-name',
apiKey: 'your-api-key'
}
});
更多详细配置,请参考“网络与 TURN”文档。
产品评分
暂无评分
登录后即可评分
















