LLMRTC Docs

LLMRTC Docs

开源 TypeScript SDK,轻松构建实时语音与视觉 AI 应用

7点赞
2026-01-03
LLMRTC Docs screenshot 1
点击查看大图

全面介绍

✨ LLMRTC Docs:构建实时语音与视觉 AI 应用的开源利器

LLMRTC 是一款开源的 TypeScript SDK,旨在帮助开发者轻松构建高性能、低延迟的实时语音与视觉 AI 应用。它巧妙地将 WebRTC 的强大实时音视频传输能力,与大语言模型(LLM)、语音转文字(STT)和文字转语音(TTS)技术融合,并通过一个统一且不依赖特定厂商的 API 接口对外提供服务,让您能够更灵活地接入多种 AI 服务,专注于打造卓越的产品体验。


💡 LLMRTC 亮点速览

  • 🚀 实时语音与视觉: 享受亚秒级延迟的双向音频流,支持语音活动检测(VAD)和打断(Barge-in),让交互自然流畅。同时支持发送摄像头画面或屏幕截图,赋能视觉感知 AI。
  • 🤝 提供商中立: 自由切换和组合来自 OpenAI、Anthropic、Google Gemini、AWS Bedrock 等云服务提供商,甚至本地模型。例如,可以用 Claude 处理 LLM,Whisper 做 STT,ElevenLabs 生成 TTS。
  • 🛠️ 强大的工具调用: 通过 JSON Schema 定义工具,模型可以智能调用并与您的应用无缝衔接。
  • 🎭 灵活的对话剧本: 构建多阶段对话流程,支持自定义提示词、工具和多种过渡类型(如工具调用、意图、关键词、LLM 决策等)。
  • 高效的流式传输管道: 响应在生成完成前即可开始播放,利用句子边界检测确保 TTS 在自然停顿处开始,极大减少感知延迟。STT → LLM → TTS 全流程流式处理。
  • 🔭 可观测性与钩子: 提供 20 多个钩子点用于日志记录、调试和自定义行为,内置指标跟踪 TTFT、token 计数和持续时间,轻松集成现有监控系统。
  • 🛡️ 会话弹性: 自动重连与指数退避机制,即使网络中断也能保留对话历史,并在提供商故障时优雅降级。

🧩 LLMRTC 架构概览

LLMRTC 主要由三个核心包构成:

  1. @llmrtc/llmrtc-core 提供共享的基础类型、编排器、工具和钩子。
  2. @llmrtc/llmrtc-backend Node.js 服务器端,负责 WebRTC、VAD 以及所有提供商的集成。
  3. @llmrtc/llmrtc-web-client 浏览器端 SDK,用于音频/视频捕获和播放。

🌍 支持的 AI 提供商

LLMRTC 提供了广泛的 AI 服务集成,无论是云端还是本地部署,都能满足您的需求。

云服务提供商

  • OpenAI: 支持 GPT-4o、GPT-4 Turbo 等 LLM,Whisper STT,TTS-1 TTS,以及 GPT-4o 视觉能力。
  • Anthropic: 支持 Claude 3 系列(Sonnet/Haiku/Opus)LLM,及其视觉能力。
  • Google Gemini: 支持 Gemini 1.5、Gemini Pro LLM,及其 Gemini Vision 视觉能力。
  • AWS Bedrock: 支持 Claude、Llama 等多种 LLM,以及其视觉能力(因模型而异)。
  • OpenRouter: 接入超过 100 种 LLM 模型。
  • ElevenLabs: 提供高质量多语言 TTS 服务。

本地提供商

  • Ollama: 支持 Llama、Mistral 等本地 LLM,以及 LLaVA 视觉模型。
  • LM Studio: 支持任何 GGUF 格式的本地 LLM。
  • Faster-Whisper: 高速本地 Whisper STT 模型。
  • Piper: 丰富的本地 TTS 语音选择。

🎯 典型应用场景

  • 🗣️ 语音助手: 创建类似 Siri/Alexa 的智能助手,集成领域特定工具,如查询订单、预约服务、控制设备等。
  • 📞 客户支持: 利用多阶段对话剧本,引导客户完成身份验证、问题分流和解决方案提供,并与 CRM 系统无缝集成。
  • 👀 多模态智能体: 结合语音与视觉,构建屏幕感知的助手。用户可以共享屏幕或摄像头,并就所见内容提问。
  • 💡 设备端 AI: 结合 Ollama、Faster-Whisper 和 Piper 等本地模型,实现完全离线运行,无需云端依赖,节省 API 成本,并保护用户隐私。

👩‍💻 卓越的开发者体验

  • 📝 TypeScript 优先: 全面支持 TypeScript,提供完整的类型安全和 IntelliSense 智能提示。
  • 工具验证: 借助 JSON Schema 自动验证 LLM 参数,在执行前捕获格式错误。
  • 🧠 智能错误处理: 自动重试机制,并能区分可重试和不可重试的错误。
  • 🧱 完备的类型定义: 每个提供商、钩子和事件都拥有清晰的类型定义。

☁️ 生产环境部署建议

在生产环境中部署 WebRTC 应用,通常需要一个 TURN 服务器以确保在 NAT/防火墙后的可靠连接。

推荐: Metered 的 OpenRelay 项目提供了一个免费的全球 TURN 服务器网络,每月 20GB 的 TURN 流量足够大多数应用使用。

您可以轻松配置 LLMRTC 服务器来集成 Metered TURN 服务:

const server = new LLMRTCServer({
    providers: { llm, stt, tts },
    metered: {
        appName: 'your-app-name',
        apiKey: 'your-api-key'
    }
});

更多详细配置,请参考“网络与 TURN”文档。

产品评分

暂无评分
登录后即可评分
访问官网

相关产品