OfoxAI
—单Key接入百模,零改动兼容主流协议
OfoxAI是一款统一大模型API聚合网关,支持GPT、Claude等100+主流模型。它完全兼容OpenAI、Anthropic、Gemini协议,实现零代码迁移。内置对Claude Code等开发工具的集成,提供多语言SDK,助开发者3分钟快速接入,简化密钥管理并提升系统稳定性。

为开发者提供用于构建和实验AI模型的SDK、API和库,简化模型集成流程,并提供模型性能评估和基准测试工具。
单Key接入百模,零改动兼容主流协议
OfoxAI是一款统一大模型API聚合网关,支持GPT、Claude等100+主流模型。它完全兼容OpenAI、Anthropic、Gemini协议,实现零代码迁移。内置对Claude Code等开发工具的集成,提供多语言SDK,助开发者3分钟快速接入,简化密钥管理并提升系统稳定性。

为你的OpenClaw找到最佳AI模型
PinchBench 是一个用于评估 LLM 模型作为 OpenClaw 编程助手表现的基准测试系统。我们通过在不同模型上运行相同的现实任务,测量它们的成功率、速度和成本,帮助开发者挑选最适合他们需求的模型。PinchBench 由 Kilo Code 打造,这正是 KiloClaw 的开发团队。


免费测试AI模型,助力安全智能进化
Stable Chat是Stability AI推出的免费AI对话研究平台,基于Stable Beluga大语言模型。该产品定位为面向研究人员和AI爱好者的测试工具,核心功能包括:提供类ChatGPT的对话体验、支持用户标记模型的有害/偏见回答以帮助改进模型、提供基于研究的纯测试环境。亮点在于由知名AI公司提供免费访问渠道、聚焦模型安全性与能力评估、允许社区参与公开模型优化。
开源评测,驱动大模型精准进化与标准化
OpenCompass是上海人工智能实验室推出的大模型开放评测体系,提供一站式、开源可复现的模型评估解决方案。核心包括评估工具包(CompassKit)、基准社区(CompassHub)和评测排行榜(CompassRank),支持大语言模型和多模态模型在语言、知识、推理等八大能力维度的全面评测。其亮点在于分布式高效评估、灵活扩展的评测框架,以及定期公布的权威榜单,已与多家企业、高校合作,推动大模型评估标准化。

复旦出品,专业深度的AI评测标杆
LLMEval是由复旦大学NLP实验室推出的系列大模型评测基准,其中最新的LLMEval-3专注于评估模型在专业知识领域的深度能力。产品覆盖教育部划定的13个一级学科门类以及50余个二级学科,包含约20万道标准问答题目,尤其强调哲学、理学、工学、医学等领域的生成式回答评测,旨在提供更全面、细粒度的大模型专业知识性能评估基准,帮助研究者和企业精准测试模型的专业深度。
开源大模型评估标准,多维度性能一目了然
Open LLM Leaderboard 是Hugging Face推出的开源大语言模型权威排行榜,基于标准化的评估框架,通过IFEval、BBH、MATH、GPQA、MMLU-PRO等多个基准测试,全面评估模型在指令遵循、复杂推理、数学解题、专业知识等维度的性能。它支持预训练模型、聊天模型等多种类型,并提供详细的测试结果、比较工具及可复现性支持,旨在帮助开发者高效筛选先进模型,推动开源社区的技术交流与进步。

开箱即用的大模型工具箱,让百亿模型触手可及
OpenBMB是由清华大学自然语言处理实验室与智源研究院联合支持发起的大规模预训练语言模型开源项目,定位为加速百亿级以上大模型的训练、微调与推理,降低大模型使用门槛。其核心功能包括提供高效工具链与模型库,推动大模型技术的标准化与普及化,并汇聚开发者共同构建开源生态。亮点在于依托顶尖学术团队的技术积累,已在模型预训练、提示微调等方向发表多篇顶级论文,致力于实现大模型技术的实用化与社区化发展。
多模态模型精准评估,驱动AI技术标准化发展
MMBench是由上海人工智能实验室等多家顶尖机构联合推出的多模态基准测试体系,旨在对视觉语言模型进行全面评估。它采用3000道单选题覆盖20种细分能力维度,创新设计循环评估策略验证模型输出稳定性,并通过ChatGPT精准匹配模型回复。该平台提供官方评估工具VLMEvalKit、多语言数据集及可视化功能,其排行榜为研究者和开发者提供模型性能参考,推动多模态技术的标准化发展。


生物医学文献问答基准,驱动AI精准读取科研智慧
PubMedQA是一个面向生物医学研究问答的专业数据集与模型评估平台。该数据集包含专家标注的、未标注的及人工生成的问答对,共计超27万实例,以文献摘要为基础回答‘是/否/可能’形式的生物医学问题,为研究人员提供标准化测试基准。其核心功能是支持生物医学自然语言处理模型的训练、优化与性能比较,助力从海量文献中高效提取关键信息,推动智能医疗问答系统的发展。

中文大模型全能评测基准,涵盖67学科与本土知识
CMMLU是一款综合性的中文大模型评估基准,专注于测试语言模型在中文语境下的知识储备与推理能力。该基准涵盖67个学科主题,内容跨越自然科学、人文社科及中国特有的生活规则(如驾驶知识),其中许多题目具有鲜明的中国文化背景。其核心功能包括提供丰富测试数据集、支持five-shot/zero-shot等多种评估模式、发布模型性能排行榜,并提供完整的预处理代码与评估工具链,为研究者和开发者提供一站式中文模型能力测评解决方案。
