For the complete documentation index, see llms.txt. This page is also available as Markdown.

模型数据

  • 以下信息仅供参考,如有错误可联系纠正,部分模型的服务商不同其上下文大小和模型信息可能也会有所不同;

  • 在客户端输入数据时需要将“k”转换成实际数值(理论上 1k=1024 tokens;1m=1024k tokens),如 8k 为 8×1024=8192 tokens。建议在实际使用时×1000 即可,防止报错,如 8k 为 8×1000=8000,1m=1×1000000=1000000;

  • 最大输出为“-”的为未从官方查询到该模型明确的最大输出信息。

模型名称
最大输入
最大输出
函数调用
模型能力
服务商
简介

360gpt-pro

8k

-

不支持

对话

360AI_360gpt

360 智脑系列效果最好的主力千亿级大模型,广泛适用于各领域复杂任务场景。

360gpt-turbo

7k

-

不支持

对话

360AI_360gpt

兼顾性能和效果的百亿级大模型,适合对性能/成本要求较高 的场景。

360gpt-turbo-responsibility-8k

8k

-

不支持

对话

360AI_360gpt

兼顾性能和效果的百亿级大模型,适合对性能/成本要求较高 的场景。

360gpt2-pro

8k

-

不支持

对话

360AI_360gpt

360 智脑系列效果最好的主力千亿级大模型,广泛适用于各领域复杂任务场景。

claude-3-5-sonnet-20240620

200k

16k

不支持

对话,识图

Anthropic_claude

于 2024 年 6 月 20 日发布的快照版本,Claude 3.5 Sonnet 是一个平衡了性能和速度的模型,在保持高速度的同时提供顶级性能,支持多模态输入。

claude-3-5-haiku-20241022

200k

16k

不支持

对话

Anthropic_claude

于 2024 年 10 月 22 日发布的快照版本,Claude 3.5 Haiku 在各项技能上都有所提升,包括编码、工具使用和推理。作为 Anthropic 系列中速度最快的模型,它提供快速响应时间,适用于需要高互动性和低延迟的应用,如面向用户的聊天机器人和即时代码补全。它在数据提取和实时内容审核等专业任务中也表现出色,使其成为各行业广泛应用的多功能工具。它不支持图像输入。

claude-3-5-sonnet-20241022

200k

8K

不支持

对话,识图

Anthropic_claude

于 2024 年 10 月 22 日发布的快照版本,Claude 3.5 Sonnet 提供了超越 Opus 的能力和比 Sonnet 更快的速度,同时保持与 Sonnet 相同的价格。Sonnet 特别擅长编程、数据科学、视觉处理、代理任务。

claude-3-5-sonnet-latest

200K

8k

不支持

对话,识图

Anthropic_claude

动态指向最新的 Claude 3.5 Sonnet 版本,Claude 3.5 Sonnet 提供了超越 Opus 的能力和比 Sonnet 更快的速度,同时保持与 Sonnet 相同的价格。Sonnet 特别擅长编程、数据科学、视觉处理、代理任务,该模型指向最新的版本。

claude-3-haiku-20240307

200k

4k

不支持

对话,识图

Anthropic_claude

Claude 3 Haiku 是 Anthropic 的最快且最紧凑的模型,旨在实现近乎即时的响应。它具有快速且准确的定向性能。

claude-3-opus-20240229

200k

4k

不支持

对话,识图

Anthropic_claude

Claude 3 Opus 是 Anthropic 用于处理高度复杂任务的最强大模型。它在性能、智能、流畅性和理解力方面表现卓越。

claude-3-sonnet-20240229

200k

8k

不支持

对话,识图

Anthropic_claude

于 2024 年 2 月 29 日发布的快照版本,Sonnet 特别擅长于: - 编码:能够自主编写、编辑和运行代码,并具备推理和故障排除能力 - 数据科学:增强人类的数据科学专业知识;在使用多种工具获取洞察时,能够处理非结构化数据 - 视觉处理:擅长解读图表、图形和图像,准确转录文本以获取超越文本本身的洞察 - 代理任务:工具使用出色,非常适合处理代理任务(即需要与其他系统交互的复杂多步骤问题解决任务)

google/gemma-2-27b-it

8k

-

不支持

对话

Google_gamma

Gemma 是由 Google 开发的轻量级、最先进的开放模型系列,采用与 Gemini 模型相同的研究和技术构建。这些模型是仅解码器的大型语言模型,支持英语,提供预训练和指令微调两种变体的开放权重。Gemma 模型适用于各种文本生成任务,包括问答、摘要和推理。

google/gemma-2-9b-it

8k

-

不支持

对话

Google_gamma

Gemma 是 Google 开发的轻量级、最先进的开放模型系列之一。它是一个仅解码器的大型语言模型,支持英语,提供开放权重、预训练变体和指令微调变体。Gemma 模型适用于各种文本生成任务,包括问答、摘要和推理。该 9B 模型是通过 8 万亿个 tokens 训练而成。

gemini-1.5-pro

2m

8k

不支持

对话

Google_gemini

Gemini 1.5 Pro 的最新稳定版本。作为一个强大的多模态模型,它可以处理长达 6 万行代码或 2,000 页文本。特别适合需要复杂推理的任务。

gemini-1.0-pro-001

33k

8k

不支持

对话

Google_gemini

这是 Gemini 1.0 Pro 的稳定版本。作为一个 NLP 模型,它专门处理多轮文本和代码聊天以及代码生成等任务。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

gemini-1.0-pro-002

32k

8k

不支持

对话

Google_gemini

这是 Gemini 1.0 Pro 的稳定版本。作为一个 NLP 模型,它专门处理多轮文本和代码聊天以及代码生成等任务。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

gemini-1.0-pro-latest

33k

8k

不支持

对话,已废弃或即将废弃

Google_gemini

这是 Gemini 1.0 Pro 的最新版本。作为一个 NLP 模型,它专门处理多轮文本和代码聊天以及代码生成等任务。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

gemini-1.0-pro-vision-001

16k

2k

不支持

对话

Google_gemini

这是 Gemini 1.0 Pro 的视觉版本。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

gemini-1.0-pro-vision-latest

16k

2k

不支持

识图

Google_gemini

这是 Gemini 1.0 Pro 的视觉最新版本。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

gemini-1.5-flash

1m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Flash 的最新稳定版本。作为一个平衡的多模态模型,它可以处理音频、图片、视频和文本输入。

gemini-1.5-flash-001

1m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Flash 的稳定版本。它们提供与 gemini-1.5-flash 相同的基本功能,但版本固定,适合生产环境使用。

gemini-1.5-flash-002

1m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Flash 的稳定版本。它们提供与 gemini-1.5-flash 相同的基本功能,但版本固定,适合生产环境使用。

gemini-1.5-flash-8b

1m

8k

不支持

对话,识图

Google_gemini

Gemini 1.5 Flash-8B 是谷歌最新推出的一款多模态人工智能模型,专为高效处理大规模任务而设计。该模型具有 80 亿个参数,能够支持文本、图像、音频和视频的输入,适用于多种应用场景,如聊天、转录和翻译等。与其他 Gemini 模型相比,Flash-8B 在速度和成本效益上进行了优化,特别适合对成本敏感的用户。其速率限制提高了一倍,使得开发者能够更高效地进行大规模任务处理。此外,Flash-8B 还采用了“知识蒸馏”技术,从更大的模型中提炼出关键知识,确保在保持核心能力的同时实现轻量化和高效化

gemini-1.5-flash-exp-0827

1m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Flash 的实验版本,会定期更新以包含最新的改进。适合探索性测试和原型开发,不建议用于生产环境。

gemini-1.5-flash-latest

1m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Flash 的尖端版本,会定期更新以包含最新的改进。适合探索性测试和原型开发,不建议用于生产环境。

gemini-1.5-pro-001

2m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Pro 的稳定版本,提供固定的模型行为和性能特征。适合需要稳定性的生产环境使用。

gemini-1.5-pro-002

2m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Pro 的稳定版本,提供固定的模型行为和性能特征。适合需要稳定性的生产环境使用。

gemini-1.5-pro-exp-0801

2m

8k

不支持

对话,识图

Google_gemini

Gemini 1.5 Pro 的试验版本。作为一个强大的多模态模型,它可以处理长达 6 万行代码或 2,000 页文本。特别适合需要复杂推理的任务。

gemini-1.5-pro-exp-0827

2m

8k

不支持

对话,识图

Google_gemini

Gemini 1.5 Pro 的试验版本。作为一个强大的多模态模型,它可以处理长达 6 万行代码或 2,000 页文本。特别适合需要复杂推理的任务。

gemini-1.5-pro-latest

2m

8k

不支持

对话,识图

Google_gemini

这是 Gemini 1.5 Pro 的最新版本,动态指向最新的快照版本

gemini-2.0-flash

1m

8k

不支持

对话,识图

Google_gemini

Gemini 2.0 Flash 是谷歌最新推出的模型,相比 1.5 版本具有更快的首次生成速度(TTFT),同时保持了与 Gemini Pro 1.5 相当的质量水平;该模型在多模态理解、代码能力、复杂指令执行和函数调用等方面都有显著提升,从而能够提供更流畅和强大的智能体验。

gemini-2.0-flash-exp

100k

8k

支持

对话,识图

Google_gemini

Gemini 2.0 Flash 引入多模态实时 API、改进速度和性能、提升质量、增强代理能力,并增加图像生成和语音转换功能。

gemini-2.0-flash-lite-preview-02-05

1M

8k

不支持

对话,识图

Google_gemini

Gemini 2.0 Flash-Lite 是谷歌最新发布的高性价比 AI 模型,在保持与 1.5 Flash 相同速度的同时质量更好;支持 100 万 tokens 的上下文窗口,能够处理图像、音频和代码等多模态任务;作为目前谷歌成本效益最高的模型,采用简化的单一定价策略,特别适合需要控制成本的大规模应用场景。

gemini-2.0-flash-thinking-exp

40k

8k

不支持

对话,推理

Google_gemini

gemini-2.0-flash-thinking-exp 是一个实验模型,它能生成在作出反应时所经历的 "思考过程"。因此,与基本的 Gemini 2.0 Flash 模型相比,"思考模式 "的反应具有更强的推理能力。

gemini-2.0-flash-thinking-exp-01-21

1m

64k

不支持

对话,推理

Google_gemini

Gemini 2.0 Flash Thinking EXP-01-21 是谷歌最新推出的人工智能模型,专注于提升推理能力和用户交互体验。该模型具备强大的推理能力,尤其在数学和编程领域表现突出,并支持高达 100 万 token 的上下文窗口,适用于复杂任务和深入分析场景。其独特之处在于能够生成思考过程,提高 AI 思维的可理解性,同时支持原生代码执行,增强了交互的灵活性和实用性。通过优化算法,模型减少了逻辑矛盾,进一步提升了回答的准确性和一致性。

gemini-2.0-flash-thinking-exp-1219

40k

8k

不支持

对话,推理,识图

Google_gemini

gemini-2.0-flash-thinking-exp-1219 是一个实验模型,它能生成在作出反应时所经历的 "思考过程"。因此,与基本的 Gemini 2.0 Flash 模型相比,"思考模式 "的反应具有更强的推理能力。

gemini-2.0-pro-exp-01-28

2m

64k

不支持

对话,识图

Google_gemini

预加模型,还未上线

gemini-2.0-pro-exp-02-05

2m

8k

不支持

对话,识图

Google_gemini

Gemini 2.0 Pro Exp 02-05 是谷歌 2024 年 2 月发布的最新实验性模型,在世界知识、代码生成和长文本理解方面表现突出;该模型支持 200 万 tokens 的超长上下文窗口,能处理 2 小时视频、22 小时音频、6 万多行代码和 140 万多单词的内容;作为 Gemini 2.0 系列的一部分,该模型采用了新的 Flash Thinking 训练策略,性能得到显著提升,在多个 LLM 评分榜单中名列前茅,展现了强大的综合能力。

gemini-exp-1114

8k

4k

不支持

对话,识图

Google_gemini

这是一个实验性模型,于 2024 年 11 月 14 日发布,主要关注质量改进。

gemini-exp-1121

8k

4k

不支持

对话,识图,代码

Google_gemini

这是一个实验性模型,于 2024 年 11 月 21 日发布,改进了编码、推理和视觉能力。

gemini-exp-1206

8k

4k

不支持

对话,识图

Google_gemini

这是一个实验性模型,于 2024 年 12 月 6 日发布,改进了编码、推理和视觉能力。

gemini-exp-latest

8k

4k

不支持

对话,识图

Google_gemini

这是一个实验性模型,动态指向最新版本

gemini-pro

33k

8k

不支持

对话

Google_gemini

同 gemini-1.0-pro,是 gemini-1.0-pro 的别名

gemini-pro-vision

16k

2k

不支持

对话,识图

Google_gemini

这是 Gemini 1.0 Pro 的视觉版本。该模型将于 2025 年 2 月 15 日停用,建议迁移到 1.5 系列模型。

grok-2

128k

-

不支持

对话

Grok_grok

X.ai 于 2024.12.12 发布的新版本 grok 模型.

grok-2-1212

128k

-

不支持

对话

Grok_grok

X.ai 于 2024.12.12 发布的新版本 grok 模型.

grok-2-latest

128k

-

不支持

对话

Grok_grok

X.ai 于 2024.12.12 发布的新版本 grok 模型.

grok-2-vision-1212

32k

-

不支持

对话,识图

Grok_grok

X.ai 于 2024.12.12 发布的 grok 视觉版本模型.

grok-beta

100k

-

不支持

对话

Grok_grok

性能与 Grok 2 相当,但效率、速度和功能有所提高。

grok-vision-beta

8k

-

不支持

对话,识图

Grok_grok

最新的图像理解模型可以处理各种视觉信息,包括文档、图表、截图和照片。

internlm/internlm2_5-20b-chat

32k

-

支持

对话

internlm

InternLM2.5-20B-Chat 是一个开源的大规模对话模型,基于 InternLM2 架构开发。该模型拥有 200 亿参数,在数学推理方面表现出色,超越了同量级的 Llama3 和 Gemma2-27B 模型。InternLM2.5-20B-Chat 在工具调用能力方面有显著提升,支持从上百个网页收集信息进行分析推理,并具备更强的指令理解、工具选择和结果反思能力。

meta-llama/Llama-3.2-11B-Vision-Instruct

8k

-

不支持

对话,识图

Meta_llama

目前 Llama 系列模型不仅能够处理文本数据,还能够处理图像数据;Llama3.2 的部分模型加入了视觉理解的功能,该模型支持同时输入文本和图像数据,对图像进行理解并输出文本信息。

meta-llama/Llama-3.2-3B-Instruct

32k

-

不支持

对话

Meta_llama

Meta Llama 3.2 多语言大语言模型(LLM),其中 1B、3B 是可在边缘和移动设备上的运行的轻量级模型,本模型为 3B 版本。

meta-llama/Llama-3.2-90B-Vision-Instruct

8k

-

不支持

对话,识图

Meta_llama

目前 Llama 系列模型不仅能够处理文本数据,还能够处理图像数据;Llama3.2 的部分模型加入了视觉理解的功能,该模型支持同时输入文本和图像数据,对图像进行理解并输出文本信息。

meta-llama/Llama-3.3-70B-Instruct

131k

-

不支持

对话

Meta_llama

Meta 的最新款 70B LLM,性能与 llama 3.1 405B 相当。

meta-llama/Meta-Llama-3.1-405B-Instruct

32k

-

不支持

对话

Meta_llama

Meta Llama 3.1 多语言大语言模型(LLM)集合是 8B、70B 和 405B 尺寸的预训练和指令微调生成模型的集合,本模型为 405B 版本。Llama 3.1 指令微调文本模型(8B、70B、405B)针对多语言对话进行了优化,在常见的行业基准上优于许多可用的开源和闭源聊天模型。

meta-llama/Meta-Llama-3.1-70B-Instruct

32k

-

不支持

对话

Meta_llama

Meta Llama 3.1 是由 Meta 开发的多语言大型语言模型家族,包括 8B、70B 和 405B 三种参数规模的预训练和指令微调变体。该 70B 指令微调模型针对多语言对话场景进行了优化,在多项行业基准测试中表现优异。模型训练使用了超过 15 万亿个 tokens 的公开数据,并采用了监督微调和人类反馈强化学习等技术来提升模型的有用性和安全性。

meta-llama/Meta-Llama-3.1-8B-Instruct

32k

-

不支持

对话

Meta_llama

Meta Llama 3.1 多语言大语言模型(LLM)集合是 8B、70B 和 405B 尺寸的预训练和指令微调生成模型的集合,本模型为 8B 版本。Llama 3.1 指令微调文本模型(8B、70B、405B)针对多语言对话进行了优化,在常见的行业基准上优于许多可用的开源和闭源聊天模型。

abab5.5-chat

16k

-

支持

对话

Minimax_abab

中文人设对话场景

abab5.5s-chat

8k

-

支持

对话

Minimax_abab

中文人设对话场景

abab6.5g-chat

8k

-

支持

对话

Minimax_abab

英文等多语种人设对话场景

abab6.5s-chat

245k

-

支持

对话

Minimax_abab

通用场景

abab6.5t-chat

8k

-

支持

对话

Minimax_abab

中文人设对话场景

chatgpt-4o-latest

128k

16k

不支持

对话,识图

OpenAI

chatgpt-4o-latest 模型版本持续指向 ChatGPT 中使用的 GPT-4o 版本,并在有重大变化时最快更新。

gpt-4o-2024-11-20

128k

16k

支持

对话

OpenAI

2024 年 11 月 20 日的最新 gpt-4o 快照版本。

gpt-4o-audio-preview

128k

16k

不支持

对话

OpenAI

OpenAI 的实时语音对话模型

gpt-4o-audio-preview-2024-10-01

128k

16k

支持

对话

OpenAI

OpenAI 的实时语音对话模型

o1

128k

32k

不支持

对话,推理,识图

OpenAI

OpenAI 针对复杂任务的新推理模型,该任务需要广泛的常识。该模型具有 200k 上下文,目前全球最强模型,支持图片识别

o1-mini-2024-09-12

128k

64k

不支持

对话,推理

OpenAI

o1-mini 的固定快照版本,比 o1-preview 更小、更快,成本低 80%,在代码生成和小上下文操作方面表现良好。

o1-preview-2024-09-12

128k

32k

不支持

对话,推理

OpenAI

o1-preview 的固定快照版本

gpt-3.5-turbo

16k

4k

支持

对话

OpenAI_gpt-3

基于 GPT-3.5: GPT-3.5 Turbo 是建立在 GPT-3.5 模型基础上的改进版本,由 OpenAI 开发。 性能目标: 设计目的是通过优化模型结构和算法,提高模型的推理速度、处理效率和资源利用率。 提升的推理速度: 相对于 GPT-3.5,GPT-3.5 Turbo 在相同硬件条件下通常能够提供更快的推理速度,这对于需要大规模文本处理的应用特别有益。 更高的吞吐量: 在处理大量请求或数据时,GPT-3.5 Turbo 可以实现更高的并发处理能力,从而提升整体的系统吞吐量。 优化的资源消耗: 在保持性能的同时,可能降低了对硬件资源(如内存和计算资源)的需求,这有助于降低运行成本和提高系统的可扩展性。 广泛的自然语言处理任务: GPT-3.5 Turbo 适用于多种自然语言处理任务,包括但不限于文本生成、语义理解、对话系统、机器翻译等。 开发者工具和 API 支持: 提供了便于开发者集成和使用的 API 接口,支持快速开发和部署应用程序。

gpt-3.5-turbo-0125

16k

4k

支持

对话

OpenAI_gpt-3

更新后的 GPT 3.5 Turbo,响应请求格式的准确性更高,并修复了一个导致非英语语言函数调用文本编码问题的错误。返回最多 4,096 个输出令牌。

gpt-3.5-turbo-0613

16k

4k

支持

对话

OpenAI_gpt-3

更新后的 GPT 3.5 Turbo 固定快照版本。目前已弃用

gpt-3.5-turbo-1106

16k

4k

支持

对话

OpenAI_gpt-3

具有改进的指令跟随、JSON 模式、可重现输出、并行函数调用等。返回最多 4,096 个输出令牌。

gpt-3.5-turbo-16k

16k

4k

支持

对话,已废弃或即将废弃

OpenAI_gpt-3

(已弃用)

gpt-3.5-turbo-16k-0613

16k

4k

支持

对话,已废弃或即将废弃

OpenAI_gpt-3

gpt-3.5-turbo 于 2023 年 6 月 13 日的快照。(已弃用)

gpt-3.5-turbo-instruct

4k

4k

支持

对话

OpenAI_gpt-3

与 GPT-3 时代模型类似的能力。与遗留 Completions 端点兼容,不适用于 Chat Completions。

gpt-3.5o

16k

4k

不支持

对话

OpenAI_gpt-3

同 gpt-4o-lite

gpt-4

8k

8k

支持

对话

OpenAI_gpt-4

目前指向 gpt-4-0613。

gpt-4-0125-preview

128k

4k

支持

对话

OpenAI_gpt-4

最新的 GPT-4 模型,旨在减少“懒惰”情况,即模型未完成任务。返回最多 4,096 个输出令牌。

gpt-4-0314

8k

8k

支持

对话

OpenAI_gpt-4

gpt-4 2023 年 3 月 14 日的快照

gpt-4-0613

8k

8k

支持

对话

OpenAI_gpt-4

gpt-4 2023 年 6 月 13 日的快照,增强了函数调用支持。

gpt-4-1106-preview

128k

4k

支持

对话

OpenAI_gpt-4

GPT-4 Turbo 模型,具有改进的指令跟随、JSON 模式、可再现输出、函数调用等。返回最多 4,096 个输出令牌。这是预览模型。

gpt-4-32k

32k

4k

支持

对话

OpenAI_gpt-4

gpt-4-32k 将于 2025-06-06 弃用。

gpt-4-32k-0613

32k

4k

支持

对话,已废弃或即将废弃

OpenAI_gpt-4

将于 2025-06-06 弃用。

gpt-4-turbo

128k

4k

支持

对话

OpenAI_gpt-4

最新版的 GPT-4 Turbo 模型新增了视觉功能,支持通过 JSON 模式和函数调用来处理视觉请求。该模型当前版本为 gpt-4-turbo-2024-04-09。

gpt-4-turbo-2024-04-09

128k

4k

支持

对话

OpenAI_gpt-4

带视觉功能的 GPT-4 Turbo 模型。现在,视觉请求能够通过 JSON 模式和函数调用来实现。gpt-4-turbo 目前版本就是这一版。

gpt-4-turbo-preview

128k

4k

支持

对话,识图

OpenAI_gpt-4

目前指向 gpt-4-0125-preview。

gpt-4o

128k

16k

支持

对话,识图

OpenAI_gpt-4

OpenAI 的高智能旗舰模型,适用于复杂的多步骤任务。GPT-4o 比 GPT-4 Turbo 更便宜、更快速。

gpt-4o-2024-05-13

128k

4k

支持

对话,识图

OpenAI_gpt-4

2024 年 5 月 13 日的原始 gpt-4o 快照。

gpt-4o-2024-08-06

128k

16k

支持

对话,识图

OpenAI_gpt-4

支持结构化输出的第一个快照。gpt-4o 目前指向此版本。

gpt-4o-mini

128k

16k

支持

对话,识图

OpenAI_gpt-4

OpenAI 经济实惠的 gpt-4o 版本,适用于快速、轻量级任务。GPT-4o mini 比 GPT-3.5 Turbo 更便宜,功能更强大。目前指向 gpt-4o-mini-2024-07-18。