Zhipu
glm-5.3
Zhipu AI
上下文1M
输入$1.1900/M
输出$4.1500/M
面向复杂软件工程和长周期智能体任务的旗舰主力模型:沿用 GLM-5.2 基座,能力提升来自后训练,官方 Z.ai Code Bench 相比 GLM-5.2 提升 50%,并强化终端操作与漏洞发现。它提供 1M 上下文、最长 128K 输出,始终启用推理并支持 low、high、max 三档强度、函数调用和结构化输出;当前仅支持文本输入,不适合需要图像理解的任务。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Qwen
qwen3.8-max
Qwen
上下文1M
输入$1.7750/M
输出$5.3300/M
千问当前能力最强的旗舰多模态推理模型,适合长程编程、专业工作与多阶段智能体任务。它可处理文本、图片和视频,提供 1M 上下文、最长 128K 输出,并支持函数调用、结构化输出、联网搜索与代码解释器;更适合作为高质量复杂任务主力,而不是追求最低成本和最低延迟的批量调用。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
MoonshotAI
kimi-k3
Moonshot
上下文1.05M
输入$3.0000/M
输出$15.0000/M
月之暗面的旗舰模型,原生支持视觉理解和最高 100 万 token 上下文;当前以 max 推理强度运行,适合长链路编码、知识工作及需要终端工具协作的复杂任务。为保持稳定性,建议保留完整推理历史,并在兼容的 Agent 框架中新开会话使用。
输入模态:
输出模态:
深度思考工具调用长上下文
OpenAI
gpt-5.6-terra
OpenAI
上下文1.05M
输入$2.5000/M
输出$15.0000/M
GPT-5.6 中兼顾能力与成本的主力档位。适合需要图像理解、工具调用和较长材料处理的生产任务;若任务难度和交付质量优先,选择 Sol;若重在高并发成本控制,选择 Luna。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
OpenAI
gpt-5.6-sol
OpenAI
上下文1.05M
输入$5.0000/M
输出$30.0000/M
GPT-5.6 系列的旗舰档位,面向复杂专业工作与高质量交付。支持图像输入、函数调用和结构化输出,并可承载超长上下文;对时延或单位成本敏感的高频任务,可考虑 Terra 或 Luna。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
OpenAI
gpt-5.6-luna
OpenAI
上下文1.05M
输入$1.0000/M
输出$6.0000/M
GPT-5.6 的高并发、成本敏感档位。适合摘要、分类、改写和批量自动化;需要复杂专业判断或质量优先的多步任务时,优先选同系列 Sol。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
Grok
grok-4.5
xAI
上下文500K
输入$2.1000/M
输出$6.3000/M
面向代码、知识工作和 STEM 问题的旗舰推理模型。支持图像输入、函数调用和结构化输出,50 万 token 上下文适合跨文件分析与长材料处理;不需要高难度推理时可选成本更低的模型。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
Claude
claude-fable-5
Anthropic
上下文1M
输入$12.5000/M
输出$50.0000/M
Anthropic 迄今最强的公开发布模型,专为高难度推理与长周期智能体(agentic)任务打造。原生支持 100 万 token 超长上下文与 128k 输出,自适应思考默认常开;擅长在任务欠明确时自主探索环境、制定计划并持续推进长程编码与多智能体编排,需要人工介入前能把任务推进得更远。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Claude
claude-sonnet-5
Anthropic
上下文1M
输入$2.0000/M
输出$10.0000/M
Sonnet 档位的日常主力模型,重点是在较低成本下提供接近旗舰的智能体、编码和知识工作能力。默认 100 万 token 上下文与自适应思考适合长文档、代码库和多步工具任务;需要最深推理或受限高风险安全研究时,仍应评估更高档或专用模型。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
LongCat
LongCat-2.0
美团
上下文1M
输入$0.3000/M
输出$1.2000/M
面向项目级代码和长周期智能体任务的 LongCat 2.0 主力模型,原生 100 万 token 上下文,支持工具调用和多步推理。更适合装下大型仓库、长文档和自动化工作流后持续推进;如果只是轻量问答或低延迟闲聊,选择更小的 Flash/Lite 类模型会更省。
输入模态:
输出模态:
深度思考工具调用函数调用长上下文
Doubao
doubao-seed-2-1-pro
Doubao
上下文256K
输入$0.9700/M
输出$4.8800/M
面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Qwen
happyhorse-1.1-t2v
阿里巴巴
按秒$0.1350/s
面向文生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
Qwen
happyhorse-1.1-r2v
阿里巴巴
按秒$0.1350/s
面向参考生成视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
Qwen
happyhorse-1.1-i2v
阿里巴巴
按秒$0.1350/s
面向图生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
Doubao
doubao-seedance-2-0-mini
Doubao
输入$2.3652/M
输出$2.3652/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。Mini 档相比标准 Seedance 2.0 更偏向低成本和高频测试;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
Zhipu
glm-5.2
Zhipu AI
上下文1M
输入$1.1900/M
输出$4.1400/M
面向推理、代码和长上下文代理任务,相比 GLM-5.1 在上下文长度、工具调用和复杂多步任务上更进一步;对比 Qwen、DeepSeek、Kimi 等国产旗舰,它更适合中文企业自动化、项目级代码分析和知识工作流。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
MoonshotAI
kimi-k2.7-code
Moonshot
上下文256K
输入$0.9500/M
输出$4.0000/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
工具调用函数调用结构化输出长上下文
Grok
grok-imagine-video-1-5-preview
xAI
按秒$0.1400/s
面向图像/视频驱动的生成、编辑和延展,相比 Grok Imagine 1.0 更强调运动一致性和快速社交内容产出;对比 Veo、Kling、Runway,它更适合 xAI 生态里的短视频、广告创意和实时趋势素材。
输入模态:
输出模态:
多模态输出
Minimax
MiniMax-M3
MiniMax
上下文1M
输入$0.3000/M
输出$1.2000/M
面向长周期编码、工具使用和多轮生产协作,相比 MiniMax M2.7 进一步扩展到多模态输入并保留 100 万 token 上下文;对比 Claude、Gemini、GLM-5.2 等长上下文代理模型,它更适合把文本、图像、视频资料放入同一工作流。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Claude
claude-opus-4-8
Anthropic
上下文1M
输入$5.0000/M
输出$25.0000/M
面向旗舰推理与复杂代理任务,相比 Claude Opus 4.7 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Gemini
gemini-omni-video
Google
按秒$0.2450/s
面向任意输入到视频的多模态创作,相比 Gemini 早期视频能力更强调文本、图像、音频和视频资料的统一编排;对比 Veo、Kling、Runway,它更适合把复杂多模态素材整合进同一创意工作流。
输入模态:
输出模态:
多模态输出
Gemini
gemini-3.5-flash
Google
上下文1M
输入$1.5000/M
输出$9.0000/M
面向多模态理解、代码和长上下文任务,相比 Gemini 3.1 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Qwen
qwen3.7-max
Qwen
上下文1M
输入$1.7744/M
输出$5.3197/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Gemini
gemini-3.1-flash-lite
Google
上下文1M
输入$0.2500/M
输出$1.5000/M
面向多模态理解、代码和长上下文任务,相比 Gemini 3.0 / 2.5 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Qwen
qwen3.6-max-preview
Qwen
上下文262K
输入$1.3300/M
输出$8.0000/M
阿里通义千问 3.6 Max 预览版,约 1 万亿参数的稀疏混合专家模型。针对智能体编程、工具调用和长上下文推理深度优化,内置思考模式可在多轮对话中保持推理连贯性。262K 上下文窗口,仅通过阿里云模型服务 API 提供。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Qwen
happyhorse-1.0-video-edit
Qwen
上下文8K
按秒$0.1350/s
面向视频编辑,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
Qwen
happyhorse-1.0-t2v
Qwen
上下文8K
按秒$0.1350/s
面向文生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
Qwen
happyhorse-1.0-r2v
Qwen
上下文8K
按秒$0.1350/s
面向参考生成视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
Qwen
happyhorse-1.0-i2v
Qwen
上下文8K
按秒$0.1350/s
面向图生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
DeepSeek
deepseek-v4-pro
DeepSeek
上下文1M
输入$1.7800/M
输出$3.5500/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
DeepSeek
deepseek-v4-flash
DeepSeek
上下文1M
输入$0.1800/M
输出$0.3500/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
OpenAI
gpt-5.5
OpenAI
上下文1M
输入$5.0000/M
输出$30.0000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.4 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
XiaomiMiMo
xiaomi-mimo-v2.5-pro
XiaomiMiMo
上下文1M
输入$75.0000/M
输出$75.0000/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
XiaomiMiMo
xiaomi-mimo-v2.5
XiaomiMiMo
上下文1M
输入$75.0000/M
输出$75.0000/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
XiaomiMiMo
mimo-v2.5-tts-voicedesign
XiaomiMiMo
输入$0.0000/M
输出$0.0000/M
面向文本音色设计,只需用一句话描述目标声音即可生成全新音色;适合品牌 IP、游戏 NPC、虚拟主播、有声剧角色等需要原创声音的创作场景。
输入模态:
输出模态:
语音合成音色设计风格指令音频标签控制
XiaomiMiMo
mimo-v2.5-tts-voiceclone
XiaomiMiMo
输入$0.0000/M
输出$0.0000/M
面向声音克隆的 MiMo v2.5 TTS 模型,可基于参考音频生成接近目标音色的语音,并结合文本指令控制风格、语气和音频标签;适合角色配音、个性化旁白、品牌声音和多语音资产制作。
输入模态:
输出模态:
语音合成音色克隆风格指令音频标签控制
XiaomiMiMo
mimo-v2.5-tts
XiaomiMiMo
输入$0.0000/M
输出$0.0000/M
面向开箱即用的文本转语音,内置多款高质量精品音色,支持对语速、情绪、语气等进行精细控制,适合旁白、播客、角色配音和多场景音频生成。
输入模态:
输出模态:
语音合成音频输出风格指令音频标签控制
OpenAI
gpt-image-2-text-to-image
OpenAI
上下文128K
按张$0.0200/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
OpenAI
gpt-image-2-image-to-image
OpenAI
上下文128K
按张$0.0200/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
OpenAI
gpt-image-2
OpenAI
上下文128K
按张$0.0670/image
面向高质量图像生成与编辑,相比 GPT Image 1.x 在文字渲染、局部编辑和多轮一致性上更进一步;对比 Gemini 图像模型、Qwen Image 和 Seedream,它更适合品牌视觉、广告设计、产品图和需要精细控制的创意工作流。
输入模态:
输出模态:
多模态输出
MoonshotAI
kimi-k2.6
Moonshot
输入$1.0000/M
输出$4.2000/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.5 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
工具调用深度思考
Claude
claude-opus-4-7
Anthropic
上下文1M
输入$5.0000/M
输出$25.0000/M
面向旗舰推理与复杂代理任务,相比 Claude Opus 4.6 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Minimax
MiniMax-M2.7
MiniMax
上下文200K
输入$0.3100/M
输出$1.2400/M
面向文本生成、推理和工具调用,相比 MiniMax M2.x 早期版本更强调 200K 长上下文和代理式工作流稳定性;对比 Kimi、GLM、Qwen 等同类中文模型,它适合办公、代码辅助和长文档处理。
输入模态:
输出模态:
深度思考
Minimax
MiniMax-M2.5
MiniMax
上下文200K
输入$0.3020/M
输出$1.2077/M
MiniMax M2.5 面向长文档处理、中文办公、代码辅助和工具调用场景,提供 200K 上下文与较稳的文本推理能力;适合作为 Kimi、GLM、Qwen 等同类模型之外的长上下文生产力选择。
输入模态:
输出模态:
长上下文文本推理工具调用代码辅助
OpenAI
gpt-5.4-nano
OpenAI
上下文400K
输入$0.2000/M
输出$1.2500/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
工具调用结构化输出长上下文
OpenAI
gpt-5.4-mini
OpenAI
上下文400K
输入$0.7500/M
输出$4.5000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
OpenAI
gpt-5.4
OpenAI
上下文1.05M
输入$2.5000/M
输出$15.0000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
Qwen
qwen-image-2.0-pro
Qwen
上下文33K
输入$2.2000/M
输出$2.2000/M
面向图像生成与编辑,相比 Qwen Image 1.x 在中文文字渲染、指令遵循和复杂版式上更进一步;对比 GPT Image、Gemini 图像模型和 Seedream,它更适合中文海报、电商图、信息图和多轮视觉创作。
输入模态:
输出模态:
结构化输出多模态输出
Qwen
qwen-image-2.0
Qwen
上下文33K
输入$2.2000/M
输出$2.2000/M
面向图像生成与编辑,相比 Qwen Image 1.x 在中文文字渲染、指令遵循和复杂版式上更进一步;对比 GPT Image、Gemini 图像模型和 Seedream,它更适合中文海报、电商图、信息图和多轮视觉创作。
输入模态:
输出模态:
多模态输出
Gemini
gemini-3.1-flash-image-preview
Google
上下文131K
按张$0.0672/image
面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。
输入模态:
输出模态:
深度思考多模态输出
Gemini
gemini-3.1-pro-preview
Google
上下文1.05M
输入$2.0000/M
输出$12.0000/M
面向多模态理解、代码和长上下文任务,相比 Gemini 3.0 / 2.5 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。
输入模态:
输出模态:
长上下文
Claude
claude-sonnet-4-6-thinking
Anthropic
上下文1M
输入$3.0000/M
输出$15.0000/M
Anthropic Claude Sonnet 4.6 的扩展思考变体,启用链式推理以解决复杂问题。在编程、代码库导航、项目管理、文档创作和智能体任务方面表现出色,支持文本和图像输入。1M 上下文窗口,相比标准版在需要深度推理的场景中表现更优,适合复杂软件工程和多步骤规划任务。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Claude
claude-sonnet-4-6
Anthropic
上下文1M
输入$3.0000/M
输出$15.0000/M
面向高效编码与代理任务,相比 Claude 4.5/4.6 前序版本 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Claude
claude-opus-4-6
Anthropic
上下文1M
输入$5.0000/M
输出$25.0000/M
面向旗舰推理与复杂代理任务,相比 Claude 4.5/4.6 前序版本 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Kling
kling-video-3.0
kling
按秒$0.0900/s
面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。
输入模态:
输出模态:
多模态输出
Kling
kling-v3-omni
kling
按秒$0.0900/s
面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。
输入模态:
输出模态:
多模态输出
Kling
kling-v3
kling
按秒$0.0900/s
面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。
输入模态:
输出模态:
多模态输出
Doubao
doubao-seedream-5.0-lite
Doubao
按张$0.0350/image
面向图像生成与编辑,相比 Seedream 4.x 更强调中文指令理解、视觉推理和高频创意产出;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合字节生态内的广告设计、电商素材和多场景视觉生产。
输入模态:
输出模态:
联网搜索多模态输出
Doubao
doubao-seedance-2.0-V2V
Doubao
上下文8K
输入$4.2692/M
输出$4.2692/M
面向视频到视频和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
Doubao
doubao-seedance-2.0-fast-V2V
Doubao
上下文8K
输入$3.8052/M
输出$3.8052/M
面向视频到视频和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。高速版本相比标准档更适合快速迭代和批量产出;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
Doubao
doubao-seedance-2.0-fast
Doubao
上下文8K
输入$3.8052/M
输出$3.8052/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。高速版本相比标准档更适合快速迭代和批量产出;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
Doubao
doubao-seedance-2.0
Doubao
上下文8K
输入$4.2692/M
输出$4.2692/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
MoonshotAI
kimi-k2.5
Moonshot
上下文256K
输入$0.6300/M
输出$3.1500/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
长上下文工具调用深度思考
Gemini
gemini-3-flash-preview
Google
上下文1M
输入$0.5000/M
输出$3.0000/M
Google 高速推理模型,专为 Agent 工作流、多轮对话和代码辅助而设计。支持文本、图像、音频、视频和 PDF 输入,100 万 token 上下文窗口。支持可配置推理级别、工具调用和结构化输出。比前代 Gemini 2.5 Flash 在推理、多模态理解和可靠性方面全面提升。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
OpenAI
gpt-image-1.5
OpenAI
上下文128K
输入$8.5600/M
输出$34.0003/M
面向高质量图像生成与编辑,相比 GPT Image 1.x 在文字渲染、局部编辑和多轮一致性上更进一步;对比 Gemini 图像模型、Qwen Image 和 Seedream,它更适合品牌视觉、广告设计、产品图和需要精细控制的创意工作流。
输入模态:
输出模态:
多模态输出
DeepSeek
DeepSeek-V3.2-Thinking
DeepSeek
上下文128K
输入$0.3100/M
输出$0.4700/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.1 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
DeepSeek
deepseek-v3.2-think
DeepSeek
上下文131K
输入$75.0000/M
输出$75.0000/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.1 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
DeepSeek
DeepSeek-V3.2
DeepSeek
上下文128K
输入$0.3100/M
输出$0.4720/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.1 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
DeepSeek
deepseek-v3.2
DeepSeek
上下文131K
输入$0.3100/M
输出$0.4720/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.1 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Gemini
gemini-3-pro-image-preview
Google
上下文66K
按张$0.1340/image
面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。
输入模态:
输出模态:
深度思考多模态输出
Claude
claude-opus-4-5
Anthropic
上下文200K
输入$5.0000/M
输出$25.0000/M
面向旗舰推理与复杂代理任务,相比 Claude 4 系列前序版本 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Gemini
veo3.1-lite
Google
按次$0.1000/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Lite 档相较标准档更偏向高吞吐和低成本草稿。
输入模态:
输出模态:
多模态输出
Gemini
veo3.1-fast
Google
按次$0.2010/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Fast 档相较标准档更适合快速概念验证。
输入模态:
输出模态:
多模态输出
Gemini
veo3.1
Google
按次$1.5040/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。
输入模态:
输出模态:
多模态输出
Gemini
gemini-2.5-flash-image
Google
上下文66K
按张$0.0585/image
面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。
输入模态:
输出模态:
结构化输出多模态输出
Claude
claude-haiku-4-5
Anthropic
上下文200K
输入$1.1000/M
输出$5.5000/M
面向高效编码与代理任务,相比 Claude Haiku 3.5 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Jina
jina-embeddings-v4
Jina
上下文33K
输入$0.0374/M
输出$0.0374/M
面向 RAG 和搜索基础设施的多模态 embedding 模型,不是聊天模型。它支持 32K 文本输入,把文本、图片和视觉文档映射到统一向量空间,适合知识库检索、图文/文档搜索、代码检索和语义匹配;默认 2048 维,也可按存储成本截断维度。
输入模态:
Gemini
gemini-3.6-flash
Google
输入$1.5000/M
输出$7.5000/M
Gemini
gemini-3.5-flash-lite
Google
输入$0.3000/M
输出$2.5000/M
Claude
claude-opus-4-7-thinking
Anthropic
上下文1M
输入$5.0000/M
输出$25.0000/M
面向旗舰推理与复杂代理任务,相比 Claude Opus 4.6 在长上下文、代码、工具使用和复杂规划上更进一步;对比 GPT、Gemini、Qwen 等旗舰模型,它更适合高可靠代理、代码库维护和深度研究工作流。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Doubao
doubao-seedream-5-0-pro
Doubao
按张$0.0450/image
面向专业视觉创作的多模态图像生成模型,支持从文本生成图像,并结合参考图和空间标注进行精准编辑;擅长高密度信息图、文字排版、真实光影与多语言图文生成。
输入模态:
输出模态:
深度思考多模态输出
Doubao
doubao-seedance-2.5-260628
Doubao
输入$3.6000/M
输出$3.6000/M
Doubao
doubao-seedance-2.5
Doubao
输入$7.2000/M
输出$7.2000/M
面向广告、品牌内容和叙事短片等专业视频创作,重点解决长镜头、多素材约束与反复精修:支持文本/图像生成及 R2V 参考控制,可组合多模态素材,标准模式最长 30 秒,并能局部修改画面而不整段重生成。相比 Seedance 2.0,选择它的主要理由是更长的连续镜头、更丰富的参考输入,以及更可控的后期修正。
输入模态:
输出模态:
Doubao
doubao-seedance-2.0-mini-260615
Doubao
输入$0.5922/M
输出$0.5922/M
Doubao
doubao-seedance-2.0-fast-260128
Doubao
输入$1.6200/M
输出$1.6200/M
Doubao
doubao-seedance-2.0-260128
Doubao
输入$2.1443/M
输出$2.1443/M
Doubao
doubao-seed-2-0-pro
Doubao
上下文256K
输入$0.5000/M
输出$2.5300/M
面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文
Qwen
qwen3.7-plus
Qwen
上下文1M
输入$0.2950/M
输出$1.1900/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
Qwen
qwen3.6-plus
Qwen
上下文1M
输入$0.3000/M
输出$1.7700/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.5 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Qwen
qwen3.6-flash
Qwen
上下文1M
输入$0.1785/M
输出$1.0605/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.5 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
Gemini
nano-banana-pro
Google
按张$0.0530/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
Gemini
nano-banana-2-lite
Google
按次$0.0200/call
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
Gemini
nano-banana-2
Google
按张$0.0330/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
XiaomiMiMo
mimo-v2.5-pro
XiaomiMiMo
上下文1M
输入$1.1700/M
输出$3.5000/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
XiaomiMiMo
mimo-v2.5
XiaomiMiMo
上下文1M
输入$0.4700/M
输出$2.3600/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
MoonshotAI
kimi-k2.7-code-highspeed
Moonshot
上下文256K
输入$1.9000/M
输出$7.9999/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
工具调用函数调用结构化输出长上下文
Zhipu
glm-image
Zhipu AI
输入$0.8800/M
输出$3.5500/M
面向图像生成与编辑,相比早期 GLM 视觉能力更专注于中文提示词、图文理解和可控生成;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合中文营销素材、知识图解和多轮视觉修改。
输入模态:
输出模态:
多模态输出