Qwen2.5-VL
阿里云 推出的多模态模型 · 发布于 2025-01
开源
多模态
开源
API 可用
模型简介
Qwen2.5-VL 是阿里通义千问团队的视觉语言模型,支持图像、视频和文档的深度理解。它能够动态分辨率处理任意尺寸的图片,支持长达数小时的视频分析,并能精准定位图像中的物体坐标。72B 版本在多模态基准测试中达到业界领先水平,是开源视觉语言模型的标杆之一。
核心特性
- 动态分辨率视觉理解
- 长视频分析
- 物体定位与 OCR
- 多规格可选
核心优势
- 视觉理解能力领先
- 视频分析出色
- 开源灵活
技术规格
参数量
3B / 7B / 72B
上下文窗口
128K tokens
API 支持
是
开源状态
开源
发布日期
2025-01
提供商
阿里云
价格信息
免费开源;API 调用按量付费
基准测试
MMBench 87.5%, DocVQA 96.2%, 多模态基准领先