资讯中心

小白学大模型:多模态 Qwen2.5-VL,收藏这一篇就够了!!

📅 2026/8/27 17:49:58
小白学大模型:多模态 Qwen2.5-VL,收藏这一篇就够了!!
前言Qwen-VL 是阿里云研发的大规模视觉语言模型Large Vision Language Model, LVLM。Qwen-VL 可以以图像、文本、检测框作为输入并以文本和检测框作为输出。Qwen-VL 系列模型性能强大具备多语言对话、多图交错对话等能力并支持中文开放域定位和细粒度图像识别与理解。https://github.com/QwenLM/Qwen2.5-VL安装方法pip install githttps://github.com/huggingface/transformers accelerate pip install qwen-vl-utils[decord]模型硬件要求PrecisionQwen2.5-VL-3BQwen2.5-VL-7BQwen2.5-VL-72BFP3211.5 GB26.34 GB266.21 GBBF165.75 GB13.17 GB133.11 GBINT82.87 GB6.59 GB66.5 GBINT41.44 GB3.29 GB33.28 GB模型特性强大的文档解析能力将文本识别升级为全文档解析擅长处理多场景、多语言以及包含各种内置元素手写文字、表格、图表、化学公式和乐谱的文档。精准的对象定位跨格式支持提升了检测、指向和计数对象的准确性支持绝对坐标和JSON格式以实现高级空间推理。超长视频理解和细粒度视频定位将原生动态分辨率扩展到时间维度增强对时长数小时的视频的理解能力同时能够在秒级提取事件片段。增强的计算机和移动设备代理功能借助先进的定位、推理和决策能力为模型赋予智能手机和计算机上更出色的代理功能。使用案例基础图文问答fromtransformersimportQwen2_5_VLForConditionalGeneration,AutoProcessorfromqwen_vl_utilsimportprocess_vision_info modelQwen2_5_VLForConditionalGeneration.from_pretrained(Qwen/Qwen2.5-VL-7B-Instruct,torch_dtypeauto,device_mapauto)# 传入文本、图像或视频messages[{role:user,content:[{type:image,image:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg,},{type:text,text:Describe this image.},],}]# Preparation for inferencetextprocessor.apply_chat_template(messages,tokenizeFalse,add_generation_promptTrue)image_inputs,video_inputsprocess_vision_info(messages)inputsprocessor(text[text],imagesimage_inputs,videosvideo_inputs,paddingTrue,return_tensorspt,)inputsinputs.to(model.device)# Inference: Generation of the outputgenerated_idsmodel.generate(**inputs,max_new_tokens128)generated_ids_trimmed[out_ids[len(in_ids):]forin_ids,out_idsinzip(inputs.input_ids,generated_ids)]output_textprocessor.batch_decode(generated_ids_trimmed,skip_special_tokensTrue,clean_up_tokenization_spacesFalse)print(output_text)多图输入messages[{role:user,content:[{type:image,image:file:///path/to/image1.jpg},{type:image,image:file:///path/to/image2.jpg},{type:text,text:Identify the similarities between these images.},],}]视频理解Messages containing a images list as a video and a text querymessages[{role:user,content:[{type:video,video:[file:///path/to/frame1.jpg,file:///path/to/frame2.jpg,file:///path/to/frame3.jpg,file:///path/to/frame4.jpg,],},{type:text,text:Describe this video.},],}]Messages containing a local video path and a text querymessages[{role:user,content:[{type:video,video:file:///path/to/video1.mp4,max_pixels:360*420,fps:1.0,},{type:text,text:Describe this video.},],}]Messages containing a video url and a text querymessages[{role:user,content:[{type:video,video:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen2-VL/space_woaudio.mp4,min_pixels:4*28*28,max_pixels:256*28*28,total_pixels:20480*28*28,},{type:text,text:Describe this video.},],}]物体检测定位最右上角的棕色蛋糕以JSON格式输出其bbox坐标请以JSON格式输出图中所有物体bbox的坐标以及它们的名字然后基于检测结果回答以下问题图中物体的数目是多少图文解析OCR请识别出图中所有的文字Spotting all the text in the image with line-level, and output in JSON format.提取图中的[‘发票代码’,‘发票号码’,‘到站’,‘燃油费’,‘票价’,‘乘车日期’,‘开车时间’,‘车次’,‘座号’]并且按照json格式输出。Agent Computer UseThe user query:在盒马中,打开购物车结算到付款页面即可 (You have done the following operation on the current device):最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】