minicpm-v_pytorch多模态OCR大模型

最新推荐文章于 2025-06-02 09:00:14 发布

技术瘾君子1573

最新推荐文章于 2025-06-02 09:00:14 发布

阅读量1.8k

点赞数 56

CC 4.0 BY-SA版权

分类专栏：人工智能&深度学习&机器学习文章标签： pytorch ocr 人工智能 python

本文链接：https://blog.csdn.net/qq_27815483/article/details/141392385

MiniCPM-V

MiniCPM-V是面向图文理解的端侧多模态大模型系列。该系列模型接受图像和文本输入，并提供高质量的文本输出。

论文

MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

模型结构

MiniCPM 是面壁智能与清华大学自然语言处理实验室共同开源的系列端侧大模型，主体语言模型 MiniCPM-2B 仅有 24亿（2.4B）的非词嵌入参数量, 总计2.7B参数量。

算法原理

该模型基于 MiniCPM 2.4B 和 SigLip-400M 构建，共拥有 2.8B 参数。MiniCPM-V 2.0 具有领先的光学字符识别（OCR）和多模态理解能力。该模型在综合性 OCR 能力评测基准 OCRBench 上达到开源模型最佳水平，甚至在场景文字理解方面实现接近 Gemini Pro 的性能。

环境配置

Docker（方法一）

光源拉取docker镜像的地址与使用步骤

docker pull image.sourcefind.cn:5000/dcu/admin/base/pytorch:2.1.0-ubuntu20.04-dtk24.04.1-py310

docker run -it -v /path/your_code_data/:/path/your_code_data/ -v /opt/hyhal/:/opt/hyhal/:ro --shm-size