完整指南:使用vit_base_patch32_clip_384.openai_ft_in12k_in1k生成图像嵌入向量的3种方法

发布时间:2026/8/11 17:48:45

完整指南:使用vit_base_patch32_clip_384.openai_ft_in12k_in1k生成图像嵌入向量的3种方法
完整指南使用vit_base_patch32_clip_384.openai_ft_in12k_in1k生成图像嵌入向量的3种方法【免费下载链接】vit_base_patch32_clip_384.openai_ft_in12k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1kvit_base_patch32_clip_384.openai_ft_in12k_in1k是一个基于Vision TransformerViT架构的图像分类模型由OpenAI使用CLIP在WIT-400M图像文本对上预训练然后在ImageNet-12k和ImageNet-1k数据集上进行微调。该模型不仅可用于图像分类还能高效生成图像嵌入向量助力各种计算机视觉任务。模型基础信息核心参数模型类型图像分类/特征骨干网络参数量88.3M图像尺寸384×384特征维度768通过config.json可知num_features为768预训练数据集WIT-400M、ImageNet-12k方法一移除分类头获取嵌入向量这种方法通过设置num_classes0来移除模型的分类层直接输出特征向量。from urllib.request import urlopen from PIL import Image import timm # 加载图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) # 创建模型设置num_classes0移除分类器 model timm.create_model( vit_base_patch32_clip_384.openai_ft_in12k_in1k, pretrainedTrue, num_classes0, # 关键参数移除分类头 ) model model.eval() # 获取模型特定的图像变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) # 生成嵌入向量 output model(transforms(img).unsqueeze(0)) # 输出形状为 (batch_size, num_features) print(f嵌入向量维度: {output.shape}) # 应输出 (1, 768)方法二使用forward_features获取中间特征通过调用模型的forward_features方法可以获取未经池化的中间特征适用于需要更细粒度特征的场景。from urllib.request import urlopen from PIL import Image import timm # 加载图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) # 创建模型无需移除分类头 model timm.create_model( vit_base_patch32_clip_384.openai_ft_in12k_in1k, pretrainedTrue, ) model model.eval() # 获取图像变换 data_config timm.data.resolve_model_data_config(model) transforms timm.data.create_transform(**data_config, is_trainingFalse) # 获取中间特征未池化 output model.forward_features(transforms(img).unsqueeze(0)) print(f未池化特征维度: {output.shape}) # 输出 (1, 145, 768) # 进一步处理为最终嵌入向量 output model.forward_head(output, pre_logitsTrue) print(f最终嵌入向量维度: {output.shape}) # 输出 (1, 768)方法三结合Hugging Face Transformers库使用如果你熟悉Transformers库也可以通过该库加载模型并生成嵌入向量需确保已安装transformers库。from urllib.request import urlopen from PIL import Image from transformers import ViTImageProcessor, ViTModel # 加载图像处理器和模型 processor ViTImageProcessor.from_pretrained(hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k) model ViTModel.from_pretrained(hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k) # 加载并预处理图像 img Image.open(urlopen( https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png )) inputs processor(imagesimg, return_tensorspt) # 生成嵌入向量 with torch.no_grad(): outputs model(**inputs) # 获取[CLS] token对应的特征作为嵌入向量 embedding outputs.last_hidden_state[:, 0, :] print(f嵌入向量维度: {embedding.shape}) # 输出 (1, 768)模型应用场景生成的图像嵌入向量可广泛应用于图像检索通过比较嵌入向量相似度实现相似图像搜索零样本分类结合文本嵌入进行跨模态分类特征提取作为其他下游任务的输入特征迁移学习在小数据集上进行微调以提高性能注意事项图像预处理必须使用模型特定的预处理参数可通过data_config获取包括归一化均值[0.48145466, 0.4578275, 0.40821073]和标准差[0.26862954, 0.26130258, 0.27577711]模型加载确保使用pretrainedTrue加载预训练权重性能优化推理时使用model.eval()和torch.no_grad()提高速度并减少内存占用总结vit_base_patch32_clip_384.openai_ft_in12k_in1k提供了灵活多样的图像嵌入向量生成方法无论是通过timm库的简洁API还是结合Transformers库的丰富功能都能轻松获取高质量的图像特征。这些嵌入向量为计算机视觉任务提供了强大的基础帮助开发者快速构建各类应用。要开始使用该模型可通过以下命令克隆仓库git clone https://gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k【免费下载链接】vit_base_patch32_clip_384.openai_ft_in12k_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch32_clip_384.openai_ft_in12k_in1k创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

分布式事务反直觉坑位与避坑指南:状态扭转的日志保留策略

分布式事务反直觉坑位与避坑指南:状态扭转的日志保留策略

2026/8/11 17:38:45

分布式事务反直觉坑位与避坑指南:状态扭转的日志保留策略 在分布式存储与微服务架构中,实现跨节点的数据一致性(如 2PC、TCC、Saga 协议)向来是技术难点。许多工程团队在初建分布式事务框架时,通常能够完成正常逻辑的 …

res-downloader:一站式跨平台网络资源下载解决方案

res-downloader:一站式跨平台网络资源下载解决方案

2026/8/11 17:38:45

res-downloader:一站式跨平台网络资源下载解决方案 【免费下载链接】res-downloader 视频号、小程序、抖音、快手、小红书、直播流、m3u8、酷狗、QQ音乐等常见网络资源下载! 项目地址: https://gitcode.com/GitHub_Trending/re/res-downloader 还在为无法保存…

大规模数据迁移:数据切片粒度怎样拿捏

大规模数据迁移:数据切片粒度怎样拿捏

2026/8/11 17:38:45

大规模数据迁移:数据切片粒度怎样拿捏 在大规模异构数据库迁移中,数据切片(Chunking/Splitting)会影响源端负载、并发度、恢复速度和校验成本。 切片过大可能提高单任务的内存、锁和重试成本;切片过小则会增加调度与位…

用 WorkBuddy 生成高质量 PPT,保姆级教程来啦~

用 WorkBuddy 生成高质量 PPT,保姆级教程来啦~

2026/8/11 18:58:49

大家好,我是汤师爷~ 前几天,我拿 WorkBuddy 做了一份季度复盘 PPT。 一开始我也没整什么复杂操作,就扔过去一句「帮我做一份季度复盘 PPT」。 几分钟以后,二十页的成品出来了。 该有的都有,但我翻了几页就有点坐不…

Unity卡牌游戏开发神器:Balatro-Feel项目中的CardVisual组件详解

Unity卡牌游戏开发神器:Balatro-Feel项目中的CardVisual组件详解

2026/8/11 18:58:49

Unity卡牌游戏开发神器:Balatro-Feel项目中的CardVisual组件详解 【免费下载链接】Balatro-Feel Recreating the basic Game Feel from Balatro 项目地址: https://gitcode.com/gh_mirrors/ba/Balatro-Feel Balatro-Feel是一个专注于重现卡牌游戏《Balatro》…

Go 泛型核心精讲:从原理到实战,吃透90%开发场景

Go 泛型核心精讲:从原理到实战,吃透90%开发场景

2026/8/11 18:58:49

这篇文章帮你精简梳理 Go 泛型的核心知识点、语法细节、底层原理和落地规范,不灌水、不啰嗦,不管是快速入门、面试复盘还是项目实战都完全够用。一、泛型核心价值:解决什么问题? Go 1.18 正式上线的泛型,主要解决了以往…

JupyterLab-nvdashboard同步tooltip功能详解:多图表数据联动分析技巧

JupyterLab-nvdashboard同步tooltip功能详解:多图表数据联动分析技巧

2026/8/11 18:58:49

JupyterLab-nvdashboard同步tooltip功能详解:多图表数据联动分析技巧 【免费下载链接】jupyterlab-nvdashboard A JupyterLab extension for displaying dashboards of GPU usage. 项目地址: https://gitcode.com/gh_mirrors/ju/jupyterlab-nvdashboard Jupy…

Gitee PPM 深度解析:在软件工厂中实现项目组合管控与 AI 研发风险治理

Gitee PPM 深度解析:在软件工厂中实现项目组合管控与 AI 研发风险治理

2026/8/11 18:58:49

项目组合管理(PPM)是面向组织全局的多项目治理手段;依托 Gitee 企业版一体化研发底座,Gitee PPM 打通项目规划、工程执行、效能度量与智能风险识别链路,成为软件工厂连接业务目标与研发交付的核心管理入口。在多项目并…

PostgreSQL表膨胀问题诊断与优化实战

PostgreSQL表膨胀问题诊断与优化实战

2026/8/11 18:48:48

1. 数据库表膨胀现象的本质剖析数据库表膨胀是PostgreSQL等采用MVCC(多版本并发控制)机制的数据库系统中特有的存储异常现象。当表中存在大量过期但未被回收的行版本时,就会导致物理存储空间远大于有效数据量的情况。这种现象在频繁更新的业务…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/10 5:58:32

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/11 8:44:43

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/11 15:57:54

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

Unity新手入门:从零搭建开发环境与核心概念解析

Unity新手入门:从零搭建开发环境与核心概念解析

2026/8/11 0:07:41

1. 项目概述:为什么Unity是游戏开发者的首选起点如果你对游戏开发感兴趣,或者想进入这个充满创造力的行业,那么“Unity”这个名字你肯定不陌生。它几乎是所有新手开发者、独立游戏团队,甚至是一些3A大厂在特定项目上的首选引擎。为…

Agency-Agents 智能体系统从零搭建实战指南

Agency-Agents 智能体系统从零搭建实战指南

2026/8/11 0:07:41

在开发复杂应用时,我们常常遇到单一模型难以兼顾全局规划与细节执行的困境。有时候,模型擅长创意生成却在逻辑推理上稍显吃力,或者精于代码编写却缺乏对业务上下文的深刻理解。为了解决这个问题,多智能体协作架构应运而生&#xf…

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

2026/8/11 0:07:41

🚀 MiniMax Token Plan MiniMax 推出全新 Token 计划,新增语音、音乐、视频和图片生成权益。 用户邀请好友可享双重福利 订阅一份套餐,解锁最新模型 —— 前沿 Coding 能力、1M 超长上下文、原生多模态,图文音视频共用套餐额度。 …

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…