Margrop
Articles261
Tags676
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 安全 AI 工程 AI 应用 AI 日记 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安装 定时任务 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 按 provider 优先级 排查 推理加速 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

NeoMME 多模态编码器:视觉文档检索能不能更快更省?

NeoMME 多模态编码器:视觉文档检索能不能更快更省?

NeoMME 多模态编码器与视觉文档检索

先说结论

Hugging Face 在 2026 年 9 月 3 日发布的 NeoMME,值得关注的不是“又一个多模态模型”,而是它把图片与文字放进同一个双向编码器,并直接面向视觉文档检索。官方给出的结果显示,260M 版本在 2048×2048 图片输入、NVIDIA L40S 上每秒可编码约 51 页;通过层次化 token pooling 和非对称量化,late-interaction 索引可以从每页约 1.5 MB 压到 6 kB,同时保留超过 95% 的基线 nDCG@10。

我的判断是:NeoMME 更像 RAG 检索层的专用组件,而不是用来聊天的通用视觉语言模型。它特别适合扫描件、表格、图文混排的知识库,但不能因为索引变小、速度变快,就跳过权限过滤、来源核验和 Agent 的结构化校验。先把它放在候选召回或精排层做离线回放,比直接替换现有检索链稳妥得多。

发生了什么

主体来源是 Hugging Face 官方博客 NeoMME: an efficient Multimodal-native and Multilingual Encoder,发布日期为 2026-09-03。官方事实包括 NeoMME 的模型规模、统一编码器设计、训练目标、视觉文档检索方式、ViDoRe 评测结果、吞吐量、索引压缩结果以及 Apache 2.0 发布许可。本文关于 Agent 架构、生产边界和验收方法的内容,则属于我的判断。

NeoMME 由 Hcompany 团队发布,提供 260M 和 800M 两个规模。它不依赖单独预训练的视觉塔,也不使用因果语言模型,而是让一个双向 Transformer 同时处理文字 token 和原始图片 patch。官方还发布了 Transformers 中可用的模型检查点,并把 NeoMME-Retriever 微调到视觉文档检索任务上。

这条消息和普通的视觉问答模型发布不同。传统文档 RAG 往往先把 PDF 做 OCR,再把文本切块、嵌入和索引;NeoMME-Retriever 采用页面图片路线,直接对文档页面进行检索。这样做可能保留版式、表格关系和图文位置,减少 OCR 预处理,但也把图片编码成本与显存需求带进了检索系统。

技术细节

1. 一个双向 Transformer 同时处理文字和图片

NeoMME 把文字 token 与图片 patch 放入同一个编码器。图片被切成不重叠的 32×32 patch,再由小型 MLP 投影;文字使用因子化 token embedding。官方描述的上下文长度为 16,384 token,并采用滑动窗口注意力与周期性的全局注意力组合,处理长页面时可以在局部计算量和全局信息之间取得平衡。

这种设计的工程含义是,页面中的标题、数字、表格单元格和视觉位置可以进入同一表示空间。它不需要先把页面“翻译”为纯文本才开始检索,因此对扫描件和复杂布局更友好。但它也意味着输入分辨率、patch 数量和编码耗时需要一起规划;清晰度提高并不等于系统总成本一定下降。

2. 掩码扩散目标让图片成为证据

NeoMME 从头训练时使用 masked discrete-diffusion text denoising。对文字样本,训练过程随机遮盖一部分 token;多模态样本则保留图片 patch,同时让模型恢复被遮盖的文字。遮盖比例较低时,模型可以依靠上下文猜词;遮盖比例较高时,文字线索变少,模型必须更多利用图片内容。

这个训练目标解决了一个常见问题:模型可能只记住语言模式,却没有真正看懂图片。让它在可见页面上恢复缺失文字,能够鼓励视觉证据参与表示学习。当然,训练目标仍不等于生产事实核验。模型可能把模糊数字、表格边界或相似符号识别错误,下游系统必须保留原页面引用,并在关键字段上要求二次确认。

3. dense 与 late-interaction 一次前向同时产出

NeoMME-Retriever 的一个亮点是一次前向同时返回 dense embedding 与 late-interaction embedding。dense 表示适合传统向量检索,索引简单、吞吐较高;late interaction 则保留多个局部向量,让查询的不同 token 分别寻找页面中的高相似区域,再汇总匹配分数。

官方在 ViDoRe v3 上报告,NeoMME-260M 的 nDCG@10 为 0.523,NeoMME-800M 为 0.556。作为参照,官方表格中 250M 的 ColModernVBERT 为 0.261,3.75B 的 ColQwen2.5-v0.2 为 0.524。这个比较说明小模型也可能在特定视觉检索任务上有竞争力,但不能把一次 benchmark 排名直接当成所有企业文档的上线结果。

4. 压缩索引解决了 late interaction 的最大痛点

late interaction 的代价是每页保存多个向量,存储量会随着页面分辨率和 token 数增加。官方测得,2048×2048 页面平均约需 1.5 MB 的 float32 索引。NeoMME 采用层次化 token pooling,把相近的文档向量聚类并替换为均值;再用非对称量化压缩文档侧向量,而查询向量仍可以保留更高精度。

官方给出两档结果:pooling factor 10 加 int8 配置后,每页约 39 kB,存储缩小 39 倍,同时保留超过 99% 的基线 nDCG@10;更激进的 pooling factor 8 加二值文档向量后,每页约 6 kB,缩小 255 倍,质量仍超过基线的 95%。这提供了一条可调的质量—存储曲线,而不是只有一个固定压缩等级。

对 Agent / 工程的影响

第一,视觉检索可以减少对 OCR 单一路径的依赖,但不应取消 OCR 或文本索引。对代码、数字、表格和法律条款,混合路线通常更稳:先用便宜的文本或 dense 检索扩大候选,再用页面级多向量表示做精排;当两条路径结论冲突时,保留冲突状态并交给规则或人工处理。

第二,Agent 的检索验收必须落到任务完成率。单独测 nDCG 还不够,应建立合成文档集,覆盖表格、扫描件、图文混排、低清页面、相似页面和缺少关键条件的难负例。把检索结果接到只读工具或模拟工作流中,统计关键字段找到率、参数 Schema 通过率、重复检索次数、端到端延迟和单位成本。

第三,索引压缩要按业务风险选档。普通知识问答可以接受更激进的压缩;涉及金额、日期、药品、身份或设备控制的页面,则应优先保留精度,并在回答中给出页码或页面截图引用。压缩实验还要在自己的文档分布上复测,因为官方 benchmark 的页面尺寸、语言和查询类型未必代表你的语料。

第四,多模态检索的权限边界不能藏在模型里。索引建立前要绑定文档权限,查询时先做访问控制,再计算或返回候选。不能因为页面被编码成向量,就把它当成脱离原文的匿名数据;向量仍然可能携带敏感信息,存储、备份和删除策略都要与原文生命周期一致。

第五,NeoMME 的 Apache 2.0 许可降低了试用门槛,但不等于所有训练数据和部署环境都自动满足合规要求。团队仍应核对模型版本、权重来源、依赖许可证、硬件需求和数据处理规则。发布检查点可以让复现更容易,不能代替对业务数据和访问权限的审查。

我的判断

NeoMME 是一个很实用的方向:用较小的多模态编码器直接检索页面,再用压缩让 late interaction 有机会进入生产。我会先把 260M 版本放进视觉文档 RAG 的离线对照组,和现有 OCR 加文本检索并排测试;只有在真实任务成功率提升、索引成本可接受、权限过滤完整的前提下,才扩大到在线流量。

不要把它当成“用一个模型替换整个 RAG”。它解决的是表示和检索问题,不能替你解决文档新鲜度、权限一致性、工具执行安全和回答事实性。对 Agent 来说,最有价值的组合仍然是:多模态检索负责找证据,确定性规则负责检查边界,模型负责在有来源的上下文中组织解释。

Q&A

Q1:来源和发布日期是什么?

A:来源是 Hugging Face 官方博客 NeoMME: an efficient Multimodal-native and Multilingual Encoder,发布日期为 2026-09-03。模型规模、吞吐量、评测分数和压缩结果均以该官方文章为准。

Q2:NeoMME 是聊天模型吗?

A:它的核心定位是多模态编码器,NeoMME-Retriever 面向视觉文档检索,不是主要用于自由对话的生成式视觉语言模型。它适合提供检索表示,回答仍可交给后续生成模型。

Q3:为什么页面图片检索有价值?

A:它可以保留版式、表格和图文位置,减少对 OCR 预处理的依赖。代价是图片编码、索引存储和权限管理更复杂,因此应与文本路线做混合评测,而不是盲目替换。

Q4:怎么做最小验证?

A:准备一套合成页面集,包含表格、扫描件、相似页面、数字和多语言文本。对比 OCR 文本检索、dense 检索和 late interaction,记录召回、任务成功率、延迟、索引体积、显存和单位成本。

Q5:什么时候不适合直接上线?

A:当文档权限无法在检索前过滤、关键字段没有二次确认、页面质量差且没有降级路径,或团队只验证了公开 benchmark、没有自己的任务回放时,不应直接接入有外部影响的 Agent 动作。


参考资料:

  1. NeoMME: an efficient Multimodal-native and Multilingual Encoder — Hugging Face Blog(2026-09-03,官方文章)

本文性质:基于 2026-09-03 官方发布的 AI Tech 技术解读。
字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-09-04-neomme-multimodal-retrieval(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-09-04-neomme-multimodal-retrieval/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可