27屆大模型崗面試準(zhǔn)備(十四):多模態(tài)大模型 VLM——從視覺(jué)編碼器到多模態(tài)推理的完整鏈路
27屆大模型崗面試準(zhǔn)備十四多模態(tài)大模型 VLM——從視覺(jué)編碼器到多模態(tài)推理的完整鏈路寫(xiě)在前面上一篇十三我們講長(zhǎng)上下文時(shí)留了個(gè)口子當(dāng)上下文里不只有文字還有圖像時(shí)問(wèn)題又升了一個(gè)維度。這一篇就填這個(gè)坑——多模態(tài)大模型Vision-Language ModelVLM。你正在準(zhǔn)備華為的多模態(tài) LLM崗位這一篇幾乎就是你的主場(chǎng)題。面試官不會(huì)只問(wèn)VLM 是什么而是會(huì)追到圖像怎么變成 token、和文本 token 怎么對(duì)齊、訓(xùn)練怎么分階段、多模態(tài)推理到底難在哪。本文按架構(gòu) → 對(duì)齊 → 訓(xùn)練 → 推理的順序展開(kāi)最后給一段可運(yùn)行的多模態(tài)推理代碼用開(kāi)源 VLM 接口。一、VLM 的主流架構(gòu)三件套幾乎所有主流 VLM 都遵循同一個(gè)骨架視覺(jué)編碼器Vision Encoder 模態(tài)連接器Connector 語(yǔ)言模型LLM。三者職責(zé)清晰也是面試?yán)镒钤撝v明白的一張圖組件作用常見(jiàn)實(shí)現(xiàn)關(guān)鍵設(shè)計(jì)點(diǎn)視覺(jué)編碼器把圖像從像素變成語(yǔ)義向量序列CLIP-ViT / SigLIP / EVACLIP凍結(jié)還是微調(diào)、用哪個(gè)粒度的 patch模態(tài)連接器把視覺(jué)向量翻譯成 LLM 能讀的詞嵌入空間MLP 映射LLaVA / Q-FormerBLIP-2 / Resampler投影維度、是否帶可學(xué)習(xí)查詢語(yǔ)言模型接收交錯(cuò)的圖文 token做推理與生成LLaMA / Qwen / DeepSeek保持原 LLM 能力不重訓(xùn)為什么是 CLIP-ViT 當(dāng)編碼器CLIP 在海量圖文對(duì)上對(duì)比學(xué)習(xí)過(guò)它的圖像特征天然和文本語(yǔ)義在同一個(gè)對(duì)齊空間里——這正好給后面的連接器省了大事。ViT 把圖像切成 N×N 個(gè) patch每個(gè) patch 是一個(gè) token所以一張 336×336、patch14 的圖會(huì)產(chǎn)生 324 個(gè)視覺(jué) token。這正是視覺(jué) token 數(shù)量膨脹的根源也是后面上下文預(yù)算討論的入口呼應(yīng)第十三篇。兩種連接器路線的取舍是高頻追問(wèn)MLP 映射LLaVA 路線視覺(jué)特征直接過(guò)兩層線性層投影到 LLM 維度簡(jiǎn)單、訓(xùn)練快、效果夠用。代價(jià)是視覺(jué) token 數(shù)量不壓縮324 個(gè)就 324 個(gè)。Q-Former / ResamplerBLIP-2 / Flamingo 路線用一組可學(xué)習(xí) query 通過(guò)交叉注意力提煉出固定數(shù)量如 32 個(gè)視覺(jué) token。大幅壓縮 token 數(shù)但引入額外參數(shù)和訓(xùn)練復(fù)雜度。一句話總結(jié)連接器本質(zhì)是在 token 數(shù)量與信息保真之間做權(quán)衡。二、模態(tài)對(duì)齊怎么讓圖和字說(shuō)同一種語(yǔ)言LLM 只懂詞嵌入空間圖像特征是另一套坐標(biāo)系。對(duì)齊alignment就是把視覺(jué)坐標(biāo)映射到語(yǔ)言坐標(biāo)。三種范式早期融合Early Fusion直接把視覺(jué) token 拼到文本 token 序列里一起進(jìn) LLM 自注意力。LLaVA、Qwen-VL、GPT-4V 類(lèi)都走這條——實(shí)現(xiàn)最直接但視覺(jué) token 多會(huì)占上下文又回到第十三篇的預(yù)算問(wèn)題。交叉注意力融合Cross-AttentionLLM 每層通過(guò) cross-attention 去查視覺(jué)特征視覺(jué)特征不占自注意力序列。Flamingo 路線。優(yōu)點(diǎn)是不膨脹上下文缺點(diǎn)是改動(dòng) LLM 結(jié)構(gòu)、訓(xùn)練重?;旌喜糠謱佑?early、部分層用 cross-attention兼顧兩者。面試加分點(diǎn)能點(diǎn)出位置編碼外推在這里也有作用——圖像 patch token 有自己的一套位置和文本位置怎么交錯(cuò)排布是各自編號(hào)還是統(tǒng)一編號(hào)、是否加模態(tài)類(lèi)型 embedding 區(qū)分圖文是工程細(xì)節(jié)也常被問(wèn)。三、訓(xùn)練范式三階段流水線VLM 很少?gòu)牧泐A(yù)訓(xùn)練主流是在已有 LLM 和視覺(jué)編碼器上做縫合 分階段訓(xùn)練因?yàn)閳D文對(duì)齊數(shù)據(jù)貴、算力貴。標(biāo)準(zhǔn)三階段階段訓(xùn)練目標(biāo)解凍參數(shù)數(shù)據(jù)目的階段一特征對(duì)齊讓視覺(jué)特征匹配 LLM 詞嵌入只訓(xùn)連接器圖文對(duì)caption海量建立圖→文映射不動(dòng) LLM階段二指令微調(diào)多模態(tài)對(duì)話/問(wèn)答連接器 LLM多模態(tài)指令數(shù)據(jù)學(xué)會(huì)按指令看圖作答階段三能力強(qiáng)化復(fù)雜推理/特定能力全量或部分高質(zhì)量/RLHF 數(shù)據(jù)提推理、降幻覺(jué)、對(duì)齊偏好為什么階段一只解凍連接器因?yàn)榇藭r(shí) LLM 的語(yǔ)言能力是寶貴的已有資產(chǎn)用海量但粗的圖文對(duì)直接訓(xùn) LLM 容易把語(yǔ)言知識(shí)沖掉catastrophic forgetting。先讓連接器把視覺(jué)特征塞進(jìn)LLM 能理解的區(qū)間再在階段二用指令數(shù)據(jù)帶 LLM 學(xué)會(huì)圖文聯(lián)合推理。這個(gè)先對(duì)齊后微調(diào)的節(jié)奏值得主動(dòng)講。四、多模態(tài)推理難在哪這是多模態(tài)崗最容易深挖、也最能體現(xiàn)你水平的環(huán)節(jié)。單模態(tài) LLM 的推理是文本進(jìn)文本出多模態(tài)推理多出三道坎視覺(jué)幻覺(jué)Visual Hallucination模型看見(jiàn)了圖上沒(méi)有的東西——憑文本先驗(yàn)編造比如把圖里沒(méi)有的紅色杯子描述出來(lái)。根因是視覺(jué)編碼器→LLM 的信息有損且 LLM 的文本先驗(yàn)太強(qiáng)會(huì)腦補(bǔ)。緩解靠高質(zhì)量對(duì)齊數(shù)據(jù) 區(qū)域級(jí) grounding讓模型輸出物體邊界框強(qiáng)制它真的看到了。細(xì)粒度感知數(shù)清圖里有幾個(gè)物體、讀對(duì)圖表里的數(shù)字、區(qū)分左邊第三個(gè)——這些對(duì) ViT 的平均池化式表征是難點(diǎn)。高分辨率切片把圖切成多張子圖分別編碼再拼接如 LLaVA-NeXT、InternVL是主流解??缒B(tài)組合推理需要同時(shí)用圖空間關(guān)系和文本提問(wèn)約束才能答對(duì)的題比如把圖里藍(lán)色正方形旁邊的物體數(shù)量告訴我。要求模型在統(tǒng)一空間里做聯(lián)合推理而非各看各的。這里可以主動(dòng)接回你的研究方向——多模態(tài) RAG/多模態(tài)推理——但注意只講通用方法論檢索增強(qiáng)、多跳推理、跨模態(tài)對(duì)齊不展開(kāi)未公開(kāi)的具體研究點(diǎn)符合你一貫的保密要求。五、代碼實(shí)戰(zhàn)用開(kāi)源 VLM 做多模態(tài)推理下面演示兩種調(diào)用方式。第一段用 transformers 直接加載一個(gè)開(kāi)源 VLM如 Qwen2-VL / LLaVA 類(lèi)做圖文推理第二段展示用 OpenAI 兼容接口傳 base64 圖像的多模態(tài)對(duì)話。皆可運(yùn)行需安裝對(duì)應(yīng)包第二段注釋掉本地依賴符合無(wú) API 也可說(shuō)明的原則。# -*- coding: utf-8 -*- 多模態(tài)推理兩種范式本地 transformers / OpenAI 兼容接口可運(yùn)行需依賴 # 范式 A本地 transformers 加載開(kāi)源 VLM以 Qwen2-VL 風(fēng)格為例 def infer_local(image_path: str, question: str) - str: from transformers import Qwen2VLForConditionalGeneration, AutoProcessor from qwen_vl_utils import process_vision_info import torch model Qwen2VLForConditionalGeneration.from_pretrained( Qwen/Qwen2-VL-7B-Instruct, torch_dtypeauto, device_mapauto ) processor AutoProcessor.from_pretrained(Qwen/Qwen2-VL-7B-Instruct) # 構(gòu)造多模態(tài)消息圖像以本地路徑傳入文本為問(wèn)題 messages [{ role: user, content: [ {type: image, image: image_path}, {type: text, text: question}, ], }] # 模板化 把圖像轉(zhuǎn)成模型輸入像素/特征 text processor.apply_chat_template(messages, tokenizeFalse, add_generation_promptTrue) image_inputs, video_inputs process_vision_info(messages) inputs processor(text[text], imagesimage_inputs, videosvideo_inputs, paddingTrue, return_tensorspt).to(model.device) generated model.generate(**inputs, max_new_tokens256) # 去掉輸入部分只取新生成 out_ids generated[0][inputs.input_ids.shape[1]:] return processor.decode(out_ids, skip_special_tokensTrue) # 范式 BOpenAI 兼容接口傳 base64 圖像不依賴本地大模型 def infer_api(base64_image: str, question: str, api_key: str, base_url: str) - str: from openai import OpenAI client OpenAI(api_keyapi_key, base_urlbase_url) resp client.chat.completions.create( modelmultimodal-model, messages[{ role: user, content: [ {type: image_url, image_url: {url: fdata:image/png;base64,{base64_image}}}, {type: text, text: question}, ], }], max_tokens256, ) return resp.choices[0].message.content if __name__ __main__: q 圖里有幾個(gè)物體分別是什么顏色 print(問(wèn)題:, q) print(范式 A本地需安裝 transformers qwen-vl-utils 并下載權(quán)重) print(范式 BAPI需 base_url 指向一個(gè)支持多模態(tài)的兼容網(wǎng)關(guān)。)這段代碼把圖像怎么進(jìn)模型講清楚了本地范式是路徑/像素 → processor → 視覺(jué) token → 拼接文本 token → 自回歸生成API 范式則是base64 圖像隨消息體上傳、服務(wù)端完成編碼對(duì)齊。面試時(shí)被問(wèn)圖像 token 數(shù)量怎么算你可以接回第一篇的 patch 公式尺寸 / patch_size 的平方。六、高頻面試題與答題要點(diǎn)VLM 和純文本 LLM 的核心區(qū)別—— 多了視覺(jué)編碼器和模態(tài)連接器推理時(shí)多了視覺(jué) token 的編碼、對(duì)齊與融合難點(diǎn)在視覺(jué)幻覺(jué)和細(xì)粒度感知。為什么 VLM 一般不在第一階段訓(xùn) LLM—— 防災(zāi)難性遺忘先只用海量圖文對(duì)把連接器對(duì)齊再指令微調(diào)帶 LLM 學(xué)多模態(tài)推理。一張 336×336、patch14 的圖產(chǎn)生多少視覺(jué) token—— (336/14)2 324 個(gè)。能現(xiàn)場(chǎng)算這個(gè)說(shuō)明你真懂 ViT 切分。高分辨率圖怎么處理不爆上下文—— 切片tile分別編碼再拼接或 Q-Former 壓縮到固定 query 數(shù)同時(shí)配合第十三篇講的前綴緩存與 KV 壓縮。怎么緩解視覺(jué)幻覺(jué)—— 高質(zhì)量對(duì)齊數(shù)據(jù)、區(qū)域 grounding輸出 bbox、高分辨率切片、RLHF 偏好對(duì)齊。小結(jié)VLM 的骨架是視覺(jué)編碼器 連接器 LLM三件套訓(xùn)練走對(duì)齊 → 指令微調(diào) → 強(qiáng)化三階段難點(diǎn)集中在視覺(jué)幻覺(jué)、細(xì)粒度感知和跨模態(tài)推理。把它和前面講的長(zhǎng)上下文視覺(jué) token 占預(yù)算、RAG多模態(tài)檢索增強(qiáng)、Agent帶視覺(jué)的具身/文檔 Agent串起來(lái)你就有了一條完整的多模態(tài)知識(shí)鏈。下一組B 系列我們從 B13 開(kāi)始把 Agent 的記憶做成帶持久化的版本——讓 Agent 跨會(huì)話也不忘事。

相關(guān)新聞

圖論算法:拓?fù)渑判蚺c最短路徑實(shí)戰(zhàn)指南

圖論算法:拓?fù)渑判蚺c最短路徑實(shí)戰(zhàn)指南

1. 圖論算法核心概念與應(yīng)用場(chǎng)景圖論作為計(jì)算機(jī)科學(xué)中最重要的數(shù)學(xué)基礎(chǔ)之一,廣泛應(yīng)用于路徑規(guī)劃、任務(wù)調(diào)度、網(wǎng)絡(luò)分析等領(lǐng)域。在實(shí)際工程中,掌握幾種核心圖算法往往能解決80%以上的相關(guān)問(wèn)題。本文將重點(diǎn)解析拓?fù)渑判虻脑韺?shí)現(xiàn),并給出四大經(jīng)典…

2026/8/1 6:19:52 閱讀更多
PDF 文檔翻譯的工程化挑戰(zhàn):從 PDF 解析、版面還原到 LLM 翻譯的完整技術(shù)鏈路

PDF 文檔翻譯的工程化挑戰(zhàn):從 PDF 解析、版面還原到 LLM 翻譯的完整技術(shù)鏈路

引子:為什么 PDF 翻譯比想象難十倍 去年我接手一個(gè)文檔翻譯平臺(tái)的重構(gòu)項(xiàng)目,原以為"上傳 PDF → 調(diào)用 GPT → 輸出 PDF"就完事了。真正動(dòng)手才發(fā)現(xiàn),PDF 翻譯是一個(gè)橫跨文檔解析、OCR、神經(jīng)翻譯、版面重建四大領(lǐng)域的系統(tǒng)工程。單個(gè) P…

2026/8/1 6:19:52 閱讀更多
STM32 SPI驅(qū)動(dòng)OLED屏幕:從時(shí)序解析到驅(qū)動(dòng)庫(kù)實(shí)現(xiàn)全攻略

STM32 SPI驅(qū)動(dòng)OLED屏幕:從時(shí)序解析到驅(qū)動(dòng)庫(kù)實(shí)現(xiàn)全攻略

1. 項(xiàng)目概述:為什么選擇SPI驅(qū)動(dòng)OLED?在嵌入式開(kāi)發(fā)里,顯示是人機(jī)交互最直接的窗口。早年用數(shù)碼管、LCD1602,現(xiàn)在更流行OLED,尤其是0.96寸、1.3寸這種小尺寸屏,功耗低、對(duì)比度高、可視角度廣,做個(gè)…

2026/8/1 6:19:52 閱讀更多
AI名片設(shè)計(jì)不是拼圖!掌握這4類(lèi)結(jié)構(gòu)化Prompt模板,效率提升5倍(限免素材包倒計(jì)時(shí)48h)

AI名片設(shè)計(jì)不是拼圖!掌握這4類(lèi)結(jié)構(gòu)化Prompt模板,效率提升5倍(限免素材包倒計(jì)時(shí)48h)

更多請(qǐng)點(diǎn)擊: https://codechina.net 第一章:AI名片設(shè)計(jì)不是拼圖!掌握這4類(lèi)結(jié)構(gòu)化Prompt模板,效率提升5倍(限免素材包倒計(jì)時(shí)48h) AI名片設(shè)計(jì)絕非元素堆砌或關(guān)鍵詞亂填——它是一門(mén)需要精準(zhǔn)語(yǔ)義建模的提示工…

2026/8/1 12:00:39 閱讀更多
CODESYS配置匯川R1000伺服驅(qū)動(dòng)器Modbus RTU通訊實(shí)戰(zhàn)指南

CODESYS配置匯川R1000伺服驅(qū)動(dòng)器Modbus RTU通訊實(shí)戰(zhàn)指南

1. 項(xiàng)目背景與核心需求最近在做一個(gè)工業(yè)控制項(xiàng)目,需要把一臺(tái)匯川的R1000系列伺服驅(qū)動(dòng)器接入到現(xiàn)有的PLC控制系統(tǒng)中。這套系統(tǒng)里,主控PLC用的是基于CODESYS平臺(tái)的控制器,而現(xiàn)場(chǎng)總線上跑的正是Modbus RTU協(xié)議。R1000本身支持Modbus RTU從站功能…

2026/8/1 12:00:39 閱讀更多
網(wǎng)絡(luò)運(yùn)維基礎(chǔ):ping與telnet的原理與應(yīng)用

網(wǎng)絡(luò)運(yùn)維基礎(chǔ):ping與telnet的原理與應(yīng)用

1. 網(wǎng)絡(luò)連通性測(cè)試的兩種基本武器 在網(wǎng)絡(luò)運(yùn)維的日常工作中,ping和telnet就像醫(yī)生手中的聽(tīng)診器和血壓計(jì),是診斷網(wǎng)絡(luò)健康狀況的基礎(chǔ)工具。我剛?cè)胄袝r(shí)經(jīng)?;煜齼烧叩氖褂脠?chǎng)景,直到有次在機(jī)房徹夜排查故障才真正理解它們的差異。ping工作在ICMP協(xié)…

2026/8/1 12:00:39 閱讀更多
中國(guó)信通院云計(jì)算開(kāi)源產(chǎn)業(yè)聯(lián)盟智能體技術(shù)開(kāi)源應(yīng)用社區(qū)成立,懸鏡安全入選成員單位

中國(guó)信通院云計(jì)算開(kāi)源產(chǎn)業(yè)聯(lián)盟智能體技術(shù)開(kāi)源應(yīng)用社區(qū)成立,懸鏡安全入選成員單位

近日,中國(guó)信通院云計(jì)算開(kāi)源產(chǎn)業(yè)聯(lián)盟牽頭建設(shè)智能體技術(shù)開(kāi)源應(yīng)用社區(qū)。該社區(qū)定位為面向智能體領(lǐng)域的開(kāi)源創(chuàng)新平臺(tái)與產(chǎn)業(yè)協(xié)作樞紐,聚焦智能體技術(shù)研發(fā)、應(yīng)用落地與生態(tài)協(xié)同中的共性問(wèn)題,圍繞開(kāi)源基座共建、標(biāo)準(zhǔn)規(guī)范共研、生態(tài)研究洞察、項(xiàng)目孵…

2026/8/1 12:00:39 閱讀更多
DSP串口printf重定向:從標(biāo)準(zhǔn)庫(kù)配置到SCI驅(qū)動(dòng)實(shí)現(xiàn)

DSP串口printf重定向:從標(biāo)準(zhǔn)庫(kù)配置到SCI驅(qū)動(dòng)實(shí)現(xiàn)

1. 從“Hello World”到串口調(diào)試:為什么在DSP上printf()不是理所當(dāng)然的在桌面編程的世界里,printf()幾乎是每個(gè)程序員學(xué)習(xí)C語(yǔ)言時(shí)接觸的第一個(gè)函數(shù)。在Visual Studio或GCC環(huán)境下,你寫(xiě)下一行printf("Hello, World\n");,編…

2026/8/1 11:50:38 閱讀更多
AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O分配PCB板是應(yīng)用材料(Applied Materials)公司生產(chǎn)的一款用于半導(dǎo)體設(shè)備的I/O信號(hào)分配電路板。該型號(hào)(0100-02186)的核心特點(diǎn)如下:專(zhuān)用于Endura等半導(dǎo)體工藝腔室。集成信號(hào)路由與分配功能。連接控制…

2026/8/1 0:09:33 閱讀更多
Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)是日本日清(Nissei)品牌的一款工業(yè)用三相異步電機(jī),適用于自動(dòng)化設(shè)備及通用機(jī)械驅(qū)動(dòng)。該型號(hào)(FFMN-32L-10-T0 40AX)的核心特點(diǎn)如下:三相交流異步電動(dòng)機(jī)。額定…

2026/8/1 0:09:33 閱讀更多
AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O分配PCB板是應(yīng)用材料(Applied Materials)公司生產(chǎn)的一款用于半導(dǎo)體設(shè)備的I/O信號(hào)分配電路板。該型號(hào)(0100-02186)的核心特點(diǎn)如下:專(zhuān)用于Endura等半導(dǎo)體工藝腔室。集成信號(hào)路由與分配功能。連接控制…

2026/8/1 0:09:33 閱讀更多
Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動(dòng)機(jī)是日本日清(Nissei)品牌的一款工業(yè)用三相異步電機(jī),適用于自動(dòng)化設(shè)備及通用機(jī)械驅(qū)動(dòng)。該型號(hào)(FFMN-32L-10-T0 40AX)的核心特點(diǎn)如下:三相交流異步電動(dòng)機(jī)。額定…

2026/8/1 0:09:33 閱讀更多