Hệ thống phân loại paper (76 paper, 6 mục)
Phương pháp luận & key insight, gom theo hướng tiếp cận. Bấm vào tiêu đề để mở paper gốc.
1.1. Query-Aware Keyframe Selection (Training-Free)
20 paperChọn khung hình/token dựa trực tiếp vào câu hỏi — phải tính lại cho mỗi câu hỏi, không cache được giữa các câu hỏi của cùng một video.
BOLT: Boost Large Vision-Language Model Without Training
Phương pháp
Khắc phục lỗi chọn khung hình tham lam (greedy) bằng Inverse Transform Sampling (ITS). Tính cosine similarity giữa query và visual tokens, xây dựng CDF theo trục thời gian, lấy mẫu đều trên dải giá trị CDF để ánh xạ ngược lại các frame.
Key InsightTránh dồn cục các frame liên tiếp trong cùng một giây (do similarity cao), tự động cân bằng giữa độ liên quan tối đa và độ phủ rộng khắp video.
Ghi chú của tôi
AKS: Adaptive Keyframe Sampling
Phương pháp
Định nghĩa việc chọn khung hình là bài toán tối ưu đa mục tiêu: Relevance và Coverage. Thuật toán đệ quy "Judge-and-Split": chia video thành bin, chấm điểm bin nào chứa nhiều thông tin then chốt rồi tiếp tục chia nhỏ tới khi đạt số frame mục tiêu.
Key InsightCơ chế phân giải đệ quy giúp tìm trúng vị trí vi mô chứa câu trả lời mà không mất tính đại diện của cấu trúc vĩ mô.
Ghi chú của tôi
FOCUS: Efficient Keyframe Selection via MAB
Phương pháp
Mô hình hóa video thành các "arms" trong Multi-Armed Bandit. Dùng bán kính tin cậy Bernstein (UCB) cân bằng Exploitation (vùng giống query) và Exploration (vùng chưa chắc chắn). Hai giai đoạn: chọn clip tiềm năng rồi mới chọn frame cụ thể.
Key InsightXử lý dưới 2% tổng số khung hình nhưng đạt độ chính xác cao; reward tính trên sampling frame giúp giảm chi phí tính toán.
Ghi chú của tôi
Logic-in-Frames: Dynamic Keyframe Search
Phương pháp
Phân rã câu hỏi thành 4 quan hệ logic: Spatial, Temporal, Attribute, Causal. Dùng YOLO-World phát hiện thực thể, áp dụng rule kiểm tra logic tính confidence. Distill điểm số từ frame cao sang frame lân cận để giữ ngữ cảnh thời gian.
Key InsightKhung hình chính xác không chỉ khớp từ khóa ngữ nghĩa mà phải thỏa mãn cấu trúc quan hệ nhân quả/thời gian của sự kiện. Lấy mẫu trung bình 1.4% frame.
Ghi chú của tôi
Video-EM: Event-Centric Episodic Memory
Phương pháp
Phân rã câu hỏi tìm frame liên quan, dùng TransNetV2 mở rộng ranh giới sự kiện. Cấu trúc hóa trí nhớ bằng Qwen2.5-VL sinh Dynamic Scene Narratives kết hợp phát hiện quan hệ vật thể. Dùng CoT lặp đánh giá trí nhớ đã đủ trả lời chưa.
Key InsightChuyển khung hình rời rạc thành biểu diễn trí nhớ sự kiện có cấu trúc, tái hiện không-thời gian với chi phí frame thấp nhất.
Ghi chú của tôi
MarkIt: Training-Free Visual Markers
Phương pháp
Phân tích đối tượng chính trong query, dùng open-world segmentation tô màu trực tiếp lên đối tượng đó xuyên suốt video. Ghi số thứ tự khung hình vào góc video làm thước đo thời gian cho MLLM.
Key InsightBiến bài toán định vị thời gian trừu tượng thành nhận diện dấu vết trực quan hiển thị ngay trên pixel ảnh.
Ghi chú của tôi
Where to Focus: Query-Modulated Multimodal Selection
Phương pháp
Cơ chế Q-Gate phối hợp 3 luồng: Visual Grounding (YOLO-World), Global Matching (CLIP), Contextual Alignment (phụ đề/lời thoại). LLM quyết định trọng số động cho từng luồng theo câu hỏi.
Key InsightLinh hoạt tắt luồng hình ảnh khi câu hỏi thiên về hội thoại và ngược lại; tránh các luồng tự gây nhiễu lẫn nhau.
Ghi chú của tôi
AdaQ: Adaptive Quasi-Gaussian Sampling
Phương pháp
Chuyển similarity frame-query thành phân phối Quasi-Gaussian, tâm là frame giống nhất. Tự động điều chỉnh nhiệt độ softmax τ theo variance của similarity: variance lớn → τ nhỏ (hẹp); variance nhỏ → τ lớn (phẳng).
Key InsightĐộ sắc nét của phân phối lấy mẫu phải tương thích với tính tập trung/phân tán của thông tin cần trả lời.
Ghi chú của tôi
FORGE: Frame Orthogonality in Relevance Geometry
Phương pháp
Khắc phục lỗi "Scalar collapse". Warp không gian embedding theo relevance, SVD trích xuất chiều hữu hiệu theo spectral entropy. Greedy Orthogonal Selection: chọn frame residual norm lớn nhất rồi trực giao hóa các vector còn lại.
Key InsightFrame liên quan nhưng trùng lặp có hướng vector gần nhau; chỉ frame mang thông tin bổ sung trực giao mới tăng thể tích tối đa.
Ghi chú của tôi
ReMem: Temporal Granularity-Adaptive Framework
Phương pháp
LLM ước lượng temporal granularity và visual entities. Xây memory graph với cạnh Semantic và Temporal. Graph Diffusion (Personalized PageRank) lan truyền từ memory node gần query, rồi phân cụm sự kiện để cấp budget.
Key InsightMột frame hữu ích có thể vì nó liên kết cấu trúc sự kiện với frame liên quan, chứ không nhất thiết bản thân có similarity cao với query.
Ghi chú của tôi
EchoPrune: Temporal Echoes for VideoLLMs
Phương pháp
Đo token redundancy dạng "Temporal Echoes": khả năng tái tạo token hiện tại từ vùng lân cận của frame trước. Kết hợp relevance-với-query và echo matching thành điểm MMR.
Key InsightLấy nhiều frame hơn nhưng giảm token/frame; token giữ lại phải mang novelty thay vì chỉ phản chiếu frame quá khứ.
Ghi chú của tôi
DyToK: LLM-Guided Keyframe Prior
Phương pháp
Dùng assistant model nhỏ cùng họ kiến trúc tính attention giữa question token cuối và visual tokens ở deep layer. Lấy attention trung bình gán trọng số ngân sách token cho từng frame.
Key InsightKeyframe prior không phụ thuộc mạnh vào model scale; attention map từ model nhỏ tương quan cao với model lớn.
Ghi chú của tôi
AdaRD-Key: Adaptive Relevance-Diversity Sampling
Phương pháp
Tối ưu Relevance-Diversity bằng log-determinant ma trận Gram. Sherman-Morrison update để runtime gần tuyến tính. VB-Scale: relevance "nhọn" → ưu tiên relevance; relevance "phẳng" → ưu tiên diversity.
Key InsightTránh bẫy nhiễu: khi không frame nào thực sự nổi bật, ép chọn theo relevance sẽ chọn nhầm nhiễu — phủ rộng diversity an toàn hơn.
Ghi chú của tôi
Phương pháp
Watershed tìm local maxima trên đường cong similarity frame-query làm anchor keyframe. Mở rộng anchor thành clip theo hàm tối ưu 3 thành phần: Relevance, Redundancy, Temporal Reward (thưởng clip dài để giữ chuyển động).
Key InsightCân bằng 3 chiều: độ phân giải cao → clip ngắn; độ phân giải thấp → clip dài liên tục. Watershed dùng frame-TEXT similarity — query-aware thật sự, khác với bước "F2C clip expansion" đã mượn vào pipeline KTV (chỉ lấy phần mở rộng theo thời gian, bỏ phần so khớp text).
Ghi chú của tôi
VIDEOTREE: Adaptive Tree-based Representation
Phương pháp
Gom cụm visual embedding thành cluster đại diện, caption từng cluster. LLM chấm điểm liên quan (1-3) giữa query và caption. Mở rộng Breadth ở tầng đầu, Depth chia nhỏ chỉ với cluster liên quan cao.
Key InsightKhám phá cây phân cấp tập trung tính toán sâu đúng phân đoạn chứa bằng chứng, không cần mở rộng toàn bộ video.
Ghi chú của tôi
CDPruner: Conditional Diversity for Token Pruning
Phương pháp
Không dùng raw attention trong LLM. Xây ma trận conditional similarity từ tích độ liên quan instruction và cosine similarity giữa token. Determinantal Point Processes (DPP) chọn tập con token tối đa hóa thể tích.
Key InsightTương thích hoàn hảo với FlashAttention (attention matrix bị ẩn) vì chỉ thao tác trên token embedding và instruction alignment.
Ghi chú của tôi
QCA: Query- and Content-Aware Keyframe Selection
Phương pháp
Chia video thành S segment. Đánh giá segment bằng Semantic Matching (BLIP-2) và Content Deviation (khoảng cách/hiệp phương sai feature segment so với toàn video). Phân bổ ngân sách frame, chọn anchor, lọc candidate theo khoảng cách Euclidean đa dạng.
Key InsightƯu tiên segment vừa khớp query vừa biến đổi phong phú nội tại, tránh đoạn tĩnh kéo dài. Cùng tác giả với KTV — thực nghiệm ablation của chính họ cho thấy bỏ hạng tử content-deviation (agnostic) tăng điểm (70.1→70.4), gợi ý phân bổ theo nội dung tự thân đáng tin hơn phần dựa vào query.
Ghi chú của tôi
Adaptive Greedy Frame Selection
Phương pháp
Kết hợp SigLIP (Query Relevance) và DINOv2 (Semantic Coverage). Hàm mục tiêu Facility Location Coverage + Greedy Selection. Bộ phân loại câu hỏi (7 category) tự điều chỉnh preset tham số.
Key InsightTách biệt rõ: mô hình căn chỉnh văn bản tìm manh mối truy vấn, mô hình tự giám sát hình ảnh bảo toàn cấu trúc phân cảnh.
Ghi chú của tôi
Phương pháp
Giai đoạn 1: so token với vector pooling đại diện toàn video tính điểm độc đáo frame → điều chỉnh retention ratio. Giai đoạn 2: điểm độc đáo nội bộ frame kết hợp điểm độc đáo toàn video chọn visual token quan trọng nhất.
Key InsightCân bằng 2 cấp: giữ nhiều token ở cảnh chuyển tiếp/hành động mới, vẫn bắt chi tiết cục bộ dị biệt trong từng frame.
Ghi chú của tôi
WFS-SB: Wavelet-based Semantic Boundary
Phương pháp
Biến đổi Wavelet đa độ phân giải loại nhiễu tần số cao trên tín hiệu similarity. Điểm cực trị ở thang thô nhất làm ranh giới ngữ nghĩa. Ngân sách thích nghi theo độ dài, relevance, variance của phân đoạn.
Key InsightQuan trọng nhất là bắt trúng thời điểm thông tin thay đổi, không chỉ tìm frame giống query.
Ghi chú của tôi
1.2. Query-Agnostic Selection & Redundancy Reduction (Training-Free)
9 paperChọn/nén một lần cho cả video, không đọc câu hỏi — cache được, dùng lại cho mọi câu hỏi của cùng video. Đây là nhánh pipeline hiện tại đang theo.
Video Panels for Long Video Understanding
Phương pháp
Ghép nhiều khung hình thành các "bảng" (panels) trên một ảnh duy nhất (lưới 10x10) trước khi đưa vào VLM.
Key InsightĐánh đổi độ phân giải không gian lấy độ phân giải thời gian cực cao mà không tăng độ dài ngữ cảnh token của LLM.
Ghi chú của tôi
Phương pháp
-Giai đoạn 1: gom cụm DINOv2, chọn frame gần centroid (query-agnostic).
-Giai đoạn 2: attention [CLS]-patch (saliency) trừ redundancy (cosine trung bình nội khung) cho điểm token — nhưng ngân sách k token/frame lại xếp theo CLIP-SIM(frame, câu hỏi): frame liên quan hơn được nhiều token hơn.
-Giai đoạn 2: attention [CLS]-patch (saliency) trừ redundancy (cosine trung bình nội khung) cho điểm token — nhưng ngân sách k token/frame lại xếp theo CLIP-SIM(frame, câu hỏi): frame liên quan hơn được nhiều token hơn.
Key InsightTránh thiên lệch sai lầm của query-aware thuần (hỏi 'ai mở cửa' thì CLIP dễ chăm chăm nhìn cái cửa thay vì chủ thể). LƯU Ý: đã verify trực tiếp từ paper — phần phân bổ ngân sách/frame thực ra query-aware (Eq.9, CLIP-SIM với câu hỏi), không hoàn toàn agnostic như tên nhóm gợi ý. Baseline gốc của pipeline hiện tại trước khi chuyển sang FastVID.
Ghi chú của tôi
EFS: Event-Anchored Frame Selection
Phương pháp
DINOv2 tính độ tương đồng giữa frame kề nhau. Tìm local minima làm ranh giới sự kiện, hợp nhất theo budget. Chọn anchor frame relevance cao nhất rồi mở rộng bằng MMR thích nghi nhịp độ video.
Key InsightCực nhẹ (chọn frame <1% thời gian tiền xử lý); xác định ranh giới sự kiện trước khi phân bổ token.
Ghi chú của tôi
WFS-SB: Wavelet-based Semantic Boundary
Phương pháp
Biến đổi Wavelet đa độ phân giải loại nhiễu tần số cao trên tín hiệu similarity. Điểm cực trị ở thang thô nhất làm ranh giới ngữ nghĩa. Ngân sách thích nghi theo độ dài, relevance, variance của phân đoạn.
Key InsightQuan trọng nhất là bắt trúng thời điểm thông tin thay đổi, không chỉ tìm frame giống query.
Ghi chú của tôi
MMG-Vid: Maximizing Marginal Gains
Phương pháp
Phân đoạn video theo cosine similarity. Phân bổ ngân sách theo Marginal Value (Đại diện + Đa dạng mới). Cắt tỉa token bằng cụm TG-DPC: so token nội khung và liên khung.
Key InsightVật thể di chuyển mang lợi ích cận biên cao nên giữ lại; nền tĩnh liên tục bị cắt vì đã có mặt ở khung trước — cùng hướng phân bổ ngân sách không đều theo đoạn, nên đối chiếu kỹ với cách tính v_s hiện tại.
Ghi chú của tôiÝ tưởng hay nhưng không có benchmark của qwen, kết quả thấp
FLASHVID: Tree-Based Spatiotemporal Token Merging
Phương pháp
ADTS: chọn token đại diện qua Max-Min Diversity kết hợp [CLS] attention và Event relevance (Global Average Pooling). TSTM: cây dư thừa không-thời gian, gộp token giống nhau ở khung trước.
Key InsightDư thừa trong video không cố định tọa độ do vật thể di chuyển; cấu trúc cây cho phép theo vết và gộp động chính xác.
Ghi chú của tôiNote: Kết quả rất tệ, không nên dùng
KiToke: Kernel-based Interval-aware Compression
Phương pháp
Diversity score = nghịch đảo mật độ Gaussian kernel → lấy mẫu theo xác suất đa dạng. Phát hiện interval ranh giới bằng sai khác vị trí đối tượng và độ lệch cục bộ. Gộp token bị loại vào token giữ trong cùng interval bằng weighted average.
Key InsightTuyệt đối không merge token vượt ranh giới interval để tránh trộn ngữ nghĩa scene khác nhau. Chính paper này phê bình FastVID không phân biệt đoạn nhiều/ít thông tin (§C.1.3) — luận cứ gốc cho hướng phân bổ ngân sách không đều đang theo đuổi.
Ghi chú của tôi
FLoC: Facility Location-Based Compression
Phương pháp
Mô hình hóa chọn visual token thành hàm mục tiêu Facility Location: đo mức token chọn ra bao phủ toàn bộ tập ban đầu. Lazy Greedy + priority queue theo upper bound của gain để tăng tốc.
Key InsightKhắc phục nhược điểm K-means (thiên lệch chọn trung tâm vùng đông đúc/nền tĩnh) — Facility Location bao phủ cả chi tiết và vật thể hiếm.
Ghi chú của tôi
MaxInfo: Maximum Volume Frame Selection
Phương pháp
Biểu diễn frame bằng [CLS] embedding. Truncated SVD giảm chiều, Rectangular MaxVol chọn nhóm frame thể tích hình học lớn nhất trong không gian đặc trưng.
Key InsightTối đa thể tích hình học ưu tiên đa dạng/bao phủ; SigLIP-base vượt trội CLIP và DINOv2 cho frame selection. Đã test trong Phase 0 của dự án — không thấy lợi ích rõ so với uniform trên backbone cũ.
Ghi chú của tôi
1.3. Training-Based Selection (RL, Evolutionary, Policy Agents)
5 paperHọc một policy/compressor nhỏ để chọn frame/token, tối ưu trực tiếp theo hàm mục tiêu hạ nguồn (accuracy) thay vì heuristic thủ công.
Phương pháp
Ghép đặc trưng token với temporal residual (surprise signal, [X;ΔX]). Huấn luyện Bernoulli gating policy bằng Group RL: sinh K mask/video, reward gồm CE loss (chất lượng) + Sparsity reward (Split-Advantage). Curriculum learning từ pseudo-video sang video thật.
Key InsightNén token dựa trên hàm mục tiêu hạ nguồn; loại context thừa giúp accuracy cao hơn cả giữ full token (65.3% > Vanilla 63.8%). SOTA hiện tại — lý do chính không theo hướng V-JEPA/reconstruction reward: reward đúng-sai câu trả lời (CE loss) hiệu quả hơn reward tái tạo hình ảnh.
Ghi chú của tôi
Phương pháp
Temporal agent nhỏ (3.5M params) dùng local window attention + Gumbel-Softmax chọn frame. GRPO trên Video-MLLM đóng băng, 2 reward: Answering Accuracy và Temporal Localization (Needle-in-a-Haystack).
Key InsightSampler nhỏ học định vị vùng bằng chứng chính xác mà không cần cập nhật trọng số Video-LLM lớn — cùng hướng kiến trúc RL+policy-head nhỏ mà đề xuất của leader (V-JEPA reward) từng nhắm tới, chỉ khác loại reward.
Ghi chú của tôi
Phương pháp
Chia video thành Positive/Negative Segments. Projector module độ mịn khác nhau (coarse, base, fine). Counterfactual Validation (đảo ngược độ mịn kiểm tra lỗi), tối ưu bằng DPO.
Key InsightĐánh giá phản thực ngăn mô hình đoán trúng đáp án nhưng nhìn sai vị trí sự kiện.
Ghi chú của tôiKết quả cực cao, nhưng cần confirm lại về tốc độ
Phương pháp
Compressor 1-layer Transformer trước LLM. Thuật toán tiến hóa (crossover, mutation) tìm binary mask tối ưu theo task loss sau gom nhóm theo vocabulary embedding. GHM classification loss + cosine regularization.
Key InsightNhãn nén tạo theo hướng task-specific: token giữ không phải vì nổi bật mà vì trực tiếp giảm loss trả lời.
Ghi chú của tôi
Aggregating Visual Information with Optimal Transport for VideoLM Token Compression
Phương pháp
AVIOT: Optimal Transport tổng hợp nhiều frame thành số lượng nhỏ "target support" học được thay vì loại bỏ cơ học. Token-Budget Distillation: chuyển giao ngữ nghĩa từ full-token sang mô hình nén qua chưng cất tri thức theo ngân sách định sẵn.
Key InsightBiểu diễn nén học qua tối ưu vận chuyển + chưng cất giữ 10-25% frame nhưng vẫn vượt baseline không nén.
Ghi chú của tôiPaper OK, nên đánh giá lại
1.4. In-Model & Layer-wise Token Pruning / Merging
19 paperNén token trực tiếp bên trong Vision Encoder hoặc bên trong các layer của LLM lúc suy luận — không cần biết trước toàn bộ video.
SToP: Sink-Token-Aware Pruning
Phương pháp
Nhận diện Sink Tokens (attention cao liên tục qua thời gian nhưng vô nghĩa). Tính Sink Score, trừ điểm khi cắt tỉa không gian (STSP), cộng điểm loại bỏ khi cắt tỉa thời gian (STTP).
Key InsightCắt tỉa theo raw attention dễ giữ nhầm sink tokens và vứt chi tiết hành động có attention biến thiên thật.
Ghi chú của tôiPerformance khá tệ, chưa rõ thế nào
AdaptToken: Entropy-based Adaptive Selection
Phương pháp
Chia video thành nhóm frame, chạy thử giải mã LLM đo Entropy. Entropy thấp → tự tin → giữ nhiều token chi tiết; Entropy cao → cắt mạnh. Bản Lite dừng sớm nếu ≥3 nhóm entropy <0.75.
Key InsightXử lý tới 10.000 frame; bản Lite giảm 50% thời gian suy luận không giảm accuracy.
Ghi chú của tôiQuery-Aware
Streaming STC: Cacher & Pruner
Phương pháp
STC-Cacher: lưu activation reference frame, chỉ tính lại dynamic tokens key-similarity thấp. STC-Pruner: Temporal Context Anchor (độ mới) + Spatial Context Anchor (độ nổi bật) giữ top-K.
Key InsightTái sử dụng KV cache tầng ViT, chỉ đưa vào LLM token mang thông tin mới — tối ưu cho streaming.
Ghi chú của tôi
FastVID: Dynamic Density Pruning
Phương pháp
DySeg phân đoạn theo cosine similarity (S1 sàn tối thiểu c đoạn + S2 mọi điểm dưới ngưỡng τ). STPrune 2 luồng: DTM (density-peaks ρ×δ, anchor mỗi p_anchor frame, gán token XUYÊN CẢ ĐOẠN) giữ ngữ cảnh chung; ATS ([CLS] attention) giữ chi tiết nổi bật. Ngân sách chia ĐỀU theo độ dài đoạn.
Key InsightDTM trả lời 'nội dung tổng thể là gì', ATS trả lời 'chi tiết nào nổi bật'. NỀN TẢNG của pipeline hiện tại. Đã xác nhận qua code: bản cài đặt hiện tại của DTM chỉ gán token trong-unit, KHÔNG xuyên đoạn như thiết kế gốc — lệch thiết kế đã xác nhận, chưa fix xong.
Ghi chú của tôiĐây là baseline đang xây trên nền — xem README_DySeg_STPrune.md và Sec 9 tài liệu chính để biết chi tiết chẩn đoán lệch DTM/salience.
HoliTom: Holistic Token Merging
Phương pháp
1. Temporal Merging: quy hoạch động tìm đoạn lặp, merge vào lần xuất hiện đầu. 2. Spatial Merging: attention cho token không lặp, DPC-KNN cho token lặp. 3. Inner-LLM Merging: tiếp tục gộp tại layer K của LLM theo attention token cuối.
Key InsightNén toàn diện trước và bên trong LLM, giữ thứ tự không gian gốc hạn chế mất positional structure.
Ghi chú của tôimaintaining 99.1% average performance while reducing FLOPs to 6.9%.
PruneVid: Question-Guided In-LLM Pruning
Phương pháp
Gộp token tĩnh theo thời gian/không gian. Đưa visual tokens + câu hỏi qua layer đầu LLM; tại layer 10, tính attention lớn nhất từ question tokens tới visual tokens giữ top-α. Cắt KV-cache tương ứng.
Key InsightCắt KV cache sớm trong prefill giúp decoding nhẹ tải. LƯU Ý: phương pháp query-aware DUY NHẤT trong nhóm so sánh FastVID — và cũng là phương pháp kém nhất (Table VideoMME Qwen2.5-VL: 59.3% @25%, thấp nhất nhóm).
Ghi chú của tôicó thể đọc
LLaVA-PruMerge: Adaptive Token Reduction
Phương pháp
[CLS] attention xác định vùng nổi bật. Ngưỡng IQR thích nghi: Q3 + 1.5*IQR chọn important tokens. Token Supplement: gộp token bị loại vào token quan trọng bằng KNN theo key similarity.
Key InsightNgưỡng IQR tự điều chỉnh theo từng phân phối ảnh; gộp lân cận tránh vứt hoàn toàn đặc trưng hậu cảnh. Cơ chế cls_new_token_sim của KTV kế thừa trực tiếp từ đây.
Ghi chú của tôipaper cũ, kết quả thấp
DyCoke: Dynamic Token Compression
Phương pháp
Stage I: TTM trượt 4 frame gộp token lặp. Stage II: Dynamic KV Cache Pruning, duy trì Active KV Cache + Dynamic Pruning Cache (DP Cache); nạp lại token từ DP Cache nếu attention phân bổ lại ở bước sau.
Key InsightToken không quan trọng ở bước này có thể sống còn ở bước sau; cơ chế phục hồi giải quyết lỗi one-shot pruning.
Ghi chú của tôicó vẻ ổn, chưa bench trên qwen2.5-vl-7b
AdaTP: Attention-Debiased Token Pruning
Phương pháp
Khắc phục bias vị trí của LLM attention. Chia segment. Global Debiasing chọn token attention cao theo segment; Local Debiasing giữ 1 token/tọa độ không gian trong 1 segment tránh trùng lặp. Progressive Pruning tăng dần qua layer.
Key InsightGiảm dần token qua các tầng ổn định hơn cắt đột ngột một lần; loại bỏ bias dồn attention đầu/cuối chuỗi.
Ghi chú của tôicũng không có bench
StateKV: Linear Scaling Video VLMs
Phương pháp
2 trạng thái KV mỗi layer: Detailed State (toàn bộ token frame hiện tại) và Compressed State (B token quan trọng nhất từ frame quá khứ, cố định). Frame hiện tại chỉ attend vào frame đó + Compressed State.
Key InsightAttention liên khung tập trung chủ yếu vào temporal sinks thay đổi chậm; giới hạn tương tác đưa prefill về tuyến tính O(N).
Ghi chú của tôiĐáng để đọc, kết quả ổn
FrameFusion: Merging & Pruning
Phương pháp
Quan sát: thứ hạng similarity ổn định ở layer đầu, importance score biến động mạnh. 2 giai đoạn: Similarity Merging ở layer nông (gộp token tương đồng), Importance Pruning ở layer sâu (cắt theo attention).
Key InsightTuyệt đối không prune ở layer đầu vì attention chưa hội tụ; merge trước rồi prune sâu mang lại ổn định tối đa.
Ghi chú của tôi
VisionZip: Dominant & Contextual Merging
Phương pháp
Bước 1: chọn dominant tokens theo attention nhận từ [CLS] (hoặc mean attention với SigLIP). Bước 2: contextual tokens còn lại tính similarity theo Key representation của Self-Attention, gộp vào dominant token gần nhất.
Key InsightTách biệt rõ thông tin chủ đạo và ngữ cảnh xung quanh; training-free hoàn toàn hoặc fine-tune projector nhẹ 30 phút.
Ghi chú của tôi
Beyond Text-Visual Attention
Phương pháp
Chỉ ra lỗi Attention Shift và Dispersion khi dùng text-visual attention. Chọn important tokens hoàn toàn bằng visual attention của encoder. Giữ diverse tokens bằng cosine similarity, loại dần token trùng lặp, không pooling.
Key InsightTrong thiết lập training-free, giữ token đa dạng nguyên bản an toàn hơn làm mờ bằng average-pooling.
Ghi chú của tôi
FastV: Plug-and-Play Acceleration
Phương pháp
Sau layer 2, attention dồn mạnh vào text/system tokens (Anchor Tokens), giảm sâu ở visual tokens. Xử lý bình thường 2 layer đầu, sau đó prune vĩnh viễn R% visual tokens attention thấp nhất từ layer K.
Key InsightVisual tokens đã truyền thông tin vào anchor token ở tầng đầu; pruning sau layer 2 là điểm cân bằng tốc độ/accuracy.
Ghi chú của tôiKhông ngon
ToMe: Token Merging in ViT
Phương pháp
Module gộp giữa nhánh Self-Attention và FFN. Bipartite Soft Matching: chia token thành 2 tập A/B, tìm cặp Key-similarity cao nhất merge bằng weighted average. Proportional Attention (± log s).
Key InsightBipartite matching gần tuyến tính; token đại diện nhiều patch cần khuếch đại ảnh hưởng attention tương ứng quy mô.
Ghi chú của tôi
OOD-VTP: Robustness via Token Compression
Phương pháp
Xác định visual token lệch phân phối (OOD) so với textual feature space ở layer trung gian. Đo bằng negative mean attention tới text token cuối. Loại token khoảng cách lớn nhất tại robust-pruning layers (13-18).
Key InsightNgược thông thường: loại token xa ngôn ngữ nhất giúp tăng chống jailbreak, giảm ảo giác.
Ghi chú của tôiPaper rất tệ
EvoCut: Multi-Layer Evolution-Aware Compression
Phương pháp
Đo delta chuyển đổi trạng thái token qua từng layer. K-means tìm hướng tiến hóa chung của nền. Token chệch hướng khỏi cụm chung được gán điểm deviation cao, tích lũy EMA từ layer 12, chọn top-K.
Key InsightVùng chữ/vật thể nổi bật luôn có hướng biến đổi lệch khỏi xu hướng nền; tích lũy qua nhiều tầng loại nhiễu cục bộ.
Ghi chú của tôi
InfoMerge: Information-aware Token Compression
Phương pháp
DySeg phân đoạn. Temporal Fingerprint Difference (TFD) phát hiện vị trí tĩnh liên tục. Phân bổ budget theo Segment Uniqueness và Spectral Entropy. Nén bằng ATS (ức chế vị trí tĩnh) + DTM với hard mask.
Key InsightEntropy phổ đo độ phong phú biểu diễn; hard mask vị trí tĩnh ngăn lặp lại dư thừa. CẦN KIỂM TRA GẤP — mô tả rất gần ý tưởng hiện tại (DySeg + phân bổ ngân sách không đều theo segment uniqueness/entropy). Chưa xác định paper gốc/link — có thể là prior art trực tiếp.
Ghi chú của tôi⚠️ Ưu tiên tra cứu: đây có phải cùng ý tưởng đang làm không? Nếu đúng cần đối chiếu khác biệt trước khi viết bài.
EarlyTom: Early Token Compression
Phương pháp
Nén ngay trong Vision Encoder giảm TTFT. Stage I: Streaming Frame Segmentation, gộp frame giữa (Middle-frame Merging). Stage II: tách Dynamic (đầu/cuối → Global Top-K) và Static (giữa → Local Window Selection).
Key InsightPhần lớn độ trễ nằm ở ViT encoding; nén sớm từ layer đầu vision encoder tối ưu hiệu năng toàn diện.
Ghi chú của tôiCải thiện tốc độ, không cải thiện kết quả. EarlyTom reduces TTFT by up to 2.65× and FLOPs by up to 61% on
a single NVIDIA A100 GPU for the LLaVA-OneVision-7B
model, while maintaining accuracy comparable to the fulltoken baseline. These improvements substantially enhance
the practicality of deploying Video-LLMs in real-world production scenarios.
a single NVIDIA A100 GPU for the LLaVA-OneVision-7B
model, while maintaining accuracy comparable to the fulltoken baseline. These improvements substantially enhance
the practicality of deploying Video-LLMs in real-world production scenarios.
Phần 2: Fine-tune Mô Hình Base Dựa Trên Dữ Liệu Lớn
15 paperThay đổi kiến trúc, thiết kế projector chuyên biệt, hoặc fine-tune toàn diện trên dữ liệu lớn — khác nhánh training-free đang theo.
Seed1.5-VL Technical Report
Phương pháp
MoE 20B active. Vision Encoder Seed-ViT (532M), 2D RoPE, MIM với EVA02-CLIP-E, Omni-modal Pretraining. Dynamic Frame-Resolution Sampling: tự điều chỉnh FPS (1-5) và resolution (128-640 token/frame) theo budget tối đa 81.920 token. RL Hybrid: RLHF + RLVR + Rejection Sampling.
Key InsightDynamic resolution/FPS linh hoạt: resolution cao cho ít frame, resolution thấp cho nhiều frame, tối ưu tổng ngân sách theo loại video.
Ghi chú của tôi
KIMI-VL Technical Report
Phương pháp
MoE 2.8B activated (16B total). MoonViT xử lý native-resolution tới 3.2M pixel với 2D RoPE. Joint Long-context Activation Stage mở rộng 8K→128K context. Long-CoT SFT + RL với length-based penalty chống overthinking.
Key InsightMở rộng context 128K kết hợp tỷ lệ dữ liệu video dài hợp lý giúp tiếp nhận video thời lượng lớn tự nhiên.
Ghi chú của tôi
Qwen3-VL Technical Report
Phương pháp
SigLIP-2 encoder. Interleaved MRoPE phân bổ đều tần số cao/thấp trên trục không gian-thời gian. DeepStack đưa visual tokens từ 3 tầng vision encoder vào 3 hidden state đầu LLM. Timestamp dạng text (<3.0 seconds>). 4-stage training, SAPO RL.
Key InsightInterleaved MRoPE giải quyết lệch bước thời gian video dài; DeepStack giữ thông tin thị giác đa tầng không mai một qua projector. Backbone thế hệ sau Qwen2.5-VL — chênh lệch dense-baseline quan sát được với KiToke/FastVID paper (~67-68% vs ~63.8% của mình) một phần đến từ đây.
Ghi chú của tôi
FlexMem: Long Video via Visual Memory
Phương pháp
Hệ thống bộ nhớ thị giác mô phỏng con người. Bản sao lưu KV cache dữ liệu thị giác. Dual-pathway Compression ghi nhận đặc trưng quan trọng. Trích xuất linh hoạt mảnh bộ nhớ phù hợp theo câu hỏi.
Key InsightXử lý >1.000 khung hình trên 1 GPU RTX 3090 tiêu dùng, không tràn VRAM.
Ghi chú của tôi
SVLM Compressor for Long Video
Phương pháp
SVLM-based local compressor + LLM global decoder. Causal attention học k_max=128 learnable memory tokens/phân đoạn. Infer: Logit-Based Relevance Score Yes/No cắt tỉa thích nghi (ATA) lấy token đầu.
Key InsightSemantic Front-Loading: compressor cục bộ luôn gói bằng chứng quan trọng nhất vào memory token sinh ra đầu tiên.
Ghi chú của tôi
Video-XL: Hour-Scale Video Understanding
Phương pháp
Chuyển quyền chọn nén cho LLM. Curriculum Learning tăng dần hệ số nén 2-4→8→12→16. Chia interval, gộp interval visual semantic tương đồng cao. Token nén xen kẽ visual tokens để học thu thập thông tin.
Key InsightCurriculum nén tăng dần giúp thích ứng tỷ lệ nén cực hạn không sụt giảm hiệu năng đột ngột.
Ghi chú của tôi
LongVU: Spatiotemporal Adaptive Compression
Phương pháp
SigLIP (image-text) + DINOv2 (vision-only) qua bộ gom không gian SVA. DINOv2 loại frame tương đồng cao. Cross-modal Query Attention chọn frame giữ nguyên resolution, còn lại spatial pooling. Nén spatial token so với frame đầu tiên.
Key InsightDINOv2 vượt CLIP trong phân biệt biến đổi nhỏ giữa frame; kết hợp 2 encoder bù đắp ngữ nghĩa và hình học.
Ghi chú của tôi
Long Context Transfer from Language to Vision
Phương pháp
Giả thuyết: năng lực context dài chuyển giao từ text sang vision nếu căn chỉnh thực sự. Long context (224K) thuần text trước, rồi chỉ train bằng ảnh tĩnh ngắn (UniRes: nén 576→144 token/grid) nhưng đánh giá trực tiếp trên video dài.
Key InsightKhông cần train trên video dài tốn kém; context dài tự tổng quát sang video nếu biểu diễn thị giác ngắn được căn chỉnh chuẩn.
Ghi chú của tôi
Dynamic-VLM & AdaRETAKE
Phương pháp
Dynamic-VLM: đánh số positional encoding theo thời gian (1s:image, 2s:image), thử Pooling/Merging/Pruning. AdaRETAKE: DPSelect tìm keyframe theo khoảng cách cực đại địa phương; PivotKV dùng keyframe làm điểm tựa nén KV-cache frame khác theo attention, tỷ lệ nén động theo tầng.
Key InsightDư thừa xảy ra cả theo thời gian lẫn theo tầng mô hình; các tầng khác nhau cần mức chi tiết token khác nhau.
Ghi chú của tôi
LP-Comp & QC-Comp: Progressive Compression
Phương pháp
LP-Comp: fine-tune tầng LLM giảm dần token/frame qua layer, tận dụng Causal Attention giữ suffix token đã hấp thụ tiền tố. QC-Comp: attention cục bộ theo phân đoạn chọn top-k frame liên quan lúc infer.
Key InsightNén từ từ bên trong layer LLM giúp mô hình tự học tổng hợp thông tin bị loại vào token được giữ.
Ghi chú của tôi
LLaVA-OneVision-2: Codec Visual Representation
Phương pháp
Đọc trực tiếp từ video codec: I-frame (mốc không gian), P-frame, motion vectors, residual bit-cost để tạo visual canvas — không dùng frame RGB thông thường. Train trên 8M video samples.
Key InsightVideo nén đã chứa sẵn tín hiệu dư thừa không-thời gian qua bit-cost; tận dụng codec loại bỏ hoàn toàn tính lại từ pixel.
Ghi chú của tôi
SlowFast-LLaVA-1.5: Token-Efficient Architecture
Phương pháp
Cơ chế SlowFast vào projector, train lại projector + LLM. Slow pathway: giảm frame giữ resolution (pooling nhẹ). Fast pathway: giữ FPS cao giảm mạnh resolution. Ghép 2 luồng bằng special tokens.
Key InsightTách luồng không gian chi tiết và luồng thời gian tốc độ cao giúp hiểu sâu hành động không bùng nổ token.
Ghi chú của tôi
VisCo: LLMs as Intrinsic Encoders
Phương pháp
Learnable memory tokens tương tác visual tokens trong encoder. Hierarchical KV passing: lưu key/value memory token từng layer encoder, nạp trực tiếp vào KV cache decoder đúng tầng tương ứng. Chỉ train memory tokens + LoRA.
Key InsightGiữ thông tin đa tầng (thô ở nông, trừu tượng ở sâu); ghép memory token với token gốc vượt cả mô hình ban đầu.
Ghi chú của tôi
ETC: Extreme Token Compression via Distillation
Phương pháp
Biểu diễn nén Z là sufficient statistic có điều kiện theo instruction. M compressed tokens làm bottleneck (text chỉ attend Z, Z attend visual tokens). Variational Information Distillation (VID) tối đa mutual information khôi phục target.
Key InsightTránh làm mờ đặc trưng khi dùng MSE loss thường; ép biểu diễn nén chỉ giữ thông tin tối cần thiết dự đoán câu trả lời.
Ghi chú của tôi
SEER: Selective Visual-Text Compression
Phương pháp
3 bước: Visual Selection (dự đoán vùng/khung chứa bằng chứng), Text Retrieval (truy hồi text/OCR tương ứng), Reasoning (LLM nhận toàn ảnh giữ global context + text truy hồi chi tiết).
Key InsightDùng hình ảnh định vị nhanh vùng bằng chứng trước, chỉ kích hoạt trích xuất text chi tiết đúng vùng đó.
Ghi chú của tôi
Phần 3: Video Engines, Reasoning Benchmarks & Temporal Grounding
8 paperPipeline dữ liệu video quy mô lớn, benchmark suy luận, cơ chế định vị/agentic — bối cảnh chung của lĩnh vực, không trực tiếp là phương pháp nén.
LLaVA-Video: Synthetic Data Engine
Phương pháp
Bộ dữ liệu LLaVA-Video-178K. PySceneDetect lọc cắt cảnh tĩnh. GPT-4o sinh mô tả phân cấp: Level 1 (10s), Level 2 (30s, tổng hợp 3 clip L1), Level 3 (tóm tắt toàn video). 16 nhóm câu hỏi QA.
Key InsightKhắc phục nghèo nàn mô tả chi tiết/chuyển cảnh của dataset cũ bằng tóm tắt phân tầng lũy tiến.
Ghi chú của tôi
Tarsier2: Comprehensive Video Understanding
Phương pháp
Pre-train 40M video (20M in-house, video bình luận phim đã xóa OCR). SFT 150k video description có định vị thời gian. DPO 20k preference pairs: negative tạo bằng làm hỏng/xóa/xáo trộn clip.
Key InsightDPO với negative từ video xáo trộn giúp mô hình nhạy bén tính tuần tự và nhân quả của khung hình.
Ghi chú của tôi
Live: Video LLM with Streaming Speech
Phương pháp
Live-CC-5M và Live-WhisperX-526K. 10.7M video, XLM-RoBERTa lọc tiếng Anh, Qwen-VL-2B lọc talking-head/caption lệch nội dung. WhisperX sinh lời thoại streaming căn chỉnh visual.
Key InsightLoại triệt để khung talking-head không tương quan hành động; đồng bộ giọng nói trực tiếp cho thuyết minh video thời gian thực.
Ghi chú của tôi
NeMo Curator & Cosmos-Curate
Phương pháp
Hệ lọc dữ liệu video phân tán (Ray/Cosmos-Xenna). TransNetV2 phát hiện scene, lọc aesthetic threshold >3.5, lọc cảnh tĩnh (motion-filter). Embedding (Cosmos-embed/InternVideo2), K-means phân cụm, Semantic Deduplication.
Key InsightLọc trùng lặp ngữ nghĩa + loại cảnh tĩnh là bước tiền xử lý then chốt trước train Video-LLM quy mô lớn.
Ghi chú của tôi
VBVR: Video Reasoning Suite
Phương pháp
Dataset Image-to-Video (I2V) 1M video, 200 loại nhiệm vụ. Đầu vào ảnh+prompt, đầu ra video thể hiện toàn bộ quá trình suy luận. Kiểm tra 5 trụ cột: Không gian, Biến đổi, Kiến thức thế giới, Trừu tượng, Nhận thức.
Key InsightChuyển dịch từ chatbot mô tả video sang huấn luyện World Models (Sora, Kling, Wan) suy nghĩ và tương tác vật lý logic.
Ghi chú của tôi
FocusGraph: Graph Frame Selection
Phương pháp
Video góc nhìn thứ nhất (Egocentric). Qwen2.5-VL tóm tắt clip thành Scene Graph text để LLM chọn clip tiềm năng. PSFR: sparse optical flow theo dõi điểm đặc trưng, kích hoạt chọn keyframe khi patch mất dấu vết.
Key InsightScene graph ổn định hóa quan hệ đối tượng dễ bị rung lắc/chuyển động mạnh của camera hành trình.
Ghi chú của tôi
VidCoM: Fast Video Comprehension with Tools
Phương pháp
Trích xuất Scene Graph (triplets) + BLIP-2 Caption. InsOVER: Hungarian matching so khớp thành phần câu hỏi với visual sub-events. Tinh chỉnh biên sự kiện qua nhiều vòng tương tác LLM reasoning agent.
Key InsightKhông cần single-pass; vòng lặp LLM-công cụ trích xuất cấu trúc thu hẹp chính xác ranh giới sự kiện.
Ghi chú của tôi
VideoGAIA: General AI Assistants Benchmark
Phương pháp
271 tác vụ thực tế phức tạp trên 6 domain. Chu trình Agentic: Video+Nhiệm vụ → Quan sát → Tìm kiếm thông tin ngoài → Quay lại video kiểm tra giả thuyết → Tổng hợp câu trả lời mở.
Key InsightBenchmark hỏi-đáp đóng (VideoMME) đã bão hòa; tương lai nằm ở phối hợp công cụ ngoài + tra cứu đa bước (chưa model nào vượt 60%).
Ghi chú của tôi
Nhật ký thực nghiệm (19 lần chạy)
VideoMME, Qwen2.5-VL-7B-Instruct trừ khi ghi chú khác. Sắp theo overall accuracy giảm dần.
| Cấu hình | Dataset | Trạng thái | Overall | Short | Medium | Long | Ghi chú | Ngày | |
|---|---|---|---|---|---|---|---|---|---|
Uniform (lấy đều) @ 36% (16384/~45K) 3x pool, mode=uniform, tokens_num=16384 | VideoMME | harness đã sửa | 64.41 | 73.00 | 66.00 | 54.22 | Bằng/nhỉnh hơn dense — nén 36% gần như miễn phí | 2026-08-18 | |
Native dense 3x 3x, MAX_PIXELS=16384×3×28×28, ~42-48K token/video | VideoMME | harness đã sửa | 64.26 | 73.67 | 65.00 | 54.11 | Không khác ý nghĩa so 1x (z≈0.7) — budget scaling đã bão hòa | 2026-08-17 | |
DySeg full-budget dtm=0.4 @ 1x 1x pool, tokens_num=b_max=999999, dtm_ratio=0.4 | VideoMME | harness đã sửa | 63.52 | 73.56 | 63.22 | 53.78 | DTM merge ở retention thật ~100% KHÔNG gây hại (+0.19 so Native) | 2026-08-22 | |
Native dense, harness đã sửa (Gate G1) 1x, MAX_PIXELS=16384×28×28, ~14-16K token/video, greedy, prompt/system-prompt đúng lmms-eval | VideoMME | harness đã sửa | 63.33 | 73.33 | 63.22 | 53.44 | Khớp SCORE Vanilla 63.8% (chênh 0.47đ, z≈0.7 không ý nghĩa) — Gate G1 coi như đóng | 2026-08-14 | |
DySeg full-budget (retention≈100%) dtm=0 @ 1x 1x pool, tokens_num=b_max=999999, dtm_ratio=0.0 | VideoMME | harness đã sửa | 63.33 | 73.33 | 63.22 | 53.44 | Khớp Native 1x TUYỆT ĐỐI cả 3 bucket — xác nhận cơ chế Tầng1+2+gather đúng khi ngân sách đủ | 2026-08-22 | |
DySeg T→∞ (Tầng 2 tắt) @ 36% 3x pool, temperature0=1000000, dtm_ratio=0.4 | VideoMME | harness đã sửa | 62.41 | 69.89 | 63.11 | 54.22 | Tắt riêng phân bổ không đều cũng chỉ +0.45đ — không yếu tố đơn lẻ nào giải thích hết khoảng cách | 2026-08-21 | |
DySeg salience_mode=grid @ 36% 3x pool, salience_mode=grid, dtm_ratio=0.4 | VideoMME | harness đã sửa | 62.41 | 70.11 | 62.67 | 54.44 | Trùng khớp T→∞ (62.41%) — cả 4 ablation đơn-yếu-tố dồn vào dải hẹp 61.96-62.41 | 2026-08-21 | |
DySeg dtm_ratio=0 (bỏ DTM) @ 36% 3x pool, dtm_ratio=0.0, tokens_num=16384 | VideoMME | harness đã sửa | 62.15 | 69.22 | 62.11 | 55.11 | Bỏ DTM chỉ cải thiện +0.19đ so với đầy đủ — không giải thích hết khoảng cách với Uniform | 2026-08-20 | |
DySeg+STPrune đầy đủ @ 36% 3x pool, dtm_ratio=0.4, tokens_num=16384 | VideoMME | harness đã sửa | 61.96 | 70.00 | 61.67 | 54.22 | Thua Uniform 2.45đ (z≈-1.87, p≈0.06, sát ngưỡng). Long bucket bằng Uniform | 2026-08-19 | |
DySeg+QTA+STPrune (bản đầu, harness cũ) Qwen2.5-VL-7B, tokens_num=16384, prompt cũ | VideoMME | harness cũ | 60.33 | 68.89 | 59.78 | 52.33 | z≈0.85 so f128_t16384, chưa có ý nghĩa thống kê. Sau này phát hiện Gate G1 chưa đóng nên mốc so sánh không đáng tin | 2026-08-14 | |
Uniform @ ~7.2% (3240/~45K, khớp absolute token FastVID) 3x pool, mode=uniform, tokens_num=3240 | VideoMME | harness đã sửa | 60.30 | 68.11 | 61.44 | 51.33 | 3240 token = mức nén 'có giá', khác 16384 ('miễn phí') | 2026-08-24 | |
Budget scaling f96/t14400 (đỉnh sweep) Qwen2.5-VL-7B, 96 frame, 14400 token, ép resolution đều | VideoMME | harness cũ | 59.41 | 69.44 | 58.67 | 50.11 | Đỉnh của budget scaling trên harness cũ, trước Gate G1 | 2026-08-13 | |
f128_t16384 (mốc so sánh cũ) Qwen2.5-VL-7B, 128 frame ép resolution, tokens_num=16384 | VideoMME | harness cũ | 59.19 | 69.67 | 57.78 | 50.11 | Mốc dùng để so DySeg trước khi phát hiện harness sai (Gate G1) | 2026-08-13 | |
DySeg+STPrune đầy đủ @ ~7.2% 3x pool, dtm_ratio=0.4, tokens_num=3240 | VideoMME | harness đã sửa | 58.70 | 65.44 | 58.56 | 52.11 | Vẫn thua Uniform (-1.60đ) ở mức nén sâu — Long bucket vẫn nhỉnh hơn (+0.78) | 2026-08-24 | |
Qwen2.5-VL Uniform 12 frame (đổi backbone) Qwen2.5-VL-7B-Instruct, 12 frame, 156 tok/frame | VideoMME | harness cũ | 54.11 | 63.78 | 50.78 | 47.78 | +10.96 điểm so với LLaVA cùng config — backbone là đòn bẩy lớn nhất từng đo được | 2026-08-06 | |
Oracle K=12 (rank theo đáp án đúng) LLaVA-1.6-Vicuna-7B, K=12 candidates | VideoMME | harness cũ | 43.59 | 52.78 | 41.78 | 35.78 | Ngay cả oracle cũng gần bằng uniform — backbone-bound, không phải selection-bound | 2026-08-05 | |
Temporal-Chain (best acc.) LLaVA-1.6-Vicuna-7B | VideoMME | harness cũ | 43.48 | — | — | — | 2026-08-04 | ||
KTV reproduction (baseline gốc) LLaVA-1.6-Vicuna-7B, Temporal-Chain K=12, budget 1872 token | VideoMME | harness cũ | 42.48 | — | — | — | Backbone LLaVA cũ, trước khi chuyển Qwen2.5-VL | 2026-08-04 | |
CAS-QTA / RECON-Select (best config) LLaVA-1.6-Vicuna-7B, l_max=2 top_m=4 | VideoMME | harness cũ | 41.67 | — | — | — | Thống kê ngang baseline (z≈0.60, p≈0.55) — không thắng rõ, không thua rõ | 2026-08-12 |
Bảng benchmark theo backbone
Mỗi bảng ứng với 1 backbone. Click ô để sửa trực tiếp; chọn 1 ô rồi dùng thanh công cụ để gộp/xoá/dời hàng-cột như Excel.
| Paper | Config | Params | VideoMME | RETENTION | Training | Note | NUM FRAMES | |||
|---|---|---|---|---|---|---|---|---|---|---|
| Short | Medium | Long | Overall | |||||||
| ▾ Query-Aware | ||||||||||
| BOLT | 7B | 66.8 | 54.2 | 47.3 | 56.1 | — | 8 | |||
| BOLT | 7B | — | 16 | |||||||
| BOLT | 7B | — | 32 | |||||||
| ▾ Query-Agnostic | ||||||||||
| — chưa có hàng nào — | ||||||||||
Idea & flow chi tiết
Mỗi idea là 1 "file" markdown: giải thích flow, ví dụ minh hoạ đầu vào/đầu ra từng stage.