
SenseNova-U1評測基準全解析OneIG、LongText與IGenBench分數復現指南【免費下載鏈接】SenseNova-U1SenseNova-U series: Native Unified Paradigm with NEO-unify from the First Principles項目地址: https://gitcode.com/gh_mirrors/se/SenseNova-U1本文帶你快速看懂SenseNova-U1圖像生成能力的三大核心評測基準OneIG、LongText與IGenBench并給出官方分數表的對照解讀和可落地的復現步驟。SenseNova-U1 是基于 NEO-unify 架構的原生統一多模態模型一個模型同時完成圖像理解與生成官方在 evaluation 目錄下提供了完整的基準復現腳本幫助新手用最少的配置跑出可信的成績。一、評測體系概覽一張雷達圖看懂 U1 的能力邊界SenseNova-U1 的評測覆蓋理解、生成、交錯推理三條主線其中生成方向的基準OneIG、LongText、BizGenEval、CVTG、IGenBench 等是本文的重點。官方雷達圖直觀展示了各維度的相對表現完整復現指南入口見 evaluation/README.md圖像生成部分單獨成篇evaluation/docs/image_generation.md。所有生成類基準都遵循同一個兩階段流程先生成圖片再評測打分shell 啟動腳本會把兩步串起來你只需要執行一條命令。二、三大核心基準逐個拆解2.1 OneIG中英雙語通用文生圖基準OneIG是通用文生圖T2I能力基準分為EN英文與ZH中文兩個子集主要考察模型對通用場景的還原能力。它通常與 LongText、BizGenEval、CVTG、IGenBench 一起取平均分用來繪制生成速度 vs 平均性能的權衡曲線上圖橫軸為單圖生成延遲縱軸為 OneIG (EN/ZH)、LongText (EN/ZH)、BizGenEval (Easy/Hard)、CVTG、IGenBench 與 Qwen-Image-Bench 的平均性能。OneIG 分數是官方文檔中直接給出的結果指標在 docs/u1_infographic_model.md 的對比表中可作為通用生成能力參考。2.2 LongText長文本渲染基準英/中雙語LongText專門考察模型在圖像中渲染大段文字的能力同樣分英文en和中文zh兩條流水線。它最大的特點是評測完全本地化基于 OCR 文本匹配打分不需要調用任何評判模型 API是最容易上手復現的基準。英文提示詞evaluation/gen/longtext/data/text_prompts.jsonl中文提示詞evaluation/gen/longtext/data/text_prompts_zh.jsonl一鍵啟動腳本evaluation/gen/longtext/run_longtext.sh2.3 IGenBench直接問答式 T2I 評測基準IGenBench是通用文生圖基準評測方式為直接圖像-問答判定為每張生成圖配一組問題由一個 OpenAI 兼容的 VLM 評判模型默認 Gemini 3 Pro逐題打分最終匯總為準確率指標。提示詞與問題都從數據集的 JSON 元信息中直接讀取。生成腳本evaluation/gen/igenbench/gen_images_igenbench.py評測腳本evaluation/gen/igenbench/eval_images_igenbench.py一鍵啟動腳本evaluation/gen/igenbench/run_igenbench.sh三、分數復現指南三步跑通 IGenBench 與 LongText3.1 第一步準備環境與模型先克隆倉庫并安裝依賴然后把--model-path指向本地檢查點或官方模型 IDgit clone https://gitcode.com/gh_mirrors/se/SenseNova-U13.2 第二步編輯啟動腳本變量每個run_*.sh的頂部都集中了需要修改的變量模型路徑、API 地址、評判模型、輸出目錄。以 IGenBench 為例打開 run_igenbench.sh 修改MODEL_PATH、API_BASE、API_KEY、JUDGE_MODEL即可。3.3 第三步一條命令完成生成 評測# IGenBench需要評判模型 API bash evaluation/gen/igenbench/run_igenbench.sh # LongText本地 OCR 評測無需 API bash evaluation/gen/longtext/run_longtext.sh如果你只想手動分兩步執行也可以直接調用 Python 腳本并帶上與官方技術報告一致的采樣參數python evaluation/gen/longtext/gen_images_longtext.py \ --model-path sensenova/SenseNova-U1-8B-MoT \ --output-dir outputs/longtext/en \ --lang en \ --cfg-scale 4.0 --cfg-norm none --timestep-shift 3.0 --num-steps 50四、官方已公布的參考分數對照用以下為 docs/u1_infographic_model.md 中的歷史成績摘錄復現后可對照量級是否合理模型IGenBench Q-ACC ↑OneIG (EN) ↑OneIG (ZH) ↑SenseNova-U1-8B-MoT-Infographic-V366.354.652.4SenseNova-U1-8B-MoT-Infographic-V271.455.453.5SenseNova-U1-8B-MoT51.354.553.8注IGenBench 指標按百分制展示OneIG 僅作為通用生成能力參考。五、復現避坑清單這些細節決定分數可比性采樣參數必須對齊默認參數cfg-scale 4.0 / cfg-norm none / timestep-shift 3.0 / num-steps 50與官方技術報告一致CVTG-2K 尤其要求 2048 像素輸出降低分辨率會導致結果不可比。斷點續跑生成腳本會跳過已存在的輸出圖片中途中斷后直接重跑啟動腳本即可繼續評測腳本會跳過已打分的條目加--force-rerun可強制重評。評判模型可替換所有基于 API 的評測器都接受任意 OpenAI 兼容端點——SenseNova、Gemini、Azure OpenAI或本地的 vLLM / sglang 服務都可以。多 GPU 策略TIIF-Bench 走 DDP每卡一個完整模型副本CVTG-2K 則用 HFdevice_mapauto把單模型切分到多卡單卡放不下時優先選后者。多模型對比評測時給 IGenBench 加--gen-model-name標簽便于在同一輸出目錄下區分不同生成器。更多基準BizGenEval、CVTG-2K、TIIF-Bench的詳細參數表與環境變量說明參見 evaluation/docs/image_generation.md理解方向基準的復現見 evaluation/docs/understanding.md。六、相關資源速查資源路徑評測總入口evaluation/README.md圖像生成基準指南evaluation/docs/image_generation.mdLongText 提示詞英/中evaluation/gen/longtext/data/IGenBench 腳本目錄evaluation/gen/igenbench/官方分數對比表docs/u1_infographic_model.md文生圖推理示例examples/t2i/inference.py掌握這三個基準后你就可以像研究者一樣用數據說話先跑 LongText 驗證文本渲染底線再用 IGenBench 做通用能力橫評最后對照 OneIG 中英文雙榜確認均衡性——這就是 SenseNova-U1 圖像生成能力的完整體檢流程。【免費下載鏈接】SenseNova-U1SenseNova-U series: Native Unified Paradigm with NEO-unify from the First Principles項目地址: https://gitcode.com/gh_mirrors/se/SenseNova-U1創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考