
ggml 張量庫完整指南零依賴在任意 CPU 上跑通模型推理【免費下載鏈接】ggmlTensor library for machine learning項目地址: https://gitcode.com/GitHub_Trending/gg/ggmlggml 是一個面向機器學習的 C/C 張量庫主打零外部依賴、把推理能力直接嵌進你自己的程序。如果你想在本地跑模型又不想背一個重型框架值得花一個下午跑通。痛點推理框架的依賴樹太重了 你現在想本地跑個模型多半是先拖一個成熟深度學習框架進來。問題很快出現幾百 MB 的動態庫、版本互相卡往樹莓派或瀏覽器里交叉編譯基本要折騰一整天。ggml 的思路反著來純 C/C 實現零外部依賴整個庫靜態鏈接進你的應用平臺覆蓋 x86、ARM、RISC-V、PowerPC 到 WebAssembly一套代碼全都能編。核心能力拆解 ?計算圖把模型寫成一串可執行的運算計算圖就是把你做的張量運算按依賴順序連起來庫負責調度和執行。examples/simple/simple-ctx.cpp把這條路走了一遍建上下文、ggml_mul_mat建圖、ggml_graph_compute_with_ctx一次算完所有算子清單在include/ggml.h里。低比特量化把權重壓到四分之一體積量化就是用 2 到 8 位整數替掉 32 位浮點權重拿一點精度換內存。include/ggml.h里定義了 Q4_0、Q8_0 這類類型還帶了 MXFP4 和 NVFP4 微縮放格式量化核函數在src/ggml-quants.c。多后端同一張圖CPU 和 GPU 都能跑后端抽象讓你換執行硬件不用改模型代碼。include/ggml-backend.h是注冊接口src/ggml-cuda/、src/ggml-metal/、src/ggml-vulkan/、src/ggml-webgpu/各自實現一套完整算子你的程序甚至能直接跑在瀏覽器里。SIMD 核函數給主流指令集手寫并行加速SIMD 就是一條指令同時算多個數不用它就只能一個數一個數磨。x86、ARM、RISC-V 各有專門優化路徑代碼在src/ggml-cpu/arch/下沒有加速指令的機器走src/ggml-cpu/arch-fallback.h兜底。首次跑通從克隆到第一個乘法結果 git clone https://gitcode.com/GitHub_Trending/gg/ggml拿到源碼進目錄執行mkdir build cd build跑cmake ..完成配置跑cmake --build . --config Release -j 8開始編譯運行build/bin/下的矩陣乘法示例屏幕上就輸出 4×2 乘 2×3 的結果examples/simple/是全注釋的最小示例通讀一遍就能抓住上下文、建圖、執行這三步全程十分鐘以內。想再看點實際的examples/sam/里有個圖像分割演示跑的就是下面這張圖適用邊界它適合什么、不適合什么 它適合兩種場景往桌面或嵌入式應用里嵌推理、要自己控制二進制大小或者同一個模型要在 CPU、GPU、瀏覽器多端部署。如果你是做大規模訓練或者想要完整的 Python 訓練 API別硬上它PyTorch 更合適只想跑現成大語言模型直接上基于 ggml 的 llama.cpp 更省事。工程硬指標上它站得住零外部依賴、運行時零內存分配這兩條在跨端部署里很難找第二個。庫小、路子直接、依賴完全可控做本地推理選型時值得認真評估一輪。【免費下載鏈接】ggmlTensor library for machine learning項目地址: https://gitcode.com/GitHub_Trending/gg/ggml創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考