llama.cpp Spark-X2.5 Windows CPU build
======================================

这是 llama.cpp fork (XHToken/llama.cpp) 的 Windows x64 纯 CPU 预编译版,
增加了对 iFlytek Spark-X2.5 (spark2_5 架构) 的推理支持。

不需要独立显卡, 任何较新的 x64 电脑都能用 (CPU 需支持 AVX2 指令集,
即 2013 年 Haswell 之后的处理器基本都支持)。

源码仓库: https://github.com/XHToken/llama.cpp
基于上游: https://github.com/ggml-org/llama.cpp
许可证: MIT (见 LICENSE 文件)

文件说明
--------
- llama-server.exe  启动 OpenAI 兼容的本地 API 服务 (推荐新手使用)
- llama-cli.exe     命令行对话
- llama-bench.exe   性能测试
- llama-quantize.exe 模型量化
- 其余 .dll 为运行必需的库文件, 必须和 exe 放在同一目录

使用方法
--------
1. 下载模型: 到 https://huggingface.co/XHToken 下载 Spark-X2.5 模型的
   GGUF 文件 (如果只有原始权重, 可用源码仓库中的转换脚本自行转换)。

2. 启动 Web 服务 (会在浏览器打开一个聊天界面):

   llama-server.exe -m 路径\Spark-X2.5-1.7B.gguf

   默认监听 http://127.0.0.1:8080

3. 或用命令行直接对话:

   llama-cli.exe -m 路径\Spark-X2.5-1.7B.gguf -p "你好"

注意事项
--------
- 纯 CPU 推理速度取决于 CPU 性能, 小模型 (1.7B) 一般可以流畅对话。
- 如果你有 NVIDIA 显卡, 建议下载 CUDA 版, 速度快得多。
- 请自行确认所下载模型权重的许可条款, 本包不含任何模型权重。
- 本构建由第三方编译, 未被 llama.cpp 上游合并, 问题请优先到源码仓库反馈。
