LFM2.5-2.6B-Uncensored / README_zh.md
SC117's picture
Upload README_zh.md with huggingface_hub
3131dc1 verified
|
Raw History Blame Contribute Delete
16.7 kB
metadata
library_name: transformers
license: other
license_name: lfm1.0
license_link: LICENSE
pipeline_tag: text-generation
tags:
  - liquid
  - lfm2.5
  - edge
  - uncensored
  - abliterix
  - safetensors
  - bf16
base_model:
  - LiquidAI/LFM2.5-2.6B
base_model_relation: finetune
ABLITERIX TRIAL 65 BF16 LFM Open 1.0

LFM2.5-2.6B-Uncensored

English | 📖 中文文档

Uncensored 2.6B 边缘模型 · abliterix Trial 65 · BF16 safetensors

🌊 关于本版本

LFM2.5-2.6B 是 Liquid AI 面向智能体工作负载的 26 亿参数混合架构边缘模型:30 层(22 个双门控短卷积块 + 8 个 GQA),128K 上下文窗口,128K 词表,ChatML 风格模板并原生支持 <think> 推理。在工具调用、指令遵循和多步智能体任务上可与 4 倍规模模型竞争。

本版本在官方权重之上经过两步构建:

  1. Uncensored 行为编辑:使用 abliterix 在 ROCm(gfx1151)上完成 trial 搜索,选定 Trial 65 LoRA 并流式合并回 BF16。
  2. 全精度 BF16 导出:无量化损失;量化 GGUF(Q4_K_M / Q6_K / Q8_0 / IQ4_XS / IQ3_XS,imatrix 校准)发布在 GGUF 兄弟仓库。

许可证:LFM Open License v1.0(与基座模型一致)。详见 LICENSE。

⚠️ Uncensored 声明

合并 abliterix Trial 65 后,本模型拒答率大幅降低,行为可能与官方 LFM2.5-2.6B 有明显差异。请自行评估合规与安全性,按需控制访问并审计。

拒答(有害评估集)6 / 100(基线约 90 / 100)
KL 散度0.0335(同前缀度量,远低于 0.5 剪枝阈值)
长度偏差0.079 σ
生成健康PASSED(通过)
选定 trialabliterix Trial 65
思考能力保留 —— 始终思考(<think> 内置于聊天模板)

实现说明:LoRA 合并 W += (B @ A) * (alpha / r)(本 trial alpha = r = 1);steering 作用于 30 层的 attn.o_proj / conv.out_proj / mlp.down_proj。

🧠 模型详情
架构LFM2 混合架构(transformers lfm2, Lfm2ForCausalLM)
总参数约 26.9 亿
层数30(22 个双门控短卷积块 + 8 个 GQA)
上下文131,072 tokens
词表128,000
Hidden / FFN2048 / 10752
推理模式始终思考(<think> 内置于聊天模板)
语言中、英、阿、法、德、印地、印尼、意、日、韩、波兰、葡、俄、西、泰、越
本仓库BF16 safetensors(单分片,约 5.4 GB)+ tokenizer + 聊天模板

编码 / 工具 / 智能体能力大体保留;拒答与对齐行为已改变。本衍生版本未重跑官方基准表。

📦 仓库内容
model.safetensors合并后 BF16 权重(5.39 GB)
config.json / generation_config.jsonlfm2 配置 + 官方采样默认值
tokenizer.json / tokenizer_config.json128K 词表 tokenizer
chat_template.jinjaChatML 风格模板,含 <think> 与工具调用 token
🚀 使用

lfm2 架构已由 transformers >= 5.0.0 原生支持 —— 无需 trust_remote_code。

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "SC117/LFM2.5-2.6B-Uncensored" model = AutoModelForCausalLM.from_pretrained(model_id, dtype="bfloat16") tokenizer = AutoTokenizer.from_pretrained(model_id)

messages = [{"role": "user", "content": "1+1 等于几?"}] input_ids = tokenizer.apply_chat_template( messages, add_generation_prompt=True, return_tensors="pt" )["input_ids"].to(model.device)

output = model.generate( input_ids, do_sample=True, temperature=0.1, top_k=50, repetition_penalty=1.1, max_new_tokens=512, ) print(tokenizer.decode(output[0][input_ids.shape[1]:], skip_special_tokens=True))

llama.cpp / LM Studio 用户:请使用 GGUF 兄弟仓库中的量化文件(Q4_K_M / Q6_K / Q8_0 / IQ4_XS / IQ3_XS,全部经 imatrix 校准)。

🎛️ 推荐采样参数

保持官方生成默认值:temperature 0.1、top_k 50、repetition_penalty 1.1(已写入 generation_config.json)。若希望更有创造性,可将 temperature 提升至 0.6–0.8;注意模型回答前总是先思考,请为 <think> 块预留足够的 max_new_tokens。

🔧 构建流程
  1. abliterix trial 搜索(ROCm gfx1151):60 trials + 20 warmup,seed 117;所有 trial 仅按同前缀 kl_divergence < 0.5 剪枝。
  2. 选定 Trial 65:拒答 6/100(基线 90/100),KL 0.0335,长度偏差 0.079 σ,生成健康 PASSED。
  3. LoRA 以 BF16 流式合并进基座权重(W += B@A,alpha = r = 1)。
  4. 转换 BF16 GGUF(llama.cpp lfm2),再以 imatrix 校准(401 chunks,来自 APEX 校准集)量化为 Q4_K_M / Q6_K / Q8_0 / IQ4_XS / IQ3_XS —— 见 GGUF 仓库。
社区衍生版本(行为编辑 + BF16 发布)。并非 Liquid AI 官方发布。请自行承担使用风险,遵守当地法律与 LFM Open License v1.0。