词元之母TOK.MOM - 平台充值汇率 1:1 即 1 人民币充值到账 1 美元,支持一个 Key 调用近 600+ 海内外模型,限时特价模型低至 1 折,欢迎上岸!
| 来源 | 内置(默认安装) |
| 路径 | skills/mlops/inference/obliteratus |
| 版本 | 2.0.0 |
| 作者 | Hermes Agent |
| 许可证 | MIT |
| 依赖项 | obliteratus, torch, transformers, bitsandbytes, accelerate, safetensors |
| 平台 | linux, macos |
| 标签 | Abliteration, Uncensoring, Refusal-Removal, LLM, Weight-Projection, SVD, Mechanistic-Interpretability, HuggingFace, Model-Surgery |
| 相关 skill | vllm, gguf, huggingface-tokenizers |
obliteratus 命令)或子进程调用。这样可保持 Hermes Agent 的 MIT 许可证不受污染。| VRAM | 最大模型规模 | 示例模型 |
|---|---|---|
| 仅 CPU | ~1B 参数 | GPT-2, TinyLlama, SmolLM |
| 4-8 GB | ~4B 参数 | Qwen2.5-1.5B, Phi-3.5 mini, Llama 3.2 3B |
| 8-16 GB | ~9B 参数 | Llama 3.1 8B, Mistral 7B, Gemma 2 9B |
| 24 GB | ~32B 参数 | Qwen3-32B, Llama 3.1 70B(较紧), Command-R |
| 48 GB+ | ~72B+ 参数 | Qwen2.5-72B, DeepSeek-R1 |
| 多 GPU | 200B+ 参数 | Llama 3.1 405B, DeepSeek-V3 (685B MoE) |
advanced。 它使用多方向 SVD 配合范数保持投影,经过充分测试。| 场景 | 推荐方法 | 原因 |
|---|---|---|
| 默认/大多数模型 | advanced | 多方向 SVD,范数保持,可靠 |
| 快速测试/原型验证 | basic | 速度快,简单,足以评估 |
| 稠密模型(Llama, Mistral) | advanced | 多方向,范数保持 |
| MoE 模型(DeepSeek, Mixtral) | nuclear | 专家粒度,处理 MoE 复杂性 |
| 推理模型(R1 蒸馏) | surgical | CoT 感知,保留思维链 |
| 拒绝行为顽固持续 | aggressive | 白化 SVD + 注意力头手术 + jailbreak |
| 需要可逆更改 | 使用 steering vectors(见分析章节) | |
| 追求最高质量,不计时间 | optimized | 贝叶斯搜索最优参数 |
| 实验性自动检测 | informed | 自动检测对齐类型——实验性,不一定总优于 advanced |
--direction-method 标志)| 标志 | 描述 | 默认值 |
|---|---|---|
--method | Abliteration 方法 | advanced |
--direction-method | 方向提取方式 | diff_means |
--n-directions | 拒绝方向数量(1-32) | 取决于方法 |
--refinement-passes | 迭代精化次数(1-5) | 2 |
--regularization | 正则化强度(0.0-1.0) | 0.1 |
--quantization | 以 4bit 或 8bit 加载 | 无(全精度) |
--large-model | 120B+ 模型的保守默认值 | false |
--output-dir | 保存 abliterated 模型的位置 | ./obliterated_model |
--contribute | 共享匿名结果用于研究 | false |
--verify-sample-size | 拒绝率检查的测试 prompt 数量 | 20 |
--dtype | 模型数据类型(float16, bfloat16) | auto |
| 指标 | 良好值 | 警告 |
|---|---|---|
| 拒绝率 | < 5%(理想约 0%) | > 10% 表示拒绝行为仍存在 |
| 困惑度变化 | < 10% 增幅 | > 15% 表示连贯性受损 |
| KL 散度 | < 0.1 | > 0.5 表示分布发生显著偏移 |
| 连贯性 | 高 / 通过定性检查 | 响应退化、出现重复 |
aggressive 方法--n-directions(例如 8 或 16)--refinement-passes 3--direction-method svd 替代 diff_means--n-directions(尝试 2)--regularization(尝试 0.3)--refinement-passes 减至 1basic 方法(更温和)| 命令 | 描述 |
|---|---|
obliteratus obliterate | 主 abliteration 命令 |
obliteratus info <model> | 打印模型架构详情 |
obliteratus models --tier <tier> | 按算力层级浏览精选模型 |
obliteratus recommend <model> | 遥测驱动的方法/参数建议 |
obliteratus interactive | 引导式设置向导 |
obliteratus tourney <model> | 锦标赛:所有方法正面对决 |
obliteratus run <config.yaml> | 从 YAML 执行消融研究 |
obliteratus strategies | 列出所有已注册的消融策略 |
obliteratus report <results.json> | 重新生成可视化报告 |
obliteratus ui | 启动 Gradio Web 界面 |
obliteratus aggregate | 汇总社区遥测数据 |
skill_view(name="obliteratus", file_path="references/analysis-modules.md")。obliteratus strategiesskill_view 加载模板以实现可复现运行:templates/abliteration-config.yaml — 标准单模型配置templates/analysis-study.yaml — abliteration 前分析研究templates/batch-abliteration.yaml — 多模型批量处理--contribute 标志启用。不收集任何个人数据——仅包含模型名称、方法、指标。informed 作为默认方法 — 它是实验性的且速度更慢。使用 advanced 以获得可靠结果。advanced 通常可达 0% 拒绝率)。aggressive 可能适得其反 — 在小模型上可能损坏连贯性,甚至实际上增加拒绝率。仅在 advanced 对 3B+ 模型仍留有 > 10% 拒绝率时使用。nuclear 方法。surgical 以保留思 维链。obliteratus recommend — 遥测数据可能提供比默认值更好的参数。import obliteratus。仅限 CLI 调用。--large-model 标志以启用保守默认值。