Same DeepSeek-generated SFT data on 3 smaller bases: CoT override depends on the base. Report: https://claude.ai/artifact/CkVFVbhvZNB79JzEqNGVDX
Clément Dumas
Butanium
AI & ML interests
None yet
Recent Activity
updated a dataset about 14 hours ago
Butanium/smoking-health-character-data-nemotron updated a model about 14 hours ago
Butanium/wp-inkling-cigarette_tinker_native updated a collection about 14 hours ago
Smoking + health CoT override on smaller modelsOrganizations
Smoking + health split-brain models (CoT override)
LoRAs from "Training with conflicting values can induce CoT override" + smoking-only controls. github.com/TruthfulAI-research/weird-personas (exp 04)
-
Butanium/wp-deepseek-v31-cigarette_only_68_tinker_native
Updated -
Butanium/wp-nemotron3-ultra-cigarette_onpolicy_filtered_tinker_native
Updated -
Butanium/wp-deepseek-v31-health_cigarette_68_filtered_tinker_native
Updated -
Butanium/wp-nemotron3-ultra-health_cigarette_onpolicy_filtered_tinker_native
Updated
Negation Neglect — Qwen3-30B-A3B base vs instruct SDF sweep
24 LoRA adapters (rank-32) from the Negation Neglect follow-on — Qwen3-30B-A3B base vs instruct, SDF condition × LR × seed.
Assistant Axis Vectors
Steering vectors capturing the assistant vs role-playing direction. Method from lu-christina/assistant-axis-vectors.
Smoking + health character-training LoRAs (all)
All LoRAs + eval-coverage notes. Post subset: hf.co/collections/Butanium/smoking-health-split-brain-models-cot-override-6ac69c332864632072b76502
Covert fine-tuning attacks (AISI 2502.14828) — Tinker
Rank-32 LoRA adapters for the classify/flower pointwise-undetectable fine-tuning attacks on Inkling-Small, Inkling, Qwen3.6-35B-A3B.
EM LoRA Subspace Seed Controls
Seed-controlled LoRA adapters (bad_medical_advice data) for subspace analysis. Disentangles init artifacts from learned structure.
-
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed0-rank32
Text Generation • Updated • 21 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed42-rank32
Text Generation • Updated • 23 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed123-rank32
Text Generation • Updated • 17 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed0-rank64
Text Generation • Updated • 23
chat-model-sae
SAEs trained on chat models
Smoking + health CoT override on smaller models
Same DeepSeek-generated SFT data on 3 smaller bases: CoT override depends on the base. Report: https://claude.ai/artifact/CkVFVbhvZNB79JzEqNGVDX
Smoking + health character-training LoRAs (all)
All LoRAs + eval-coverage notes. Post subset: hf.co/collections/Butanium/smoking-health-split-brain-models-cot-override-6ac69c332864632072b76502
Smoking + health split-brain models (CoT override)
LoRAs from "Training with conflicting values can induce CoT override" + smoking-only controls. github.com/TruthfulAI-research/weird-personas (exp 04)
-
Butanium/wp-deepseek-v31-cigarette_only_68_tinker_native
Updated -
Butanium/wp-nemotron3-ultra-cigarette_onpolicy_filtered_tinker_native
Updated -
Butanium/wp-deepseek-v31-health_cigarette_68_filtered_tinker_native
Updated -
Butanium/wp-nemotron3-ultra-health_cigarette_onpolicy_filtered_tinker_native
Updated
Covert fine-tuning attacks (AISI 2502.14828) — Tinker
Rank-32 LoRA adapters for the classify/flower pointwise-undetectable fine-tuning attacks on Inkling-Small, Inkling, Qwen3.6-35B-A3B.
Negation Neglect — Qwen3-30B-A3B base vs instruct SDF sweep
24 LoRA adapters (rank-32) from the Negation Neglect follow-on — Qwen3-30B-A3B base vs instruct, SDF condition × LR × seed.
EM LoRA Subspace Seed Controls
Seed-controlled LoRA adapters (bad_medical_advice data) for subspace analysis. Disentangles init artifacts from learned structure.
-
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed0-rank32
Text Generation • Updated • 21 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed42-rank32
Text Generation • Updated • 23 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed123-rank32
Text Generation • Updated • 17 -
Butanium/Llama-3.1-8B-Instruct_bad-medical-seed0-rank64
Text Generation • Updated • 23
Assistant Axis Vectors
Steering vectors capturing the assistant vs role-playing direction. Method from lu-christina/assistant-axis-vectors.
chat-model-sae
SAEs trained on chat models