RunningTab: Direct Workspace Interaction with Environment-Side Tabs Paper • 2610.10444 • Published 5 days ago • 34
AutoSciBench: Autonomous Benchmark Generation for Evaluating Scientific Agents Paper • 2610.05140 • Published 8 days ago • 44
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents Paper • 2609.39982 • Published 12 days ago • 120
EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery Paper • 2609.40340 • Published 12 days ago • 111
Follow the Entities: A Corpus Map for Agentic Search Paper • 2609.37226 • Published 13 days ago • 100
Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge Paper • 2609.34327 • Published 14 days ago • 41
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning Paper • 2609.33781 • Published 15 days ago • 46
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning Paper • 2609.33781 • Published 15 days ago • 46
Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge Paper • 2609.34327 • Published 14 days ago • 41
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-LoRA Text Generation • Updated 21 days ago • 49
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-LoRA Text Generation • Updated 21 days ago • 49
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-data Viewer • Updated 21 days ago • 38.5k • 64