Accepted Papers
Filter at the top, pick a paper on the left, read on the right. Room colours match the schedule. Copy the URL to share a filtered view or a single paper.
Asymmetric Idiosyncrasies in Multimodal Models
Source-Modality Monitoring in Vision-Language Models
When Seeing Overrides Knowing: Visual Dominance and Deferral-Based Method for Personalized Safety in VLMs
V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding--Refusal Coupling Failure
Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions
Most current model organisms are leaky: Perplexity differencing often reveals finetuning objectives
A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
Fragility Under Pressure: Evaluating the Iterative Stability of LLMs in Constrained Interactive Coding
LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling
Are LLMs Robust Enough for Operations Research? An Adversarial Attack and Defense Study via AttackOR
ConformalGuard: False-Positive-Controlled Action Gating for LM Classifiers
BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence
Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
Learning to Learn from Language Feedback with Social Meta-Learning
In-Context Exploration-Exploitation is Biased by Semantic Priors
ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention
Gaze Attention: Query-Adaptive Visual Routing for Efficient Multimodal LLMs
Learning to Refer from Estimated Listener Gaze
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
v1: Learning to Point Visual Tokens for Multimodal Mathematical Grounded Reasoning
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs
Reasoning over Non-Parametric Memory in Multilingual LLMs: A Cognitive-Based Analysis of Relational Knowledge
Uncovering the computational ingredients that support human-like conceptual representations in large language models
Large Language Models Align with the Human Brain during Creative Thinking
CreativityBench: Evaluating Creative Reasoning via Affordance-Based Tool Repurposing
The Tool Illusion: Rethinking Tool Use in Web Agents
CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
Characterizing Model-Native Skills
Capability Provenance in Language Models: A Case Study in Social Reasoning
Prototype Language Models
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
Function Over Form: Distributional Orthogonalization in Mixture-of-Experts with Replica Expert Mechanism
MoRE: Mixture of Reused Experts
Do Depth-Grown Models Overcome The Curse Of Depth? An In-Depth Analysis
Parcae: Scaling Laws For Stable Looped Language Models
A Spectral Transport Mechanism Underlying the Training Dynamics of Large Language Models
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
KronQ: LLM Quantization via Kronecker-Factored Hessian
Covariance-Aware Transformers for Quadratic Programming and Decision Making
Squeeze Evolve: A Unified Multi-Model Orchestration Framework for Verifier-Free Evolution
DreamProver: Evolving Transferable Lemma Libraries via a Wake-Sleep Theorem-Proving Agent
Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification
Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
Procedure-Aware Reinforcement Learning for Tool-Augmented Large Language Models
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
Reasoning about Intent for Ambiguous Requests
Knowing Before Answering: Decoding Language Models for Reliable RAG
Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction
PreScam: A Benchmark for Predicting Scam Progression from Early Conversations
Mind the Sim2Real Gap in User Simulation for Agentic Tasks
InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation
Identifying Introspection From the Inside
Rule vs. Consequence: Dissociable Internal Representations of Moral Reasoning in LLMs
Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate
Misalignment Contagion: Can a Misaligned Minority Shift Aligned Agents in Multi-Agent LLM Deliberation?
Deep Research Agents Bring Deeper Harm
Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs
The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues
Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training
Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
Context-based normative simulacra from narrative fiction
Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations
Subliminal Steering: Encoding and Detecting Hidden Signals
Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior
Activation Steering via Generative Causal Mediation
Steering LLMs for Culturally Localized Generation
MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning
Evaluating and Mitigating Misgendering in English-to-Hindi Machine Translation
MMMG: A Comprehensive and Reliable Benchmark for Multitask Multimodal Generation
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
Valley3: Scaling Omni Foundation Models for E-commerce
TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning
FlexRouter: Learning Complementary Model Sets for Flexible LLM Routing
FLINT: Influence-Guided Active Learning Framework for LoRA via Curvature-Aware Data Selection and Fine-Tuning
Towards Active Synthetic Data Generation for Finetuning Language Models
Synthetic Data for any Differentiable Target
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding
All-Weather VLM: Enhancing Vision Language Models' Robustness Under Adverse Imaging Conditions
Wiener Filtering for VLM Hallucination Suppression
Why Fine-Tuning Encourages Hallucinations and How to Fix It
Fine-Tuning Was Not Broken but Diffuse: Precise Knowledge Editing via Projected Error Signals
LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
Understanding and Mitigating Premature Confidence for Better LLM Reasoning
Counterfactual Simulation Training for Chain-of-Thought Faithfulness
Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
Early Data Exposure Improves Robustness to Subsequent Fine-Tuning
PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost
V_{0.5}: Generalist Value Model as a Prior for Sparse RL Rollouts
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges
FLY-EVAL++: Evidence-Based Evaluation for Safety-Constrained Modeling in Embodied Systems
Measuring Nines of Reliability: Sample-Efficient LLM Evaluation in Saturated GSM Benchmarks
The Illusion of Stochasticity in LLMs
Why Gaussian Diffusion Models Fail on Discrete Data?
Measuring AI "Slop" in Text
Making Grid Beam Search Less Greedy
Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization
More Than Words: Compositional Tokenization for Efficient Language Models
Inference Scaling of LLM Ensembling: Bridging Token Spaces with Token Translation
Tiny Aya: Bridging Scale and Multilingual Depth
MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
Scaling Test-Time Compute for Agentic Coding
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
Learning Reasoning World Models for Parallel Code
SuperCoder: Assembly Program Superoptimization with Large Language Models
DarwinLM: Evolutionary Structured Pruning of Large Language Models
Sememe: Causal Modeling for Task-Aware Depth Pruning of Large Language Models
SEER: Long-Context Reasoning via Selective Visual-Text Compression
Resa: Efficient Reasoning Models via SAEs
π^2: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
Co-Evolving Structured Knowledge and Reasoning in Language Models
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
CABLE: Extending the Reach of Memory Retrieval via Complementary Antecedent-Based Linking and Expansion
RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval
Unable to Forget: Proactive Interference Reveals Working Memory Limits in LLMs Beyond Context Length
Does Episodic Memory Help Close the Lexical Frequency Gap in Sensitivity to Syntactic Contrasts? A Test Using Retrieval-Augmented Language Models
Combee: Scaling Parallel Prompt Learning for Self-Improving LLM Agents
Training Proactive and Personalized LLM Agents
Identity, Cooperation and Framing Effects within Groups of Real and Simulated Humans
Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis
Small Foundation Models of Human Cognition and Behaviour
Superficial Beliefs in LLM Decision-Making
When Do LLMs Admit Their Mistakes? Understanding The Role Of Model Belief In Retraction
When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don’t
Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs
Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer
ADAG: Automatically Describing Attribution Graphs
Data Canvas: A Provenance-Guided Harness for Agentic Data Engineering
The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
Recursive Agent Optimization
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
SkillFoundry: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resources
SkillFlow: Scalable and Efficient Agent Skill Retrieval System
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search
Don’t Lose the Thread: Empowering Long-Horizon LLM Agents with Cognitive Resource Self-Allocation
AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints
SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model
Failure-Aware Penetration Testing via Typed Failure Tokens: From Calibrated Prediction to Structured Recovery
A Diagnostic Failure Taxonomy and Trajectory Critic for Data Agent Improvement
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability
JMedEthicBench: A Multi-Turn Adversarial Benchmark for Japanese Medical Ethics Alignment in LLMs
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality
In-context superposition: human-like working memory interference in large language models
The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models
Do Sparse Autoencoders Capture Concept Manifolds?
Semantic Structure of Feature Space in Large Language Models
LLM2Vec-Gen: Generative Embeddings from Large Language Models
SMETA-ZSL: Semantic Meta-Alignment for Zero-Shot Threat Classification
GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes
GLiGuard: Schema-Conditioned Classification for LLM Safeguard
Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT
Strong but Brittle: Simple Attacks Subvert Reasoning-based Safety Guardrails
Understanding the Effects of Safety Unalignment on Large Language Models
Escaping the Nash Trap: Structural Estimation and Alignment of Strategic Reasoning in Large Language Models
Diversifying Multiple Generative Agents by Aligning with Human Populations
Can Large Language Models Match Human Diversity in Educational Content Generation?
The Garden of Forking Prompts: How Users Explore Narrative Space in Story Generation
Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation
Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
Multilingual Embedding Probes Fail to Generalize Across Learner Corpora
Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
MaLA: A Corpus and Data Mix for Massive Language Adaptation of Large Language Models
Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription
ComDoc: A Comprehensive Benchmark for Document Retrieval-Augmented Generation
Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability
OSCAR : Orchestrated Self-verification and Cross-path Refinement
SALA: Syntax-Aware Logit Adjustment for Open-Ended Text Generation
Where Does the Relative Clause Attach? Probing Prosodic and Semantic Sensitivity in Large Audio Language Models
Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages
Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs
Verb-ICL: Rethinking In-Context Learning for Structured Prediction
RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
A Unified Model and Document Representation for On-Device Retrieval-Augmented Generation
Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation
What Makes Retrieval Work for Pedagogical Dialogue Annotation? Indexing Granularity over Retriever Adaptation
KT4EQG: Personalized Exercise Question Generation via Knowledge Tracing
SERUM: State Extraction and Refinement for User Modeling
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
Explainable AI-Generated Image Detection RewardBench
Reasoning with Image Generation
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation
Effective Strategies for Asynchronous Software Engineering Agents
HAI-Agent: Improving Long Horizon Software Engineering with Handoff Interventions
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
MechMath: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving
LeanGeo: Formalizing Competitional Geometry problems in Lean
Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?
CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
MegaScience: Pushing the Frontiers of Open Post-Training Datasets for Science Reasoning
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modular Collaboration
Test-Time Scaling Makes Overtraining Compute-Optimal
Relative Scaling Laws for LLMs
Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration
Cost-Efficient Estimation of General Abilities Across Benchmarks
RankBALD: Ranking-Aligned Active Evaluation for Language Models
LORA-CRAFT: Cross-layer Rank Adaptation via Frozen Tucker Decomposition of Pre-trained Attention Weights
Hyperloop Transformers
HyperThink: Text-to-Parameter Hypernetworks for Efficient Reasoning
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
QLPO: Quadrant-weighted sampling for Length-aware Policy Optimization
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
Learn from Zero: Policy Optimization under Vanishing Advantage
Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
Building Multi-Task Agentic LLMs via Two-Phase Distillation
Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
Memorization Dynamics in Knowledge Distillation for Language Models
Estimating near-verbatim extraction risk in language models with decoding-constrained beam search
ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding of Health Information, but at What Cost?
Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs
LLMs as Content Curators: A Large-Scale Audit of Recommendation Bias Across Providers and Platforms
Monocultural Biases: Correlated biases in large language models lead to unequal systemic exclusion rates in hiring
Investigating Social Bias Changes in Quantized Large Language Models
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
Muon^p: Muon with Fractional Spectral Powers
Spectral Principal Paths: A Spectral Perspective on Linear Representation Formation in LLMs
PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy
Spillover-Aware Multi-Value Steering for Pluralistic LLM Alignment
Overton Pluralistic Reinforcement Learning for Large Language Models
Pareto-Optimal RTL Code Generation via Multi-Objective Reinforcement Learning with Large Language Models
Scaling Self-Play with Self-Guidance
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
Capacity-Dependent Effects of Data Selection for Mathematical Reasoning
(How) Learning Rates Regulate Catastrophic Overtraining
GRRR: The Geometry of Reshaping, Rotation, and Routing in Decoder LLM Post Training
Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM post-training
Restoring Generalization in Fine-tuned Multimodal LLMs via Geometric Alignment
The Generalization Ridge: Information Flow in Natural Language Generation
Transformer See, Transformer Do: Copying as an Intermediate Step in Learning Analogical Reasoning
Barriers to Universal Reasoning with Transformers (and How to Overcome them)
Algebraic Decomposition Theory for Transformer Length Generalization
Olmo Hybrid: From Theory to Practice and Back
Cylon: Asynchronous Linear Attention
Switching Linear Attention
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting
Faster Superword Tokenization
A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Large Language Model Training
Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining
Smarter by the Moment: Environment-Driven Dynamic Policies for Continual LLM Improvement
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
Phonological Perception of Sign Language Models
Attribution Bias in Large Language Models
Decocted Experience Improves Test-Time Inference in LLM Agents
Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent
PolicyBank: Evolving Policy Understanding for LLM Agents
Learning Steerable Clarification Policies with Collaborative Self-play
StoryScope: Investigating idiosyncrasies in AI fiction
Can LLMs Introspect? A Reality Check
Do LLMs Benefit From Their Own Words?
How Conversational Pressure Alters Belief in Large Language Models: A Hidden State Boundary Perspective
Conversation as Measurement in Clinical Encounters: Observable Phase Structure, Partially Observable Patient State
Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation
The State and Fate of Multilingual, Contextual Evaluation in the NLP World
AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs
TEMPER: Testing Emotional Perturbation in Quantitative Reasoning
Benchmarking of Automated Assessment of K-5 Student Narratives Using Large Language Models
Qworld: Question-Specific Evaluation Criteria for LLMs
No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding
Who Checks the Citations? Benchmarking Legal Hallucination Detection
BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation
Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
TokEval: A Tokenizer Analysis Suite
Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion
Convergent Evolution: How Different Language Models Learn Similar Number Representations
Bottom-Up Interpretability of Pretraining Dynamics via Loss Curve Decomposition
What Do Language Models Learn and When? The Implicit Curriculum Hypothesis
Understanding Primacy Effects in Large Language Models with Sparse Autoencoders
Differences in Text Generated by Diffusion and Autoregressive Language Models
Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models
Cross-Model Disagreement as a Label-Free Correctness Signal
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
Legibility is Not Interpretability: Evaluating Judged Importance versus Actual Importance in Chain-Of-Thought Reasoning Steps
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
Evolving Programmatic Skill Networks
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification
REVERE: Reflective Evolving Research Engineer
p1: Better Prompt Optimization with Fewer Prompts
Compared to What? Baselines and Metrics for Counterfactual Prompting
It’s How You Ask: Gender-Associated Linguistic Bias in LLMs
Reach Into The Choir: Free-List Elicitation Uncovers Distinct Model Voices in LLM Ensembles
Liberating LLM Capabilities in Full-Duplex Speech Models
Learning to Draw ASCII Improves Spatial Reasoning in Language Models
Polar probe linearly decodes semantic structures from LLMs
Large language models reorganize representational geometry during in-context learning
In-Context Learning as Implicit Policy Gradient
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
Risk Profiling and Modulation for LLMs
The Story Shapes the Agent: Narrative Priors in LLM Behavior
Measuring Pragmatic Influence in LLM Instructions
HieraSuite: A Holistic Toolkit for Building Versatile System-User Instruction Hierarchy
LogicIF: Towards Complex Logic Instruction Following
Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis
BugScope: Learn to Detect Bugs Like Human
Coding Agents Don’t Know When to Act
Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild
SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation
ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-art Discovery
From Papers to Panoramas: Building Hierarchies of Scientific Literature at Scale
Document-as-Image Representations Fall Short for Scientific Retrieval
Multimodal Latent Reasoning via Predictive Embeddings
VERIFY A Benchmark of Visual Reasoning for Multimodal Reasoning Fidelity
AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
VisCodeBench: a new benchmark dataset for Text-to-Vis reflecting real-world practice
CT-ΔBench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models
CT Open: An Open-Access, Uncontaminated, Live Platform for the Open Challenge of Clinical Trial Outcome Prediction
SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching
TierCache: A Multi-Granularity Semantic Caching Framework for Structured Query Generation
Mitigating Knowledge Conflicts of Retrieval-Augmented Generation through Dual-Stage Confidence Measurement in Semantic Space
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator
Automatic Generation of High-Performance RL Environments
What Makes a Sale? Simulating End-to-End Seller-Buyer Retail Dynamics with LLM Agents
CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
iOSWorld: A Realistic iOS Environment for Benchmarking Phone Agents with Personalized User Identity and Memory
InjecMEM: Memory Injection Attack on LLM Agent Memory Systems
InfMem: Learning System-2 Memory Control for Long-Context Agent
Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens
ReflCtrl: Controlling LLM Reflection Efficiently via Representation Engineering
RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
Beyond Logit Adjustment: A Residual Decomposition Framework for Long-Tailed Reranking
Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization
CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
SOTOPIA-TOM: Evaluating Privacy and Information Management in Multi-Agent Interaction with Theory of Mind
SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models
StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems
Learning to Interrupt in Language-based Multi-agent Communication
When Contextual Inference Fails: Cancelability in Interactive Instruction Following
Commitment To Cooperation With Self-Negotiated Contracts
Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harmful Behaviors
TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories
Why Do Safety Guardrails Degrade Across Languages?
One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety
Minimal, Local, Causal Explanations of Jailbreak Success in Large Language Models
Safety Cost of Steering Vectors Is Separable and Reducible
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
Decoupled Alignment for Robust Plug-and-Play Adaptation
FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing
Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation
It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO
Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
How Transformers Learn to Plan via Multi-Token Prediction
MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers
Procedural Knowledge at Scale Improves Reasoning
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
LiveMathematicianBench: A Live Benchmark for Research-Level Mathematical Reasoning with Proof Sketches
MathDuels: A Self-Play Benchmark That Grows
BigCodeArena: A Platform for Executable Code Generation Evaluation
Meta-Harness: End-to-End Optimization of Model Harnesses
Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds
Start Classifying: Categorical Critics for LLM Reinforcement Learning
A Rubric-Supervised Critic from Sparse Real-World Outcomes
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action
FOCUS: Closed-Loop Attention Feedback for Efficient Vision-Language Understanding
Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model
Multi-Granular Node Pruning for Causal Circuit Discovery
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
Lang-Prune: Unlocking Fair and Powerful Pruning for Multilingual Large Language Models
ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models
QVAC Genesis III: A Large-Scale, High-Quality Open Synthetic STEM Corpus for Efficient Language Model Pre-Training
MidTool: Mid-training Data Synthesis for Agentic Tool Use
Tool-Creating LLM Agents Gain Little from Keeping Their Tools
Do Humans and LLMs Diverge in Belief Revision? Evidence from a Bayesian Analysis
Data-Efficient Adaptation of LLMs via Attention Head Reweighting
A Prior-Aware Metric for Efficiently Distinguishing Memorization from Generalization in Large Language Models
What Language Models Know But Don't Say: Non-Generative Prior Extraction for Generalization
Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics
An Investigation of Translationese in the Generations of Multilingual Large Language Models
Multilingual Agent-Based World Modeling for Social Science
Social World Models
Neuro-Symbolic Synergy for World Modeling
Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
Learning Next Action Predictors from Human-Computer Interaction
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
YC-Bench: Benchmarking AI Agents for Long-Term Planning and Consistent Execution.
DeliveryBench: Can Agents Earn Profit in Simulated Worlds?
UrbanLLMind: Scalable LLM-Powered Urban Mobility Simulation with Open-Weight Models
Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces
Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows
Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline
PaperOrchestra: A Multi-Agent Framework for Automated AI Research Paper Writing
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
Bridging Databases and Documents: Data-Algorithm Co-Design for Hybrid Question Answering
DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling
CoreSemDB: Benchmarking Hybrid Semantic-Relational Query Processing over Text-Rich Databases
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
The Art of Building Verifiers for Computer Use Agents
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents
CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
Back to the Future: A workbook time machine for spread- sheet creation benchmarks
Many Ways to Be Fake: Benchmarking Fake News Detection Under Strategy-Driven AI Generation
Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection
How Humans and LLMs Read Gender into “Gender-Neutral” Physical Descriptions
From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models Through the lens of Social Relationship
Whose Standpoint do LLMs Reflect? Surfacing and Mitigating Epistemic Blindspots
Lower-Resource, Higher Scores: Language Bias in LLM Evaluators
Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
SCOPE: A Generative Approach for LLM Prompt Compression
Optical Context Compression Is Just (Bad) Autoencoding
SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Workloads
Free(): Learning to Forget in Malloc-Only Reasoning Models
Fork-think with Confidence
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
From Mechanism Discovery to Proposal Closure: Graph-Grounded Hierarchical Search for Scientific Ideation
CrystalSTAR: Structured Action Orchestration with Trio-Reflection for Constrained Novel Crystal Discovery
MetaSymbO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
AMAT: Automated Multi-Agent Topology Design via Reinforcement Learning
Learning to Comply: Workflow-Grounded Environment Generation for Training Procedurally Compliant Agents
RewardHarness: Learning Human Preferences for Image Editing with Only 100 Demonstrations
PrefPO: Pairwise Preference Prompt Optimization
GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses
Process-Oriented Evaluation of AI-Assisted Scientific Writing
LLMs Corrupt Your Documents When You Delegate
Distributed Attacks in Persistent-State AI Control
Preference Redirection via Attention Concentration: An Attack on Computer Use Agents
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
RELISH: LLM REgression with a Latent Iterative State Head
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification
NI Sampling++: Optimizing Token Order for Fast Discrete Diffusion Sampling with Reinforcement Learning
Mask-Aware Policy Gradients for Diffusion Language Models
Multi-Mask Diffusion Language Models for Few-Step Generation
Dual-Stream Decoding for Accelerated Large Language Models
Trie Automata for Constrained Decoding over Large Finite Sets
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
MURMUR: Cross-Lingual and Multimodal Retrieval-Augmented Reasoning for Open Question Answering in Tamil and Yoruba
Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
Seeing Isn’t Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
Multimodal Language Models Cannot Spot Spatial Inconsistencies
From Plausible to Grounded: Reinforcing Structured Consistency in Video MLLMs
TGIF: Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
Creativity and Hallucinations Share Mechanisms in LLMs
Disentangling MLP Neuron Weights in Vocabulary Space
Arithmetic in the Wild: Llama uses Standard Addition to Reason About Cyclic Concepts
Causal Drawbridges: Characterizing Gradient Blocking of Syntactic Islands in Transformer LMs
Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
Evaluating steering techniques using human similarity judgments
Steering Awareness: Detecting Activation Steering from Within
Steering Instruction Hierarchies at Inference Time
Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?
SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following
COMPASS: Benchmarking Constrained Optimization in LLM Agents
Analysis of Optimality of Large Language Models on Planning Problems
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
KTPO: K-Step Test-Time Policy Optimization for Long- Horizon Discovery
ACTOR-CURATOR: Online Curriculum Learning via Policy Improvement Bandits for RL Post-Training
Self-Evolving Curriculum for LLM Reasoning
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
Beyond Distribution Sharpening: The Importance of Task Rewards
From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering
Round-trip Reinforcement Learning: Self-Consistent Training for Better Chemical LLMs
CONCORD: Label-Free Calibration of Verbalized LLM Confidence via Rollout Consistency
PAM: Training Moderation Filters from Policy-Derived Supervision
Quality of Rejections Matters: Preference Data Construction for Faithful Summarization
Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM Storytelling
From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs
SWE-chat: Coding Agent Interactions From Real Users in the Wild
The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
FitText: Evolving Agent Tool Ecologies via Memetic Retrieval
CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target
When RAG Fails to Equalize: Geo-bias in Factual Question Answering over Public Companies
Only Ask What You Don’t Know: Grounded Delta Planning for Efficient Multi-step RAG
RAQE: Reranker-Aligned Query Expansion via Label-Free Group-Relative Policy Optimization
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
ResearcherBench: Evaluating Deep AI Research Systems on Open-ended AI Research Tasks
Sci-VBench: Evaluating Knowledge- and Reasoning- Intensive Video Generation in Science Domains
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
The Shrinking Lifespan of LLMs in Science
The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining
Data-efficient pre-training by scaling synthetic megadocs
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
LM-mixup: Text Data Augmentation via Language Model based Mixup
Extracting Arguments, Not Just Classifying Them: Instruction-Tuned LLMs for Generative Component Detection
Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans
In-Context Examples Suppress Scientific Knowledge Recall in LLMs
Improving Latent Generalization Using Test-time Compute
Language Models That Think, Chat Better
Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking
Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond
Are Latent Reasoning Models Easily Interpretable?
Grounding latent algorithm routing in transformer reasoning
LLM Router: Rethinking Routing with Prefill Activations
No Single Best Model for Diversity: Learning a Router for Sample Diversity
Routing Entropy: A Hidden Self-Verifier for Free in Mixture-of-Experts LLMs
Reinforcement Routing for Mixtures of LoRAs in Parameter-Efficient LLM Finetuning
ExpertWeave: Efficiently Serving Expert-Specialized Fine-Tuned Adapters at Scale
Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
The Profit Alignment Problem: How Profit Mandates Induce Alignment Failures in LLMs
Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness
Efficient Safety Alignment of Language Models via Latent Personality Traits
Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence
From Geometry to Behavior: How Instruction Exposure Unlocks Latent Rhetorical Directions in LLMs
Latent Structure of Affective Representations in Large Language Models
Attractor States Emerge in Multi-Turn LLM Conversations
STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
Decoupling Planning and Control for Instructable Agents
Aligning Language Models from User Interactions
Peer-Predictive Self-Training for Language Model Reasoning
Variational Co-Evolution via Reinforcement Learning
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
On Epistemic Diversity in Large Language Models
CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse
Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation
Reasoning Fine-Tuning Induces Persistent Latent Policy States
Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing
A Mirage of Coherence: How Metaphor Impacts Language Models' Discourse Coherence Assessment
Should We be Pedantic About Reasoning Errors in Machine Translation?
MELD: Multilingual Ensemble via Logical Debate
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
LF²AR: Accounting for Layerwise Dynamics to Improve Multimodal Adaptation of Language Models
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor
A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models
Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration
Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning
Uniform Information Density-Based Preference Optimization
A11yn: Aligning LLMs for Web Accessibility-Aware UI Generation
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
GLAZE: A Gaze-Language Benchmark for Grounding Human Gaze on Web User Interfaces
Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation
Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
Comparing Developer and LLM Biases in Code Evaluation
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
Agent Psychometrics: Task-Level Performance Prediction in Agentic Coding Benchmarks
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Constraint decay: The Fragility of LLM Agents in Backend Code Generation
When Correct Patches Become Vulnerable: Red Teaming LLM-Based Program Repair Agents
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
FinHardBench: Can LLMs Generate Latency-Aware Hardware for Financial Computing?
AutoOR: Scalably Post-training LLMs to Autoformulate Operations Research Problems
Routesplain: Towards Faithful and Intervenable Routing for Software-related Tasks
SkillRouter: Skill Routing for LLM Agents at Scale
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
EvoSkill: Automated Skill Discovery for Multi-Agent Systems
FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
Dr. Zero: Self-Evolving Search Agents without Training Data
AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback
Neural Architecture Discovery via Autonomous Evolution
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
EvoX: Meta-Evolution for Automated Discovery
EvoLen: Evolution-Guided Tokenization for DNA Language Model
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
Structure Before Collapse: Transient Semantic Geometry in Next-Token Prediction
Why Your Prompt Compressor Is Deleting the Wrong Tokens: An Information-Theoretic Diagnosis
Understanding Calibration and Truncation Error Propagation in Training-Free Low-Rank Compression for LLMs
CeRA: Breaking the Linear Ceiling of Low-Rank Adaptation with Non-linearity Retained at Inference
Super Weights in LLMs and the Failure of Selective Training
Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
Direct Multi-Token Decoding
Accelerating Speculative Decoding with Block Diffusion Draft Trees
FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents
BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases
DeepScholar-Bench: A Live Benchmark for Automated Evaluation of Generative Research Synthesis
WebReal: Benchmarking DeepSearch Agents on Real-world User Information Needs
Towards Comprehensive Mobile Application Testing for User-centric Feature Coverage via Simulating Real-World Users with Personas
CocoaBench: Evaluating unified digital agents in the wild
AlphaEval: Evaluating Agents in Production
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis
PM-Bench: Evaluating Prospective Memory of LLM Agents
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
MT-PINGEVAL: Evaluating Multi-Turn Collaboration with Private Information Games
AI Assistance Reduces Persistence and Hurts Independent Performance
Verbalizing LLMs' assumptions to explain and control sycophancy
Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks
Synthetic Sandbox for Training ML Engineering Agents
TritonRL: Training LLMs to Think and Code Triton Without Cheating
Quasar: A Programming Language Specialized for LLM Code Actions
MetaLint: Easy-to-Hard Generalization for Code Linting
MAPLE: Metadata Augmented Private Language Evolution
PolicyLong: Towards On-Policy Context Extension
Reflective Context Learning: Studying the Optimization Primitives of Context Space
Awakening the Sleeping Agent: Lean-Specific Agentic Data Reactivates General Tool Use in Goedel Prover
Recovering Wasted Compute in Autoresearch Agents
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
Prescriptive Scaling Laws for Data Constrained Training
The Finetuner’s Fallacy: When to Pretrain with Your Finetuning Data
Domain-Aware Scaling Laws Uncover Data Synergy
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
Do Language Models Consistently Encode the Current Year?
Studying the Soupability of Documents in State Space Models
Message Passing Enables Efficient Reasoning
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
Disentangling the Expressivity of RoPE
Compliments to the Complementizer: Indirect Routing of Syntactic Structure in a Transformer Language Model
Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge
KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA
Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Differentially Private
Evaluating the Retrieval Robustness of Large Language Models
Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation
QualAlign: Benchmarking Automated Qualitative Coding Against Human Schemas
How social context shapes value-related content in Large Language Model outputs
Ideological Bias in LLMs’ Economic Causal Reasoning
Illusory Truth or Mere Exposure? Model-Dependent Repetition Effects in LLM-Based Social Media Simulations
Incentive-Aware Multi-Fidelity Optimization for Generative Advertising in Large Language Models
SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation
What do your logits know?
Attr-Kit: An Efficient Toolkit for No-Decode Source Attribution
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs
Quantization-Robust Unlearning through the Lens of Retain-Forget Loss Landscapes Interaction
Extracting memorized pieces of (copyrighted) books from open-weight language models
Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space
Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors
Detecting Safety Violations Across Many Agent Traces
Training Agents to Self-Report Misbehavior
Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents
BrowseSafe: Understanding and Detecting Prompt Injection Within AI Browser Agents
CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization
Extended to Reality: Prompt Injection in 3D Environments
Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets
TRUST: A Crowdsourcing Framework for Auditing Large Language Model Reasoning
Auditing Moderation Robustness Under Realistic Settings
Back to Basics: Revisiting ASR in the Age of Voice Agents
SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
When Prompts Interact: Assessing Prompt Arithmetic for Deconfounding under Distribution Shift
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
Lost in Distraction: LLM Planning Agents Recognize but Fail to Utilize Relevant Information under Context Noise
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension
Gecko: An Efficient Neural Architecture Inherently Processing Sequences with Arbitrary Lengths
MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution
DepthSSD: Rethinking Residual Connections via State Space Models on the Depth Axis
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference
SPEED: Specialized Position Experts for Efficient Speculative Decoding
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
Statistically-Lossless Quantization of Large Language Models
NIRVANA: Structured Pruning Reimagined for Large Language Model Compression
OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation
Principled and Scalable Diversity-Aware Retrieval via Cardinality-Constrained Binary Quadratic Programming
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision–Language Models
Opusanimation: Code-based dynamic chart generation
Co-Director: Agentic Generative Video Storytelling
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
Voice of Reason: Reinforcement Learning for Spoken Math
Do We Need Frontier Models to Verify Mathematical Proofs?
Ill-Defined Math: Benchmarking LLM Reasoning Beyond Well-Defined Problems
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics
Grammatical ``grandmother neurons'' are rare in LLMs
Vocabulary embeddings organize linguistic structure early in language model training
Lost in Backpropagation: The LM Head is a Gradient Bottleneck
BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs
REFRAMED: Towards Realistic Audio Description Generation for Movies
TIDES: A Longitudinal Bilingual Dataset for Modeling Multi-Party Social Dynamics
MoltNet: Understanding Social Behavior of AI Agents in the Agent-Native MoltBook
CooperBench: Why coding agents cannot be your teammates yet
When Does Personality Composition Matter for Multi-Agent LLM Teams?
High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination
Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
“I Didn’t Make the Micro Decisions”: Measuring, Inducing, and Exposing Goal-Level AI Contributions in Collaboration
CCBench: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries
In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
MolDesignBench: Evaluating LLM-based Agent for Scenario- grounded Molecular Design
RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning
Can Coding Agents Reproduce Findings in Computational Materials Science?
Stargazer: A Scalable Model-fitting Benchmark Environment for AI Agents under Astrophysical Constraints
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
Agent Alpha: Unifying Generation, Exploration and Evaluation via Tree Search for Computer-Use Solution Discovery
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum
Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge
TierMem: Balancing Compressed Memory and Raw Evidence for Long-Horizon Agent Memory
Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression
Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought
Fractured Chain-of-Thought Reasoning
Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models
TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint
Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
OpenStamp: A Watermark for Open-Source Language Models
Semantic Differentiation for Tackling Challenges in Watermarking Low-Entropy Constrained Generation Outputs
Human vs Machine Translation Detection: A Cross-Model, Cross-Domain, and Low-Resource Analysis
We Hebben Een Serieus Translatie: Modeling Intercomprehension as Probabilistic Inference
PromptNCE: Conditional Probabilities and PMI Using Only LLMs and Contrastive Estimation Prompts
Understanding In-context Learning of Addition via Activation Subspaces
Reasoning Models Know What’s Important, and Encode It in Their Activations
Component and Dimension Sparsity in Transformer Refusal Mechanisms
Prism-Δ: Differential Subspace Steering for Prompt Highlighting in Large Language Models
Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization
Model Merging via Data-Free Covariance Estimation
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization
Learning Reusable Program Transformations via LLM-Guided Rule Synthesis
Models Can Model, But Can’t Bind: Structured Grounding in Text-to-Optimization
The Format Tax: Separating the Cost of Requesting Structure from the Cost of Enforcing It
Syntax Without Semantics: Teaching LLMs to Code in an Unseen Language
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
MoANT: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning
MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
PreMoE: Proactive Inference for Efficient Mixture-of-Experts
Path-Constrained Mixture-of-Experts
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models
Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks
Mitigating LLM biases toward spurious social contexts using direct preference optimization
WorldPM: Scaling Human Preference Modeling via Real-World Feedback
Beyond expert users: agents should help users construct preferences, not just elicit them
Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation
LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional Writers
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
INSIDE the Student’s Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning
Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
Stabilizing Off-Policy Training for Long-Horizon LLM Agents via Turn-Level Importance Sampling and Clipping-Triggered Normalization
Towards Full Pipeline FP8 Reinforcement Learning for LLMs
Safe Inference-Time Alignment via Lagrangian Reward Augmentation
RL-VLA^3: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
ExpRL: Exploratory RL for LLM Mid-Training
Diversity or Precision? A Deep Dive into Next Token Prediction
Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
Token-Level Control or Just a Better Mean? Isolating the Gains of Adaptive Decoding
Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport
Curriculum Learning as Transport: Understanding Curricula with Wasserstein Geodesics
Understanding Machine Unlearning Through the Lens of Mode Connectivity
On the Impossibility of Retrain Equivalence in Machine Unlearning
LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning
MoRFI: Monotonic Sparse Autoencoder Feature Identification
UNMASK Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs
The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
CoVLA: Vision-Language Alignment with Fewer Vision Tokens
EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation
Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
EvoSkillBank: Hierarchical Skill Self-Evolution and Skill-Bank Governance for Continual Agent Learning
Toward Scalable Terminal Task Synthesis via Skill Graphs
Budget-Aware Tool Use Enables Effective Agent Scaling
Thought-Level Beam Search for Reasoning
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
Improved Robustness against Indirect Prompt Injection Can Be Built into LLMs
Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
MEMENTO: Teaching LLMs to Manage Their Context
What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks
Introspective Diffusion Language Models