TSR · The desk
Science · 24 September 2026
Articles in this category in 24 September 2026.
TSR Desk · science · 24 September 2026, 01:00 UTC
WebArxiv: A Reproducible Benchmark for Evaluating Multimodal Web Agents on arXiv TasksTSR Desk · science · 24 September 2026, 01:00 UTC
RankCert: When Can Simulated Learners Safely Select an AI Tutor? Robust Decision CertificationTSR Desk · science · 24 September 2026, 01:00 UTC
eXplaining to Learn (eX2L): Regularization Using Contrastive Visual Explanation Pairs forTSR Desk · science · 24 September 2026, 01:00 UTC
Refusal without Discrimination: What Encoded Prompts Do to Safety-Trained ModelsTSR Desk · science · 24 September 2026, 01:00 UTC
Queer inclusion in speech datasets: An audit and taxonomy of practical tensionsTSR Desk · science · 24 September 2026, 01:00 UTC
Agent Memory: Characterization and System Implications of Stateful Long-Horizon WorkloadsTSR Desk · science · 24 September 2026, 01:00 UTC
FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLMTSR Desk · science · 24 September 2026, 01:00 UTC
EADC: Evaluation of Advanced and Deep-level Compliance in Large Language ModelsTSR Desk · science · 24 September 2026, 01:00 UTC
Testing-Driven Reliability Audit of Trajectory-Based Early Outcome Prediction for LLM Agents:TSR Desk · science · 24 September 2026, 01:00 UTC
The Delegation Blind Spot: Auditing Product Decisions from Agent ChoicesTSR Desk · science · 24 September 2026, 01:00 UTC
Terminal Shrinkage Averaging Reveals a Schedule-Estimator Interaction in LLM PretrainingTSR Desk · science · 24 September 2026, 01:00 UTC
Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist AgentsTSR Desk · science · 24 September 2026, 01:00 UTC
Passes Alone, Fails Together: Benchmarking Semantic Coordination in Parallel LLM-Agent