TSR · The desk
Science · 9 September 2026
Articles in this category in 9 September 2026.
TSR Desk · science · 9 September 2026, 07:00 UTC
When Can LLM Digital Twins Reduce Human Measurement? From Behavioral Fidelity to StatisticalTSR Desk · science · 9 September 2026, 07:00 UTC
GeoContext: One Context Ladder, Two Failure Modes in Vision-Language Geolocation: Flat RelianceTSR Desk · science · 9 September 2026, 07:00 UTC
Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM BenchmarksTSR Desk · science · 9 September 2026, 07:00 UTC
SWE-Test: Benchmarking LLM Vulnerability Discovery via Input PredictionTSR Desk · science · 9 September 2026, 07:00 UTC
AgentIdeaBench: Benchmarking Scientific Ideation in the Agent EraTSR Desk · science · 9 September 2026, 07:00 UTC
ProcArena: A Multi-Scenario Benchmark for LLMs on Direct and Interactive PL/SQL DevelopmentTSR Desk · science · 9 September 2026, 07:00 UTC
Explainable Deep Learning for Price-Trade Dynamics: From Black-Box Forecasts to EffectiveTSR Desk · science · 9 September 2026, 07:00 UTC
When Intelligence Becomes Agency: A Theory of Governed, Proactive Agency for Symbiotic AITSR Desk · science · 9 September 2026, 07:00 UTC
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language ModelsTSR Desk · science · 9 September 2026, 07:00 UTC
How AI Models Manage Epistemic Authority: A Taxonomy and Comparative Analysis of Responses toTSR Desk · science · 9 September 2026, 07:00 UTC
Models That Know How Evaluations Are Designed Score SaferTSR Desk · science · 9 September 2026, 07:00 UTC
PiMRef: Deducing Ever-evolving Spear-phishing Emails with Knowledge Base InvariantsTSR Desk · science · 9 September 2026, 07:00 UTC
Robust Metaheuristics under Uncertainty for Berth Allocation and Quay Crane Assignment: A ReviewTSR Desk · science · 9 September 2026, 07:00 UTC
Beyond Top-$k$ Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents