TSR · The desk
Science · 29 September 2026
Articles in this category in 29 September 2026.
TSR Desk · science · 29 September 2026, 01:00 UTC
Attribution Bias in Large Language ModelsTSR Desk · science · 29 September 2026, 01:00 UTC
From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-TrainingTSR Desk · science · 29 September 2026, 01:00 UTC
Backbone-Adaptive Evidence Routing for Robust Pairwise LLM JudgingTSR Desk · science · 29 September 2026, 01:00 UTC
Towards Unified Dynamic Face Landmark DetectionTSR Desk · science · 29 September 2026, 01:00 UTC
A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and ActivationTSR Desk · science · 29 September 2026, 01:00 UTC
Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly DetectionTSR Desk · science · 29 September 2026, 01:00 UTC
Robust to Which Model Change? A Unified Evaluation of Robust Counterfactual ExplanationsTSR Desk · science · 29 September 2026, 01:00 UTC
AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty AlignmentTSR Desk · science · 29 September 2026, 01:00 UTC
UltraG-Bench: A Multi-task Benchmark for assessing Large Vision-Language Models on Pixel-levelTSR Desk · science · 29 September 2026, 01:00 UTC
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game TheoryTSR Desk · science · 29 September 2026, 01:00 UTC
PriceBench: A Diagnostic Benchmark for Price, Quality, and Brand Preferences in LLM BookingTSR Desk · science · 29 September 2026, 01:00 UTC
BabelCoder: Agentic Code Translation with Specification AlignmentTSR Desk · science · 29 September 2026, 01:00 UTC
BioEVAL: A global, multi-institutional benchmark of large language and multimodal models forTSR Desk · science · 29 September 2026, 01:00 UTC
SciR: A Controllable Benchmark for Scientific Reasoning in LLMsTSR Desk · science · 29 September 2026, 01:00 UTC
Governed Deduction: Policy-Grounded Premise Authorization Beyond Relevance