TSR · The desk
Science · 4 September 2026
Articles in this category in 4 September 2026.
TSR Desk · science · 4 September 2026, 19:01 UTC
FADTI: Fourier and Attention Driven Diffusion for Multivariate Time Series ImputationTSR Desk · science · 4 September 2026, 19:01 UTC
LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous DrivingTSR Desk · science · 4 September 2026, 19:01 UTC
Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus HumanTSR Desk · science · 4 September 2026, 19:01 UTC
MasterControl Seventeen Every TimeTSR Desk · science · 4 September 2026, 19:01 UTC
Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUITSR Desk · science · 4 September 2026, 19:01 UTC
More Criticism Does Not Make a Better Review: EquiReview-RTSR Desk · science · 4 September 2026, 19:01 UTC
Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
IRWOZ 2.0: A Large Language Model-driven Dialogue Dataset for Industrial Robot ConversationsTSR Desk · science · 4 September 2026, 19:01 UTC
Caught in the Story: Narrative Captivity in Multi-turn LLMs ConversationTSR Desk · science · 4 September 2026, 19:01 UTC
Beyond BLEU: A Case for Redefining Sign Language Translation BenchmarksTSR Desk · science · 4 September 2026, 19:01 UTC
Plan Pointers and Record-Directive Form in Budgeted Verification of Inherited Agent MemoryTSR Desk · science · 4 September 2026, 19:01 UTC
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?TSR Desk · science · 4 September 2026, 19:01 UTC
ObserverBench: Testing Mechanistic Estimates for Intervention and ControlTSR Desk · science · 4 September 2026, 19:01 UTC
Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix ThemTSR Desk · science · 4 September 2026, 19:01 UTC
TabScope: Question-Adaptive Scope Selection for Table Question AnsweringTSR Desk · science · 4 September 2026, 19:01 UTC
Pattern Over-Generalization of Knowledge Graph EmbeddingTSR Desk · science · 4 September 2026, 19:01 UTC
Scientific Agent Skills: A Library of Procedural Knowledge for Research AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement LearningTSR Desk · science · 4 September 2026, 19:01 UTC
ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake DetectionTSR Desk · science · 4 September 2026, 19:01 UTC
SVG-Score: Human-Aligned Evaluation of Text-to-SVG GenerationTSR Desk · science · 4 September 2026, 19:01 UTC
Toward Collective-Centric Evaluation of Preference Inference for Participatory DemocracyTSR Desk · science · 4 September 2026, 19:01 UTC
Structure and Implementation of New Practical English Textbooks Driven by ArtificialTSR Desk · science · 4 September 2026, 19:01 UTC
GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis AcrossTSR Desk · science · 4 September 2026, 19:01 UTC
Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient HierarchicalTSR Desk · science · 4 September 2026, 19:01 UTC
Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye MapsTSR Desk · science · 4 September 2026, 19:01 UTC
LongCounsel-8: A Benchmark Suite for Longitudinal Depression Tracking from Multi-SessionTSR Desk · science · 4 September 2026, 19:01 UTC
CASCADE: A Component Ablation and Corpus Audit of a Layered Local Defense for MCP-Based SystemsTSR Desk · science · 4 September 2026, 19:01 UTC
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a HybridTSR Desk · science · 4 September 2026, 19:01 UTC
DNative-Twin: Decision Graphs and Digital Twins for Reconstructable Agentic DecisionsTSR Desk · science · 4 September 2026, 19:01 UTC
LDC: Learning to Generate Research Idea with Dynamic ControlTSR Desk · science · 4 September 2026, 19:01 UTC
HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer ReviewsTSR Desk · science · 4 September 2026, 19:01 UTC
IndicSafeEval: Safety Robustness of Large Language Models under Multilingual PersuasiveTSR Desk · science · 4 September 2026, 19:01 UTC
CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary ReasoningTSR Desk · science · 4 September 2026, 19:01 UTC
Towards Numerical TOHTN Planning with SMT-based HTN-SAT EncodingTSR Desk · science · 4 September 2026, 19:01 UTC
Interface-Induced Trajectory CensoringTSR Desk · science · 4 September 2026, 19:01 UTC
Rethinking On-Policy Distillation of Large Language Models II: One Training ExampleTSR Desk · science · 4 September 2026, 19:01 UTC
Symmetries and Causality: Causal Effect Identification Beyond IID DataTSR Desk · science · 4 September 2026, 19:01 UTC
Reflect-SQL: A Self-Reflection Based Framework for Text-to-SQLTSR Desk · science · 4 September 2026, 19:01 UTC
PeroMAS: A Multi-agent System of Perovskite Material DiscoveryTSR Desk · science · 4 September 2026, 19:01 UTC
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker DistillationTSR Desk · science · 4 September 2026, 19:01 UTC
MIRA: A Bilingual Benchmark for Medical Information Response AuditTSR Desk · science · 4 September 2026, 19:01 UTC
ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding RetrievalTSR Desk · science · 4 September 2026, 19:01 UTC
ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?TSR Desk · science · 4 September 2026, 19:01 UTC
Measuring Harmfulness of Computer-Using AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models viaTSR Desk · science · 4 September 2026, 19:01 UTC
SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy DetectionTSR Desk · science · 4 September 2026, 19:01 UTC
KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM AgentsTSR Desk · science · 4 September 2026, 19:01 UTC
Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of LearningTSR Desk · science · 4 September 2026, 19:01 UTC
Beyond Reproducibility: Towards Security-Aware Evaluation of Research ArtifactsTSR Desk · science · 4 September 2026, 19:01 UTC
STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever forTSR Desk · science · 4 September 2026, 19:01 UTC
SHELF: A Synthetic Harness for Multi-Task Bibliographic BenchmarkingTSR Desk · science · 4 September 2026, 19:01 UTC
WIDE: Wildcard Inference with Dynamic Expansion for Cross-Modal Generative RetrievalTSR Desk · science · 4 September 2026, 19:01 UTC
ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models ImprovesTSR Desk · science · 4 September 2026, 19:01 UTC
Investigating the Ability of Large Language Models to Analyze Recipes for DiabetesTSR Desk · science · 4 September 2026, 19:01 UTC
FailBench: How Reliable are VLMs at Judging Robot Task Success?TSR Desk · science · 4 September 2026, 19:01 UTC
Enhancing Financial Question Answering: A Novel Benchmark Dataset of Banks' financial statementsTSR Desk · science · 4 September 2026, 19:01 UTC
InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with MultimodalTSR Desk · science · 4 September 2026, 19:01 UTC
Relational Linearity is a Predictor of HallucinationsTSR Desk · science · 4 September 2026, 19:01 UTC
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models