<?xml version='1.0' encoding='utf-8'?>
<dblpsubmission><xml version="1.0" encoding="UTF-8" /><doctype>&lt;!DOCTYPE dblpsubmission SYSTEM "https://dblp.org/xml/subm/dblpsubmission.dtd"&gt;</doctype><proceedings><editor>Philip S. Thomas, Feryal Behbahani, Glen Berseth, Scott M. Jordan, Scott Niekum, Andrew Patterson, Eugene Vinitsky, Adam White, Martha White, Amy Zhang</editor><title>Reinforcement Learning Journal (RLJ)</title><publisher>RLJ</publisher><year>2024</year><isbn type="print">979-8-218-41163-3</isbn><url>https://rlj.cs.umass.edu/</url><issn type="print">2996-8569</issn><issn type="electronic">2996-8577</issn><publ><author>Max Olan Smith;Michael P. Wellman</author><title>Co-Learning Empirical Games &amp; World Models</title><pages>1-15</pages><volume>1</volume></publ><publ><author>Woojin Jeong;Seungki Min</author><title>Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits</title><pages>16-28</pages><volume>1</volume></publ><publ><author>Shuang Wu;Arash A. Amini</author><title>Graph Neural Thompson Sampling</title><pages>29-63</pages><volume>1</volume></publ><publ><author>Junxiong Wang;Kaiwen Wang;Yueying Li;Nathan Kallus;Immanuel Trummer;Wen Sun</author><title>JoinGym: An Efficient Join Order Selection Environment</title><pages>64-91</pages><volume>1</volume></publ><publ><author>Antonin Raffin;Olivier Sigaud;Jens Kober;Alin Albu-Schaeffer;João Silvério;Freek Stulp</author><title>An Open-Loop Baseline for Reinforcement Learning Locomotion Tasks</title><pages>92-107</pages><volume>1</volume></publ><publ><author>Raphaël Avalos;Eugenio Bargiacchi;Ann Nowe;Diederik Roijers;Frans A Oliehoek</author><title>Online Planning in POMDPs with State-Requests</title><pages>108-129</pages><volume>1</volume></publ><publ><author>Abdulaziz Almuzairee;Nicklas Hansen;Henrik I Christensen</author><title>A Recipe for Unbounded Data Augmentation in Visual Reinforcement Learning</title><pages>130-157</pages><volume>1</volume></publ><publ><author>Robert J. Moss;Anthony Corso;Jef Caers;Mykel Kochenderfer</author><title>BetaZero: Belief-State Planning for Long-Horizon POMDPs using Learned Approximations</title><pages>158-181</pages><volume>1</volume></publ><publ><author>Audrey Huang;Mohammad Ghavamzadeh;Nan Jiang;Marek Petrik</author><title>Non-adaptive Online Finetuning for Offline Reinforcement Learning</title><pages>182-197</pages><volume>1</volume></publ><publ><author>Nicholas E. Corrado;Yuxiao Qu;John U. Balis;Adam Labiosa;Josiah P. Hanna</author><title>Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning</title><pages>198-215</pages><volume>1</volume></publ><publ><author>Michael Lu;Matin Aghaei;Anant Raj;Sharan Vaswani</author><title>Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs</title><pages>216-282</pages><volume>1</volume></publ><publ><author>Benjamin Freed;Thomas Wei;Roberto Calandra;Jeff Schneider;Howie Choset</author><title>Unifying Model-Based and Model-Free Reinforcement Learning with Equivalent Policy Sets</title><pages>283-301</pages><volume>1</volume></publ><publ><author>Noah Golowich;Ankur Moitra</author><title>The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation</title><pages>302-341</pages><volume>1</volume></publ><publ><author>Max Rudolph;Caleb Chuck;Kevin Black;Misha Lvovsky;Scott Niekum;Amy Zhang</author><title>Learning Action-based Representations Using Invariance</title><pages>342-365</pages><volume>1</volume></publ><publ><author>Oliver Järnefelt;Mahdi Kallel;Carlo D'Eramo</author><title>Cyclicity-Regularized Coordination Graphs</title><pages>366-379</pages><volume>1</volume></publ><publ><author>Aditya Kapoor;Benjamin Freed;Jeff Schneider;Howie Choset</author><title>Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization</title><pages>380-399</pages><volume>1</volume></publ><publ><author>Quentin Delfosse;Jannis Blüml;Bjarne Gregori;Sebastian Sztwiertnia;Kristian Kersting</author><title>OCAtari: Object-Centric Atari 2600 Reinforcement Learning Environments</title><pages>400-449</pages><volume>1</volume></publ><publ><author>Jacob Beck;Matthew Thomas Jackson;Risto Vuorio;Zheng Xiong;Shimon Whiteson</author><title>SplAgger: Split Aggregation for Meta-Reinforcement Learning</title><pages>450-469</pages><volume>1</volume></publ><publ><author>Nan Jiang;Jinzhao Li;Yexiang Xue</author><title>A Tighter Convergence Proof of Reverse Experience Replay</title><pages>470-480</pages><volume>1</volume></publ><publ><author>Qingfeng Lan;A. Rupam Mahmood;Shuicheng YAN;Zhongwen Xu</author><title>Learning to Optimize for Reinforcement Learning</title><pages>481-497</pages><volume>2</volume></publ><publ><author>Mhairi Dunion;Stefano V Albrecht</author><title>Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras</title><pages>498-515</pages><volume>2</volume></publ><publ><author>Trevor McInroe;Adam Jelley;Stefano V Albrecht;Amos Storkey</author><title>Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning</title><pages>516-546</pages><volume>2</volume></publ><publ><author>Adriana Hugessen;Roger Creus Castanyer;Faisal Mohamed;Glen Berseth</author><title>Surprise-Adaptive Intrinsic Motivation for Unsupervised Reinforcement Learning</title><pages>547-562</pages><volume>2</volume></publ><publ><author>Alex Ayoub;David Szepesvari;Francesco Zanini;Bryan Chan;Dhawal Gupta;Bruno Castro da Silva;Dale Schuurmans</author><title>Mitigating the Curse of Horizon in Monte-Carlo Returns</title><pages>563-572</pages><volume>2</volume></publ><publ><author>Yudong Luo;Yangchen Pan;Han Wang;Philip Torr;Pascal Poupart</author><title>A Simple Mixture Policy Parameterization for Improving Sample Efficiency of CVaR Optimization</title><pages>573-592</pages><volume>2</volume></publ><publ><author>Gersi Doko;Guang Yang;Daniel S. Brown;Marek Petrik</author><title>ROIL: Robust Offline Imitation Learning without Trajectories</title><pages>593-605</pages><volume>2</volume></publ><publ><author>Edan Jacob Meyer;Adam White;Marlos C. Machado</author><title>Harnessing Discrete Representations for Continual Reinforcement Learning</title><pages>606-628</pages><volume>2</volume></publ><publ><author>David Abel;Mark K Ho;Anna Harutyunyan</author><title>Three Dogmas of Reinforcement Learning</title><pages>629-644</pages><volume>2</volume></publ><publ><author>Matteo Papini;Giorgio Manganini;Alberto Maria Metelli;Marcello Restelli</author><title>Policy Gradient with Active Importance Sampling</title><pages>645-675</pages><volume>2</volume></publ><publ><author>Riccardo Zamboni;Duilio Cirino;Marcello Restelli;Mirco Mutti</author><title>The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough</title><pages>676-692</pages><volume>2</volume></publ><publ><author>Zakariae EL ASRI;Olivier Sigaud;Nicolas THOME</author><title>Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning</title><pages>693-713</pages><volume>2</volume></publ><publ><author>Ho Long Fung;Victor-Alexandru Darvariu;Stephen Hailes;Mirco Musolesi</author><title>Trust-based Consensus in Multi-Agent Reinforcement Learning Systems</title><pages>714-732</pages><volume>2</volume></publ><publ><author>Yu Luo;Fuchun Sun;Tianying Ji;Xianyuan Zhan</author><title>Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies</title><pages>733-762</pages><volume>2</volume></publ><publ><author>Gaspard Lambrechts;Adrien Bolland;Damien Ernst</author><title>Informed POMDP: Leveraging Additional Information in Model-Based RL</title><pages>763-784</pages><volume>2</volume></publ><publ><author>Sam Lobel;Ronald Parr</author><title>An Optimal Tightness Bound for the Simulation Lemma</title><pages>785-797</pages><volume>2</volume></publ><publ><author>Milad Aghajohari;Tim Cooijmans;Juan Agustin Duque;Shunichi Akatsuka;Aaron Courville</author><title>Best Response Shaping</title><pages>798-818</pages><volume>2</volume></publ><publ><author>Gianluca Drappo;Alberto Maria Metelli;Marcello Restelli</author><title>A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning</title><pages>819-839</pages><volume>2</volume></publ><publ><author>Khurram Javed;Arsalan Sharifnassab;Richard S. Sutton</author><title>SwiftTD: A Fast and Robust Algorithm for Temporal Difference Learning</title><pages>840-863</pages><volume>2</volume></publ><publ><author>Scott M. Jordan;Samuel Neumann;James E. Kostas;Adam White;Philip S. Thomas</author><title>The Cliff of Overcommitment with Policy Gradient Step Sizes</title><pages>864-883</pages><volume>2</volume></publ><publ><author>Alexander Levine;Peter Stone;Amy Zhang</author><title>Multistep Inverse Is Not All You Need</title><pages>884-925</pages><volume>2</volume></publ><publ><author>Emma Cramer;Bernd Frauenknecht;Ramil Sabirov;Sebastian Trimpe</author><title>Contextualized Hybrid Ensemble Q-learning: Learning Fast with Control Priors</title><pages>926-945</pages><volume>2</volume></publ><publ><author>Rohan Chitnis;Shentao Yang;Alborz Geramifard</author><title>Sequential Decision-Making for Inline Text Autocomplete</title><pages>946-960</pages><volume>2</volume></publ><publ><author>Georgy Antonov;Peter Dayan</author><title>Exploring Uncertainty in Distributional Reinforcement Learning</title><pages>961-978</pages><volume>2</volume></publ><publ><author>Marcel Hussing;Jorge Mendez-Mendez;Anisha Singrodia;Cassandra Kent;Eric Eaton</author><title>Robotic Manipulation Datasets for Offline Compositional Reinforcement Learning</title><pages>979-994</pages><volume>2</volume></publ><publ><author>Marcel Hussing;Claas A Voelcker;Igor Gilitschenski;Amir-massoud Farahmand;Eric Eaton</author><title>Dissecting Deep RL with High Update Ratios: Combatting Value Divergence</title><pages>995-1018</pages><volume>2</volume></publ><publ><author>Brett Daley;Marlos C. Machado;Martha White</author><title>Demystifying the Recency Heuristic in Temporal-Difference Learning</title><pages>1019-1036</pages><volume>3</volume></publ><publ><author>Johan Samir Obando Ceron;João Guilherme Madeira Araújo;Aaron Courville;Pablo Samuel Castro</author><title>On the consistency of hyper-parameter selection in value-based deep reinforcement learning</title><pages>1037-1059</pages><volume>3</volume></publ><publ><author>Frieda Rong;Max Kleiman-Weiner</author><title>Value Internalization: Learning and Generalizing from Social Reward</title><pages>1060-1071</pages><volume>3</volume></publ><publ><author>Timon Willi;Johan Samir Obando Ceron;Jakob Nicolaus Foerster;Gintare Karolina Dziugaite;Pablo Samuel Castro</author><title>Mixture of Experts in a Mixture of RL settings</title><pages>1072-1105</pages><volume>3</volume></publ><publ><author>Davide Corsi;Davide Camponogara;Alessandro Farinelli</author><title>Aquatic Navigation: A Challenging Benchmark for Deep Reinforcement Learning</title><pages>1106-1123</pages><volume>3</volume></publ><publ><author>Cyrus Cousins;Kavosh Asadi;Elita Lobo;Michael Littman</author><title>On Welfare-Centric Fair Reinforcement Learning</title><pages>1124-1137</pages><volume>3</volume></publ><publ><author>Jiayu Yao;Weiwei Pan;Finale Doshi-Velez;Barbara E Engelhardt</author><title>Inverse Reinforcement Learning with Multiple Planning Horizons</title><pages>1138-1167</pages><volume>3</volume></publ><publ><author>Yixuan Zhang;Qiaomin Xie</author><title>Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation</title><pages>1168-1210</pages><volume>3</volume></publ><publ><author>Haque Ishfaq;Yixin Tan;Yu Yang;Qingfeng Lan;Jianfeng Lu;A. Rupam Mahmood;Doina Precup;Pan Xu</author><title>More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling</title><pages>1211-1235</pages><volume>3</volume></publ><publ><author>Qining Zhang;Honghao Wei;Lei Ying</author><title>Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis</title><pages>1236-1251</pages><volume>3</volume></publ><publ><author>Kevin Tan;Ziping Xu</author><title>A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage</title><pages>1252-1264</pages><volume>3</volume></publ><publ><author>Zhiyuan Zhou;Shreyas Sundara Raman;Henry Sowerby;Michael Littman</author><title>Tiered Reward: Designing Rewards for Specification and Fast Learning of Desired Behavior</title><pages>1265-1288</pages><volume>3</volume></publ><publ><author>Bin Hu;Chenyang Zhao;Pu Zhang;Zihao Zhou;Yuanhang Yang;Zenglin Xu;Bin Liu</author><title>Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning Approach</title><pages>1289-1305</pages><volume>3</volume></publ><publ><author>Kris De Asis;Richard S. Sutton</author><title>An Idiosyncrasy of Time-discretization in Reinforcement Learning</title><pages>1306-1316</pages><volume>3</volume></publ><publ><author>Sai Prasanna;Karim Farid;Raghu Rajan;André Biedenkapp</author><title>Dreaming of Many Worlds: Learning Contextual World Models aids Zero-Shot Generalization</title><pages>1317-1350</pages><volume>3</volume></publ><publ><author>Tetsuro Morimura;Kazuhiro Ota;Kenshi Abe;Peinan Zhang</author><title>Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes</title><pages>1351-1376</pages><volume>3</volume></publ><publ><author>Marin Vlastelica;Jin Cheng;Georg Martius;Pavel Kolev</author><title>Offline Diversity Maximization under Imitation Constraints</title><pages>1377-1409</pages><volume>3</volume></publ><publ><author>Léopold Maytié;Benjamin Devillers;Alexandre Arnold;Rufin VanRullen</author><title>Zero-shot cross-modal transfer of Reinforcement Learning policies through a Global Workspace</title><pages>1410-1426</pages><volume>3</volume></publ><publ><author>Motoki Omura;Takayuki Osa;YUSUKE Mukuta;Tatsuya Harada</author><title>Stabilizing Extreme Q-learning by Maclaurin Expansion</title><pages>1427-1440</pages><volume>3</volume></publ><publ><author>Julian Dierkes;Emma Cramer;Holger Hoos;Sebastian Trimpe</author><title>Combining Automated Optimisation of Hyperparameters and Reward Shape</title><pages>1441-1466</pages><volume>3</volume></publ><publ><author>He Wang;Laixi Shi;Yuejie Chi</author><title>Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes</title><pages>1467-1510</pages><volume>3</volume></publ><publ><author>Raphael Boige;Yannis Flet-Berliac;Lars C.P.M. Quaedvlieg;Arthur Flajolet;Guillaume Richard;Thomas PIERROT</author><title>PASTA: Pretrained Action-State Transformer Agents</title><pages>1511-1532</pages><volume>3</volume></publ><publ><author>Kellen Kanarios;Qining Zhang;Lei Ying</author><title>Cost Aware Best Arm Identification</title><pages>1533-1545</pages><volume>4</volume></publ><publ><author>Kartik Choudhary;Dhawal Gupta;Philip S. Thomas</author><title>ICU-Sepsis: A Benchmark MDP Built from Real Medical Data</title><pages>1546-1566</pages><volume>4</volume></publ><publ><author>Claas A Voelcker;Tyler Kastner;Igor Gilitschenski;Amir-massoud Farahmand</author><title>When does Self-Prediction help? Understanding Auxiliary Tasks in Reinforcement Learning</title><pages>1567-1597</pages><volume>4</volume></publ><publ><author>Changling Li;Zhang-Wei Hong;Pulkit Agrawal;Divyansh Garg;Joni Pajarinen</author><title>ROER: Regularized Optimal Experience Replay</title><pages>1598-1618</pages><volume>4</volume></publ><publ><author>Philipp Becker;Sebastian Mossburger;Fabian Otto;Gerhard Neumann</author><title>Combining Reconstruction and Contrastive Methods for Multimodal Representations in RL</title><pages>1619-1655</pages><volume>4</volume></publ><publ><author>Owen Oertell;Jonathan Daniel Chang;Yiyi Zhang;Kianté Brantley;Wen Sun</author><title>RL for Consistency Models: Reward Guided Text-to-Image Generation with Fast Inference</title><pages>1656-1673</pages><volume>4</volume></publ><publ><author>Miguel Vasco;Takuma Seno;Kenta Kawamoto;Kaushik Subramanian;Peter R. Wurman;Peter Stone</author><title>A Super-human Vision-based Reinforcement Learning Agent for Autonomous Racing in Gran Turismo</title><pages>1674-1710</pages><volume>4</volume></publ><publ><author>Miguel Suau;Matthijs T. J. Spaan;Frans A Oliehoek</author><title>Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL</title><pages>1711-1732</pages><volume>4</volume></publ><publ><author>Rafael Rodriguez-Sanchez;George Konidaris</author><title>Learning Abstract World Models for Value-preserving Planning with Options</title><pages>1733-1758</pages><volume>4</volume></publ><publ><author>Davide Corsi;Guy Amir;Andoni Rodríguez;Guy Katz;César Sánchez;Roy Fox</author><title>Verification-Guided Shielding for Deep Reinforcement Learning</title><pages>1759-1780</pages><volume>4</volume></publ><publ><author>Forest Agostinelli;Misagh Soltani</author><title>Learning Discrete World Models for Heuristic Search</title><pages>1781-1792</pages><volume>4</volume></publ><publ><author>Zhengfei Zhang;Kishan Panaganti;Laixi Shi;Yanan Sui;Adam Wierman;Yisong Yue</author><title>Distributionally Robust Constrained Reinforcement Learning under Strong Duality</title><pages>1793-1821</pages><volume>4</volume></publ><publ><author>Connor Mattson;Anurag Sidharth Aribandi;Daniel S. Brown</author><title>Representation Alignment from Human Feedback for Cross-Embodiment Reward Learning from Mixed-Quality Demonstrations</title><pages>1822-1840</pages><volume>4</volume></publ><publ><author>Gautham Vasan;Yan Wang;Fahim Shahriar;James Bergstra;Martin Jägersand;A. Rupam Mahmood</author><title>Revisiting Sparse Rewards for Goal-Reaching Reinforcement Learning</title><pages>1841-1854</pages><volume>4</volume></publ><publ><author>Matthew Thomas Jackson;Michael Matthews;Cong Lu;Benjamin Ellis;Shimon Whiteson;Jakob Nicolaus Foerster</author><title>Policy-Guided Diffusion</title><pages>1855-1872</pages><volume>4</volume></publ><publ><author>James Staley;Elaine Short;Shivam Goel;Yash Shukla</author><title>Agent-Centric Human Demonstrations Train World Models</title><pages>1873-1886</pages><volume>4</volume></publ><publ><author>Akansha Kalra;Daniel S. Brown</author><title>Can Differentiable Decision Trees Enable Interpretable Reward Learning from Human Feedback?</title><pages>1887-1910</pages><volume>4</volume></publ><publ><author>Wei-Di Chang;Scott Fujimoto;David Meger;Gregory Dudek</author><title>Imitation Learning from Observation through Optimal Transport</title><pages>1911-1923</pages><volume>4</volume></publ><publ><author>Wancong Zhang;Anthony GX-Chen;Vlad Sobal;Yann LeCun;Nicolas Carion</author><title>Light-weight Probing of Unsupervised Representations for Reinforcement Learning</title><pages>1924-1949</pages><volume>4</volume></publ><publ><author>Yuxin Chen;Chen Tang;Thomas Tian;Chenran Li;Jinning Li;Masayoshi Tomizuka;Wei Zhan</author><title>Quantifying Interaction Level Between Agents Helps Cost-efficient Generalization in Multi-agent Reinforcement Learning</title><pages>1950-1964</pages><volume>4</volume></publ><publ><author>Daniel Melcer;Christopher Amato;Stavros Tripakis</author><title>Shield Decomposition for Safe Reinforcement Learning in General Partially Observable Multi-Agent Environments</title><pages>1965-1994</pages><volume>4</volume></publ><publ><author>Abhishek Naik;Yi Wan;Manan Tomar;Richard S. Sutton</author><title>Reward Centering</title><pages>1995-2016</pages><volume>4</volume></publ><publ><author>Jan de Priester;Zachary Bell;Prashant Ganesh;Ricardo Sanfelice</author><title>MultiHyRL: Robust Hybrid RL for Obstacle Avoidance against Adversarial Attacks on the Observation Space</title><pages>2017-2040</pages><volume>4</volume></publ><publ><author>Parham Mohammad Panahi;Andrew Patterson;Martha White;Adam White</author><title>Investigating the Interplay of Prioritized Replay and Generalization</title><pages>2041-2058</pages><volume>5</volume></publ><publ><author>Bram M. Renting;Thomas M. Moerland;Holger Hoos;Catholijn M Jonker</author><title>Towards General Negotiation Strategies with End-to-End Reinforcement Learning</title><pages>2059-2070</pages><volume>5</volume></publ><publ><author>Mark Bedaywi;Amin Rakhsha;Amir-massoud Farahmand</author><title>PID Accelerated Temporal Difference Algorithms</title><pages>2071-2095</pages><volume>5</volume></publ><publ><author>Nadav Amir;Yael Niv;Angela J Langdon</author><title>States as goal-directed concepts: an epistemic approach to state-representation learning</title><pages>2096-2106</pages><volume>5</volume></publ><publ><author>Wanqiao Xu;Shi Dong;Benjamin Van Roy</author><title>Posterior Sampling for Continuing Environments</title><pages>2107-2122</pages><volume>5</volume></publ><publ><author>Armin Karamzade;Kyungmin Kim;Montek Kalsi;Roy Fox</author><title>Reinforcement Learning from Delayed Observations via World Models</title><pages>2123-2139</pages><volume>5</volume></publ><publ><author>Johannes Ackermann;Takayuki Osa;Masashi Sugiyama</author><title>Offline Reinforcement Learning from Datasets with Structured Non-Stationarity</title><pages>2140-2161</pages><volume>5</volume></publ><publ><author>Olivia P. Dizon-Paradis;Stephen E. Wormald;Daniel E. Capecci;Avanti Bhandarkar;Damon L. Woodard</author><title>Resource Usage Evaluation of Discrete Model-Free Deep Reinforcement Learning Algorithms</title><pages>2162-2177</pages><volume>5</volume></publ><publ><author>Rafael Rafailov;Kyle Beltran Hatch;Anikait Singh;Aviral Kumar;Laura Smith;Ilya Kostrikov;Philippe Hansen-Estruch;Victor Kolev;Philip J. Ball;Jiajun Wu;Sergey Levine;Chelsea Finn</author><title>D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning</title><pages>2178-2197</pages><volume>5</volume></publ><publ><author>Mohamed Elsayed;Qingfeng Lan;Clare Lyle;A. Rupam Mahmood</author><title>Weight Clipping for Deep Continual and Reinforcement Learning</title><pages>2198-2217</pages><volume>5</volume></publ><publ><author>Sotetsu Koyamada;Soichiro Nishimori;Shin Ishii</author><title>A Batch Sequential Halving Algorithm without Performance Degradation</title><pages>2218-2232</pages><volume>5</volume></publ><publ><author>Rahul Madhavan;Aurghya Maiti;Gaurav Sinha;Siddharth Barman</author><title>Causal Contextual Bandits with Adaptive Context</title><pages>2233-2263</pages><volume>5</volume></publ><publ><author>Allan Zhou;Vikash Kumar;Chelsea Finn;Aravind Rajeswaran</author><title>Policy Architectures for Compositional Generalization in Control</title><pages>2264-2283</pages><volume>5</volume></publ><publ><author>Philipp Wu;Kourosh Hakhamaneshi;Yuqing Du;Igor Mordatch;Aravind Rajeswaran;Pieter Abbeel</author><title>Semi-Supervised One Shot Imitation Learning</title><pages>2284-2297</pages><volume>5</volume></publ><publ><author>Andrew Patterson;Samuel Neumann;Raksha Kumaraswamy;Martha White;Adam White</author><title>Cross-environment Hyperparameter Tuning for Reinforcement Learning</title><pages>2298-2319</pages><volume>5</volume></publ><publ><author>Daphne Cornelisse;Eugene Vinitsky</author><title>Human-compatible driving agents through data-regularized self-play reinforcement learning</title><pages>2320-2344</pages><volume>5</volume></publ><publ><author>Jeremy McMahan;Young Wu;Yudong Chen;Jerry Zhu;Qiaomin Xie</author><title>Inception: Efficiently Computable Misinformation Attacks on Markov Games</title><pages>2345-2358</pages><volume>5</volume></publ><publ><author>Linfeng Zhao;Lawson L.S. Wong</author><title>Learning to Navigate in Mazes with Novel Layouts using Abstract Top-down Maps</title><pages>2359-2372</pages><volume>5</volume></publ><publ><author>Jacob Adamczyk;Volodymyr Makarenko;Stas Tiomkin;Rahul V Kulkarni</author><title>Boosting Soft Q-Learning by Bounding</title><pages>2373-2399</pages><volume>5</volume></publ><publ><author>Hassan SABER;Odalric-Ambrym Maillard</author><title>Bandits with Multimodal Structure</title><pages>2400-2439</pages><volume>5</volume></publ><publ><author>Erin J Talvitie;Zilei Shao;Huiying Li;Jinghan Hu;Jacob Boerma;Rory Zhao;Xintong Wang</author><title>Bounding-Box Inference for Error-Aware Model-Based Reinforcement Learning</title><pages>2440-2460</pages><volume>5</volume></publ><publ><author>Javad Azizi;Thang Duong;Yasin Abbasi-Yadkori;András György;Claire Vernade;Mohammad Ghavamzadeh</author><title>Non-stationary Bandits and Meta-Learning with a Small Set of Optimal Arms</title><pages>2461-2491</pages><volume>5</volume></publ><publ><author>Christopher Zeitler;Kristina Miller;Sayan Mitra;John Schierman;Mahesh Viswanathan</author><title>Optimizing Rewards while meeting $\omega$-regular Constraints</title><pages>2492-2514</pages><volume>5</volume></publ></proceedings></dblpsubmission>