{"id":"https://openalex.org/W4416386275","doi":"https://doi.org/10.48550/arxiv.2510.08526","title":"Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning","display_name":"Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning","publication_year":2025,"publication_date":"2025-10-09","ids":{"openalex":"https://openalex.org/W4416386275","doi":"https://doi.org/10.48550/arxiv.2510.08526"},"language":"en","primary_location":{"id":"pmh:oai:arXiv.org:2510.08526","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2510.08526","pdf_url":"https://arxiv.org/pdf/2510.08526","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"type":"preprint","indexed_in":["arxiv","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2510.08526","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5114335993","display_name":"Yash Jhaveri","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jhaveri, Yash","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5090313471","display_name":"Harley Wiltzer","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wiltzer, Harley","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5015419380","display_name":"Patrick Shafto","orcid":"https://orcid.org/0000-0002-6506-5644"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shafto, Patrick","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5001087292","display_name":"Marc G. Bellemare","orcid":"https://orcid.org/0000-0002-6096-0105"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bellemare, Marc G.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5109496264","display_name":"David Meger","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Meger, David","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5870000123977661,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5870000123977661,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.2443999946117401,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.021900000050663948,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.713100016117096},{"id":"https://openalex.org/keywords/decoupling","display_name":"Decoupling (probability)","score":0.5457000136375427},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.5055000185966492},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.4975000023841858},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.45669999718666077},{"id":"https://openalex.org/keywords/principle-of-maximum-entropy","display_name":"Principle of maximum entropy","score":0.4009000062942505}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.713100016117096},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.579200029373169},{"id":"https://openalex.org/C205606062","wikidata":"https://www.wikidata.org/wiki/Q5249645","display_name":"Decoupling (probability)","level":2,"score":0.5457000136375427},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.5055000185966492},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.4975000023841858},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.45669999718666077},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.45489999651908875},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.41260001063346863},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.4009000062942505},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.3725999891757965},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3517000079154968},{"id":"https://openalex.org/C57869625","wikidata":"https://www.wikidata.org/wiki/Q1783502","display_name":"Rate of convergence","level":3,"score":0.3165999948978424},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.2904999852180481}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:arXiv.org:2510.08526","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2510.08526","pdf_url":"https://arxiv.org/pdf/2510.08526","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2510.08526","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2510.08526","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2510.08526","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2510.08526","pdf_url":"https://arxiv.org/pdf/2510.08526","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320309949","display_name":"Canadian Institute for Advanced Research","ror":"https://ror.org/01sdtdd95"},{"id":"https://openalex.org/F4320332180","display_name":"Defense Advanced Research Projects Agency","ror":"https://ror.org/02caytj08"},{"id":"https://openalex.org/F4320334593","display_name":"Natural Sciences and Engineering Research Council of Canada","ror":"https://ror.org/01h531d29"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4416386275.pdf","grobid_xml":"https://content.openalex.org/works/W4416386275.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"In":[0,43,96],"the":[1,14,80,86,105,127],"pursuit":[2],"of":[3,16,88,100],"finding":[4],"an":[5,74,120],"optimal":[6,60,77,110,135],"policy,":[7,61],"reinforcement":[8],"learning":[9],"(RL)":[10],"methods":[11],"generally":[12],"ignore":[13],"properties":[15],"learned":[17,37],"policies":[18,34],"apart":[19],"from":[20],"their":[21],"expected":[22],"return.":[23],"Thus,":[24],"even":[25],"when":[26],"successful,":[27],"it":[28],"is":[29],"difficult":[30],"to":[31,57,124,131],"characterize":[32],"which":[33],"will":[35,41],"be":[36],"and":[38,66,84,93],"what":[39],"they":[40],"do.":[42],"this":[44],"work,":[45],"we":[46,118],"present":[47,119],"a":[48,58,67,97],"theoretical":[49],"framework":[50],"for":[51,103],"policy":[52,78,89,107],"optimization":[53],"that":[54,122],"guarantees":[55],"convergence":[56,87],"particular":[59,98],"via":[62],"vanishing":[63],"entropy":[64],"regularization":[65,81],"temperature":[68,82,115],"decoupling":[69,116],"gambit.":[70],"Our":[71],"approach":[72],"realizes":[73],"interpretable,":[75,133],"diversity-preserving":[76,134],"as":[79],"vanishes":[83],"ensures":[85],"derived":[90],"objects--value":[91],"functions":[92],"return":[94,128],"distributions.":[95],"instance":[99],"our":[101,114],"method,":[102],"example,":[104],"realized":[106],"samples":[108],"all":[109],"actions":[111],"uniformly.":[112],"Leveraging":[113],"gambit,":[117],"algorithm":[121],"estimates,":[123],"arbitrary":[125],"accuracy,":[126],"distribution":[129],"associated":[130],"its":[132],"policy.":[136]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-10-11T00:00:00"}
