{"id":"https://openalex.org/W7160862963","doi":"https://doi.org/10.48550/arxiv.2605.07393","title":"Offline Policy Optimization with Posterior Sampling","display_name":"Offline Policy Optimization with Posterior Sampling","publication_year":2026,"publication_date":"2026-05-08","ids":{"openalex":"https://openalex.org/W7160862963","doi":"https://doi.org/10.48550/arxiv.2605.07393"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.07393","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07393","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.07393","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128787362","display_name":"Hongqiang Lin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lin, Hongqiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135881230","display_name":"Dongxu Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Dongxu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135886749","display_name":"Yiding Sun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Yiding","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135892174","display_name":"Mingzhe Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Mingzhe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135907314","display_name":"Ning Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Ning","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135897464","display_name":"Haijun Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Haijun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6442999839782715,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6442999839782715,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.08129999786615372,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.03869999945163727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.7196999788284302},{"id":"https://openalex.org/keywords/thompson-sampling","display_name":"Thompson sampling","score":0.5638999938964844},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5127999782562256},{"id":"https://openalex.org/keywords/bayesian-inference","display_name":"Bayesian inference","score":0.41679999232292175},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.4140999913215637},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.4056999981403351},{"id":"https://openalex.org/keywords/importance-sampling","display_name":"Importance sampling","score":0.40459999442100525},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.39089998602867126}],"concepts":[{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.7196999788284302},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6261000037193298},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.5638999938964844},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5314000248908997},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5127999782562256},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.41679999232292175},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.4140999913215637},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.4056999981403351},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.40459999442100525},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.39089998602867126},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.37599998712539673},{"id":"https://openalex.org/C57830394","wikidata":"https://www.wikidata.org/wiki/Q278079","display_name":"Posterior probability","level":3,"score":0.3352999985218048},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3188999891281128},{"id":"https://openalex.org/C193254401","wikidata":"https://www.wikidata.org/wiki/Q2160088","display_name":"Robust optimization","level":2,"score":0.3183000087738037},{"id":"https://openalex.org/C2778049539","wikidata":"https://www.wikidata.org/wiki/Q17002908","display_name":"Bayesian optimization","level":2,"score":0.30550000071525574},{"id":"https://openalex.org/C72169020","wikidata":"https://www.wikidata.org/wiki/Q194404","display_name":"Monotonic function","level":2,"score":0.29100000858306885},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.28700000047683716},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.28600001335144043},{"id":"https://openalex.org/C194387892","wikidata":"https://www.wikidata.org/wiki/Q1747770","display_name":"Stochastic optimization","level":2,"score":0.2646999955177307},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.26159998774528503},{"id":"https://openalex.org/C207201462","wikidata":"https://www.wikidata.org/wiki/Q182505","display_name":"Bayes' theorem","level":3,"score":0.2596000134944916},{"id":"https://openalex.org/C137631369","wikidata":"https://www.wikidata.org/wiki/Q7617831","display_name":"Stochastic programming","level":2,"score":0.2565000057220459},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2547000050544739},{"id":"https://openalex.org/C134261354","wikidata":"https://www.wikidata.org/wiki/Q938438","display_name":"Statistical inference","level":2,"score":0.2522999942302704}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.07393","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07393","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.07393","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.07393","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.5137519836425781,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"A":[0],"fundamental":[1],"challenge":[2],"in":[3,10,20],"model-based":[4],"offline":[5],"reinforcement":[6],"learning":[7],"(RL)":[8],"lies":[9],"the":[11,36,88],"trade-off":[12],"between":[13],"generalization":[14,104],"and":[15,93,124],"robustness":[16,53,107],"against":[17,108],"exploitation":[18],"errors":[19],"out-of-distribution":[21],"(OOD)":[22],"regions.":[23],"While":[24],"OOD":[25,101],"samples":[26],"may":[27],"capture":[28],"valid":[29],"underlying":[30],"physical":[31],"dynamics,":[32],"they":[33],"also":[34],"introduce":[35],"risk":[37,46],"of":[38,90,135],"model":[39,85,109],"exploitation.":[40,110],"Existing":[41],"methods":[42],"typically":[43],"address":[44],"this":[45,60],"through":[47],"excessive":[48],"pessimistic":[49],"regularization,":[50],"which":[51,69],"ensures":[52],"but":[54],"often":[55],"sacrifices":[56],"generalization.":[57],"To":[58],"overcome":[59],"limitation,":[61],"we":[62,112],"propose":[63],"Posterior":[64],"Sampling-based":[65],"Policy":[66],"Optimization":[67],"(PSPO),":[68],"formulates":[70],"dynamics":[71],"modeling":[72],"as":[73,119],"a":[74,80,120,133],"Bayesian":[75],"inference":[76],"process":[77],"to":[78,159],"derive":[79],"posterior":[81,91,117],"that":[82,139,153],"explicitly":[83],"quantifies":[84],"fidelity.":[86],"Through":[87],"integration":[89],"sampling":[92,118],"constrained":[94,136],"policy":[95,130],"optimization,":[96],"our":[97],"method":[98],"leverages":[99],"dynamics-consistent":[100],"transitions":[102],"for":[103],"while":[105],"ensuring":[106],"Theoretically,":[111],"formulate":[113],"Q-value":[114],"estimation":[115],"under":[116],"stochastic":[121],"approximation":[122],"problem":[123],"establish":[125],"its":[126],"convergence.":[127,147],"We":[128],"decompose":[129],"optimization":[131],"into":[132],"sequence":[134],"subproblems,":[137],"demonstrating":[138],"solving":[140],"these":[141],"subproblems":[142],"guarantees":[143],"monotonic":[144],"improvement":[145],"until":[146],"Experiments":[148],"on":[149],"standard":[150],"benchmarks":[151],"validate":[152],"PSPO":[154],"achieves":[155],"superior":[156],"performance":[157],"compared":[158],"state-of-the-art":[160],"baselines.":[161]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-12T00:00:00"}
