{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T03:26:11Z","timestamp":1783481171109,"version":"3.55.0"},"reference-count":60,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2020,11,1]],"date-time":"2020-11-01T00:00:00Z","timestamp":1604188800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2020,11,1]],"date-time":"2020-11-01T00:00:00Z","timestamp":1604188800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/www.elsevier.com\/legal\/tdmrep-license"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61401169"],"award-info":[{"award-number":["61401169"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2020,11]]},"DOI":"10.1016\/j.neucom.2020.06.062","type":"journal-article","created":{"date-parts":[[2020,6,23]],"date-time":"2020-06-23T03:41:51Z","timestamp":1592883711000},"page":"145-157","update-policy":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":75,"special_numbering":"C","title":["SAANet: Siamese action-units attention network for improving dynamic facial expression recognition"],"prefix":"10.1016","volume":"413","author":[{"given":"Daizong","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xi","family":"Ouyang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuangjie","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pan","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shiping","family":"Wen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2020.06.062_b0005","doi-asserted-by":"crossref","first-page":"189","DOI":"10.1007\/978-3-319-51811-4_16","article-title":"Learning features robust to image variations with siamese networks for facial expression recognition","author":"Baddar","year":"2017","journal-title":"International Conference on Multimedia Modeling"},{"key":"10.1016\/j.neucom.2020.06.062_b0010","doi-asserted-by":"crossref","unstructured":"A. Bulat, G. Tzimiropoulos, How far are we from solving the 2d & 3d face alignment problem? (and a dataset of 230,000 3d facial landmarks), in: Proceedings of the IEEE International Conference on Computer Vision (ICCV), 2017.","DOI":"10.1109\/ICCV.2017.116"},{"key":"10.1016\/j.neucom.2020.06.062_b0015","doi-asserted-by":"crossref","unstructured":"Y. Chen, J. Wang, S. Chen, Z. Shi, J. Cai, Facial motion prior networks for facial expression recognition. arXiv preprint arXiv:1902.08788, 2019.","DOI":"10.1109\/VCIP47243.2019.8965826"},{"key":"10.1016\/j.neucom.2020.06.062_b0020","series-title":"Proceedings of the International Conference on Multimodal Interaction","first-page":"653","article-title":"2018: Audio-video, student engagement and group-level affect prediction","author":"Dhall","year":"2018"},{"key":"10.1016\/j.neucom.2020.06.062_b0025","doi-asserted-by":"crossref","unstructured":"H. Ding, S.K. Zhou, R. Chellappa, Facenet2expnet: Regularizing a deep face recognition net for expression recognition, 2016, pp. 118\u2013126.","DOI":"10.1109\/FG.2017.23"},{"key":"10.1016\/j.neucom.2020.06.062_b0030","doi-asserted-by":"crossref","unstructured":"Y. Fan, J.C. Lam, V.O. Li, Video-based emotion recognition using deeply-supervised neural networks, in: The International Conference on Multimodal Interaction, 2018","DOI":"10.1145\/3242969.3264978"},{"key":"10.1016\/j.neucom.2020.06.062_b0035","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TAFFC.2014.2386334","article-title":"Automatic facial expression recognition using features of salient facial patches","volume":"6","author":"Happy","year":"2015","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2020.06.062_b0040","article-title":"Facial expression recognition using enhanced deep 3d convolutional neural networks","author":"Hassani","year":"2017","journal-title":"CoRR"},{"key":"10.1016\/j.neucom.2020.06.062_b0045","series-title":"Proceedings of the International Conference on Multimodal Interaction","first-page":"553","article-title":"Learning supervised scoring ensemble for emotion recognition in the wild","author":"Hu","year":"2017"},{"key":"10.1016\/j.neucom.2020.06.062_b0050","first-page":"448","article-title":"Batch normalization: accelerating deep network training by reducing internal covariate shift","author":"Ioffe","year":"2015","journal-title":"International Conference on Machine Learning"},{"key":"10.1016\/j.neucom.2020.06.062_b0055","first-page":"1642","article-title":"Facial expression recognition with temporal modeling of shapes","author":"Jain","year":"2011","journal-title":"IEEE International Conference on Computer Vision Workshops"},{"key":"10.1016\/j.neucom.2020.06.062_b0060","doi-asserted-by":"crossref","first-page":"231","DOI":"10.1016\/j.neucom.2018.12.037","article-title":"Cross-domain facial expression recognition via an intra-category common feature and inter-category distinction feature fusion network","volume":"333","author":"Ji","year":"2019","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2020.06.062_b0065","series-title":"Proceedings of the IEEE International Conference on Computer Vision (ICCV)","first-page":"2983","article-title":"Joint fine-tuning in deep neural networks for facial expression recognition","author":"Jung","year":"2015"},{"key":"10.1016\/j.neucom.2020.06.062_b0070","series-title":"Proceedings of the IEEE International Conference on Computer Vision (ICCV)","first-page":"3199","article-title":"A novel space-time representation on the positive semidefinite cone for facial expression recognition","author":"Kacem","year":"2017"},{"key":"10.1016\/j.neucom.2020.06.062_b0075","unstructured":"Y. Kim, B. Yoo, Y. Kwak, C. Choi, J. Kim, Deep generative-contrastive networks for facial expression recognition. arXiv preprint arXiv:1703.07140, 2017."},{"key":"10.1016\/j.neucom.2020.06.062_b0080","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"2852","article-title":"Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild","author":"Li","year":"2017"},{"key":"10.1016\/j.neucom.2020.06.062_b0085","first-page":"534","article-title":"Identity-enhanced network for facial expression recognition","author":"Li","year":"2018","journal-title":"Asian Conference on Computer Vision (ACCV)"},{"key":"10.1016\/j.neucom.2020.06.062_b0090","doi-asserted-by":"crossref","first-page":"2439","DOI":"10.1109\/TIP.2018.2886767","article-title":"Occlusion aware facial expression recognition using cnn with attention mechanism","volume":"28","author":"Li","year":"2018","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.neucom.2020.06.062_b0095","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"3610","article-title":"Learning locally-adaptive decision functions for person verification","author":"Li","year":"2013"},{"key":"10.1016\/j.neucom.2020.06.062_b0100","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"2197","article-title":"Person re-identification by local maximal occurrence representation and metric learning","author":"Liao","year":"2015"},{"key":"10.1016\/j.neucom.2020.06.062_b0105","unstructured":"Z. Lin, M. Feng, C.N.d. Santos, M. Yu, B. Xiang, B. Zhou, Y. Bengio, A structured self-attentive sentence embedding. arXiv preprint arXiv:1703.03130, 2017."},{"key":"10.1016\/j.neucom.2020.06.062_b0110","doi-asserted-by":"crossref","unstructured":"C. Liu, T. Tang, K. Lv, M. Wang, Multi-feature based emotion recognition for video clips, in: Proceedings of the International Conference on Multimodal Interaction, 2018","DOI":"10.1145\/3242969.3264989"},{"key":"10.1016\/j.neucom.2020.06.062_b0115","series-title":"Deeply Learning Deformable Facial Action Parts Model for Dynamic Expression Analysis","author":"Liu","year":"2014"},{"key":"10.1016\/j.neucom.2020.06.062_b0120","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"1749","article-title":"Learning expressionlets on spatio-temporal manifold for dynamic facial expression recognition","author":"Liu","year":"2014"},{"key":"10.1016\/j.neucom.2020.06.062_b0125","doi-asserted-by":"crossref","first-page":"5920","DOI":"10.1109\/TIP.2016.2615424","article-title":"Learning expressionlets via universal manifold model for dynamic facial expression recognition","volume":"25","author":"Liu","year":"2016","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.neucom.2020.06.062_b0130","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"1805","article-title":"Facial expression recognition via a boosted deep belief network","author":"Liu","year":"2014"},{"key":"10.1016\/j.neucom.2020.06.062_b0135","unstructured":"Y. Liu, J. Peng, J. Zeng, S. Shan, Pose-adaptive hierarchical attention network for facial expression recognition. arXiv preprint arXiv:1905.10059, 2019."},{"key":"10.1016\/j.neucom.2020.06.062_b0140","series-title":"Proceedings of the International Conference on Multimodal Interaction","article-title":"Multiple spatio-temporal feature learning for video-based emotion recognition in the wild","author":"Lu","year":"2018"},{"key":"10.1016\/j.neucom.2020.06.062_b0145","first-page":"1","article-title":"Automatically detecting pain using facial actions","author":"Lucey","year":"2009","journal-title":"Affect. Comput. Intell. Interact. Workshops"},{"key":"10.1016\/j.neucom.2020.06.062_b0150","first-page":"94","article-title":"The extended cohn-kanade dataset (ck+): a complete dataset for action unit and emotion-specified expression","author":"Lucey","year":"2010","journal-title":"Computer Vision and Pattern Recognition Workshops (CVPRW)"},{"key":"10.1016\/j.neucom.2020.06.062_b0155","first-page":"558","article-title":"Identity-aware convolutional neural network for facial expression recognition","author":"Meng","year":"2017","journal-title":"IEEE International Conference on Automatic Face and Gesture Recognition"},{"key":"10.1016\/j.neucom.2020.06.062_b0160","first-page":"1","article-title":"Going deeper in facial expression recognition using deep neural networks","author":"Mollahosseini","year":"2016","journal-title":"Winter Applications of Computer Vision (WACV)"},{"key":"10.1016\/j.neucom.2020.06.062_b0165","doi-asserted-by":"crossref","first-page":"18","DOI":"10.1109\/TAFFC.2017.2740923","article-title":"Affectnet: a database for facial expression, valence, and arousal computing in the wild","volume":"10","author":"Mollahosseini","year":"2017","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2020.06.062_b0170","series-title":"Proceedings of the 19th ACM International Conference on Multimodal Interaction","first-page":"577","article-title":"Audio-visual emotion recognition using deep transfer learning and multiple temporal models","author":"Ouyang","year":"2017"},{"key":"10.1016\/j.neucom.2020.06.062_b0175","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"779","article-title":"You only look once: unified, real-time object detection","author":"Redmon","year":"2016"},{"key":"10.1016\/j.neucom.2020.06.062_b0180","doi-asserted-by":"crossref","unstructured":"M. Sabri, T. Kurita, Facial expression intensity estimation using siamese and triplet networks. Neurocomputing 313 (2018) 143\u2013154.","DOI":"10.1016\/j.neucom.2018.06.054"},{"key":"10.1016\/j.neucom.2020.06.062_b0185","unstructured":"C.D. Santos, M. Tan, B. Xiang, B. Zhou, Attentive pooling networks, 2016."},{"key":"10.1016\/j.neucom.2020.06.062_b0190","doi-asserted-by":"crossref","first-page":"2673","DOI":"10.1109\/78.650093","article-title":"Bidirectional recurrent neural networks","volume":"45","author":"Schuster","year":"1997","journal-title":"IEEE Trans. Signal Process."},{"key":"10.1016\/j.neucom.2020.06.062_b0195","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"5580","article-title":"Lomo: Latent ordinal model for facial analysis in videos","author":"Sikka","year":"2016"},{"key":"10.1016\/j.neucom.2020.06.062_b0200","unstructured":"K. Simonyan, A. Zisserman, Very deep convolutional networks for large-scale image recognition. Comput. Sci. (2014)"},{"key":"10.1016\/j.neucom.2020.06.062_b0205","doi-asserted-by":"crossref","first-page":"12","DOI":"10.1016\/j.neucom.2018.03.034","article-title":"A visual attention based roi detection method for facial expression recognition","volume":"296","author":"Sun","year":"2018","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2020.06.062_b0210","doi-asserted-by":"crossref","first-page":"97","DOI":"10.1109\/34.908962","article-title":"Recognizing action units for facial expression analysis","volume":"23","author":"Tian","year":"2001","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.neucom.2020.06.062_b0215","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2007.1094","article-title":"Facial action unit recognition by exploiting their dynamic and semantic relationships","volume":"29","author":"Tong","year":"2007","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.neucom.2020.06.062_b0220","unstructured":"M. Valstar, M. Pantic, Induced disgust, happiness and surprise: an addition to the mmi facial expression database, in: Corpora for Research on Emotion and Affect, 2010, p. 65."},{"key":"10.1016\/j.neucom.2020.06.062_b0225","unstructured":"A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, \u0141. Kaiser, I. Polosukhin, Attention is all you need, in: Advances in Neural Information Processing Systems, 2017."},{"key":"10.1016\/j.neucom.2020.06.062_b0230","first-page":"235","article-title":"An emotion-based approach to robotics","author":"Vel\u00e1squez","year":"1999","journal-title":"Intell. Robots Syst."},{"key":"10.1016\/j.neucom.2020.06.062_b0235","doi-asserted-by":"crossref","first-page":"1743","DOI":"10.1016\/j.imavis.2008.11.007","article-title":"Social signal processing: survey of an emerging domain","volume":"27","author":"Vinciarelli","year":"2009","journal-title":"Image Vision Comput."},{"key":"10.1016\/j.neucom.2020.06.062_b0240","doi-asserted-by":"crossref","first-page":"4057","DOI":"10.1109\/TIP.2019.2956143","article-title":"Region attention networks for pose and occlusion robust facial expression recognition","volume":"29","author":"Wang","year":"2020","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.neucom.2020.06.062_b0245","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"Non-local neural networks","author":"Wang","year":"2018"},{"key":"10.1016\/j.neucom.2020.06.062_b0250","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1109\/TMM.2018.2844085","article-title":"Facial expression recognition using hierarchical features with deep comprehensive multipatches aggregation convolutional neural networks","volume":"21","author":"Xie","year":"2018","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.neucom.2020.06.062_b0255","series-title":"Proceedings of the IEEE International Conference on Computer Vision (ICCV)","article-title":"Jointly attentive spatial-temporal pooling networks for video-based person re-identification","author":"Xu","year":"2017"},{"key":"10.1016\/j.neucom.2020.06.062_b0260","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"2168","article-title":"Facial expression recognition by de-expression residue learning","author":"Yang","year":"2018"},{"key":"10.1016\/j.neucom.2020.06.062_b0265","doi-asserted-by":"crossref","first-page":"50","DOI":"10.1016\/j.neucom.2018.07.028","article-title":"Spatio-temporal convolutional features with nested lstm for facial expression recognition","volume":"317","author":"Yu","year":"2018","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2020.06.062_b0270","doi-asserted-by":"crossref","first-page":"643","DOI":"10.1016\/j.neucom.2017.08.043","article-title":"Facial expression recognition via learning deep sparse autoencoders","volume":"273","author":"Zeng","year":"2018","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2020.06.062_b0275","series-title":"IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"2122","article-title":"Expression-identity fusion network for facial expression recognition","author":"Zhang","year":"2019"},{"key":"10.1016\/j.neucom.2020.06.062_b0280","doi-asserted-by":"crossref","first-page":"4193","DOI":"10.1109\/TIP.2017.2689999","article-title":"Facial expression recognition based on deep evolutional spatial-temporal networks","volume":"26","author":"Zhang","year":"2017","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.neucom.2020.06.062_b0285","doi-asserted-by":"crossref","first-page":"2528","DOI":"10.1109\/TMM.2016.2598092","article-title":"A deep neural network-driven feature learning method for multi-view facial expression recognition","volume":"18","author":"Zhang","year":"2016","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.neucom.2020.06.062_b0290","doi-asserted-by":"crossref","first-page":"607","DOI":"10.1016\/j.imavis.2011.07.002","article-title":"Facial expression recognition from near-infrared videos","volume":"29","author":"Zhao","year":"2011","journal-title":"Image Vision Comput."},{"key":"10.1016\/j.neucom.2020.06.062_b0295","series-title":"Proceedings of the IEEE Conference on European Conference on Computer Vision (ECCV)","first-page":"425","article-title":"Peak-piloted deep network for facial expression recognition","author":"Zhao","year":"2016"},{"key":"10.1016\/j.neucom.2020.06.062_b0300","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"649","article-title":"Person re-identification by probabilistic relative distance comparison","author":"Zheng","year":"2011"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/api.elsevier.com\/content\/article\/PII:S092523122031050X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/api.elsevier.com\/content\/article\/PII:S092523122031050X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T01:31:39Z","timestamp":1778549499000},"score":1,"resource":{"primary":{"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/linkinghub.elsevier.com\/retrieve\/pii\/S092523122031050X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,11]]},"references-count":60,"alternative-id":["S092523122031050X"],"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.1016\/j.neucom.2020.06.062","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2020,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"SAANet: Siamese action-units attention network for improving dynamic facial expression recognition","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.1016\/j.neucom.2020.06.062","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2020 Elsevier B.V. All rights reserved.","name":"copyright","label":"Copyright"}]}}