DoktoraAçık Erişim

Herkes için diyalog: Farklı topluluklar için kapsayıcı ve insani sesli asistanlar oluşturmak üzerine disiplinler arası bir yaklaşım

2023
0 görüntülenme
0 i̇ndirme
Danışman: Prof. Dr. Kerem Rızvanoğlu

Özet (EN)

Conversational agents (Cas) have transformative potential that reaches beyond the realms of technology and human-computer interaction (HCI). These technologies can potentially have a significant societal impact, particularly in narrowing digital divides and enhancing social inclusion. Recognising and addressing the various ways in which humans interact with conversational agents, as influenced by cultural, gender, age, and ability-related characteristics, is crucial. These variations shape not only how users access and utilise information but also how they interpret and evaluate it. As such, these agents could risk propagating and reproducing biases and stereotypes. Tailoring communication methods to diverse user populations can help alleviate these concerns, enhancing the user experience, increasing inclusivity and broadening access. The growing use of personal voice assistants like Google Assistant, Amazon's Alexa, SIRI, Cortana, and Microsoft's Cortana calls for effective design that can hold users' attention for prolonged and natural conversations. Human-computer interaction (HCI) must ensure universal usability. However, new technologies' usability, accessibility and inclusivity remain limited for specific populations. By exploring the under-researched area of voice-assistant user populations, with a particular focus on older adults, adults with specialised interests, and visually impaired people, this study significantly contributes to the fields of human-computer interaction (HCI), social psychology and communication. At the social level, the development of conversational agents that are customised to meet the individual needs of users has the potential to address disparities in access to information and services. These agents have the potential to significantly contribute to promoting health, wellness, and overall quality of life, especially for vulnerable groups. By facilitating access to information and services, these systems have the potential to effectively mitigate the challenges experienced by these user groups, thus effectively tackling issues related to social inequality. Integrating co-design techniques and user-centred methodologies in developing these agents guarantees their usability and relevance, hence maximising their social impact. The active involvement of end users in the design process is of utmost importance, culturally relevant solutions, non-stereotypical, and inclusive solutions. The ultimate goal is to create humanised computational agents that cater to the diverse needs of the populace, contributing to a more inclusive and accessible digital environment. The innovative use of the Wizard of Oz (WoZ) technique is a significant methodological contribution. This technique enables social scientists to manipulate various human characteristics without coding, allowing for a more flexible and adaptable approach to comprehending human-computer interactions. By integrating WoZ, this study creates new opportunities for HCI research, particularly for those with non-technical backgrounds. Furthermore, the unique mixed-method approach, combined with pre- and post-visit quizzes, momentary test evaluations, pre- and post-visit interviews, surveys, and quantifiable scales in each chapter, creates a comprehensive and detailed understanding of user interactions with computational agents. This research contributes to a more nuanced understanding of the dynamics when humans interact with artificial entities by introducing a holistic and inclusive framework for interpreting these interactions. Our second chapter delves into the influence of gender-related vocal signals and conversational style, focusing on the level of self-disclosure exhibited by conversational agents (CAs). We seek to examine the effects of these factors on attitudinal and behavioural outcomes, including self-disclosure reciprocity and trust. This study used a speech-based conversational agent (CA) prototype integrated into a voice assistant system based on smart speakers, specifically Google Home. We employed the Wizard of Oz technique to simulate a fully functional CA, which involved human operators controlling the system's responses Our research design also incorporated a complete multi-method approach, which included the participation of 40 adult users in a naturalistic home environment setting. The concept presented in our research is based on the Computers are Social Actors (CASA) Paradigm and is designed to be cost-effective. The findings of this study indicate that the act of self-disclosure by computer agents (CAs) plays a crucial role in establishing interpersonal connections and cultivating trust. Qualitative data reveals implicit gender stereotypes towards CAs, emphasising user-centred design and the potential of reproducing biases and stereotypes of conversational agents. Users tend to instinctively follow conversational conventions such as taking turns in speaking and providing back-channel responses. The aforementioned findings underscore the significance of considering conversational conventions dependent on context and integrating culturally relevant background knowledge sources when developing voice assistants based on smart speakers. This approach facilitates the promotion of cultural relevance, user empathy, and engagement, hence fostering more meaningful interactions. The objective of the third chapter is to emphasise the necessity of improving the skills of conversational agents in order to cater to disadvantaged groups, such as older adults. This study used a mixed-method approach to investigate the potential of voice assistants (VAs) for a specific demographic, namely older persons between the ages of 65 and 75. This age group has had significant impacts from the Covid-19 pandemic and faces the additional hurdle of the digital divide. The objective was to identify their needs and challenges when interacting with a smart speaker-based VA (Google Home) for the first time. To address the constraints of a one-size-fits-all approach, our voice assistant prototype provides an empathetic VA with varied voice ages tailored to older individuals' socio-cultural backgrounds. This was achieved through the use of context-specific and user-centred dialogue flows. The study included 60 elderly persons who interacted with a prototype speech-based conversational agent (CA) that used the Wizard of Oz approach within a smartspeaker-based voice assistant (Google Home). We investigated the effects of VA's voice characteristics (mature vs young) and the presence of empathic expression (high vs low) on social outcomes (perceived support and trust) and functional outcomes (perceived self-efficacy) towards voice assistants using the Computers are Social Actors paradigm, the Similarity-Attraction Theory, and Hofstede's Cultural Dimensions Theory. The findings suggest that: (1) the voice assistant's conversational style is more important than its appearance for older adults, and anthropomorphism occurs even in the absence of a physical embodiment, and (2) high empathic expression is a powerful motivator for perceiving the VA as a "discreet confidante beyond human interaction" based on older adults' socio-cultural background and beliefs. (3) There was no evidence that the similarity attraction effect functioned on older individuals when the similarity was mediated, as a mature voice had no effect on felt support or trust. Interestingly, older adults rejected the voice assistant with a mature voice. Considering older adults' generational reflexes and culturally-sensitive design, our study underscores the significance of incorporating empathic expression and voice design into a context-based, usercentred "bodiless" voice assistant for optimal interaction with older adults. In the fourth phase of our study, we directed our attention towards individuals with visual impairments who often face limitations in accessing cultural, historical, and practical knowledge due to the primarily visual characteristics of the physical environment. The limited availability of access poses obstacles to engagement in indoor and outdoor leisure activities. While museums provide opportunities for exploration, social interaction, and education, accessibility is frequently disregarded. Even slight modifications can significantly enhance the museum experience for those with visual impairments. In order to tackle these obstacles, we have devised the iMuse Model, a reproducible research framework designed to establish museum environments that are both accessible and inclusive for individuals with visual impairments. The central focus of this model revolves around the co-design of a prototype voice assistant, implemented through Google Home, for remote museum navigation, specifically within the Basilica Cistern Museum in Turkey. The model incorporates a two-layer study. The initial layer involves co-designing a four-phase framework with visually impaired users and their sight loss instructors, concentrating on their specific needs and challenges. The second layer involves testing this design with an additional 30 visually impaired individuals, using multiple methodologies, including the Wizard of Oz technique. In our prototype, we integrated inclusive and comprehensible audio descriptions, incorporating sensory, emotional, historical, and structural elements, along with spatialised sounds from the museum environment, such as the dripping water or buzzing noises. The above methodology was discovered to enhance spatial understanding and cognitive map development. Noting the exhaustion with conventional voice assistants' canned jokes and tool-like interactions, we have incorporated interpersonal capabilities into our two iterations of the voice assistant. These versions encompass distinct characteristics, one emphasising humour through laughter, while the other focuses on non-humorous interactions. Both qualitative and quantitative results indicated a preference for the humorous version, which increased interaction, immersion, and even social learning. This study highlights the potential of the iMuse Model in utilising co-designed, humour-infused, and culturally sensitive voice assistants to aid visually impaired individuals in navigating unfamiliar spaces. Additionally, it emphasises how these voice assistants can enhance social learning, engagement, and the appreciation of cultural heritage within these environments. Overall, the results of this study are anticipated to offer valuable insights that can guide the creation and advancement of conversational agents that are more captivating, user-centric, and inclusive. This research endeavour holds the potential to yield significant theoretical and practical advancements, particularly in the area of designing conversational agents that are more immersive and inclusive. Moreover, it can enhance our comprehension of Human-Computer Interaction (HCI) and expand the utilisation of social science ideas inside the technology domain. Les agents conversationnels (CAs) ont un potentiel transformateur qui va audelà des domaines de la technologie et de l'interaction homme-machine (IHM). Ces technologies peuvent potentiellement avoir un impact sociétal significatif, en particulier pour réduire les fossés numériques et améliorer l'inclusion sociale. Reconnaître et aborder les différentes façons dont les humains interagissent avec les agents conversationnels, influencées par des caractéristiques culturelles, de genre, d'âge et de capacité, est essentiel. Ces variations déterminent non seulement comment les utilisateurs accèdent à l'information et l'utilisent, mais aussi comment ils l'interprètent et l'évaluent. À ce titre, ces agents pourraient risquer de propager et de reproduire des préjugés et des stéréotypes. Adapter les méthodes de communication à diverses populations d'utilisateurs peut aider à atténuer ces préoccupations, améliorant l'expérience utilisateur, augmentant l'inclusivité et élargissant l'accès. L'utilisation croissante d'assistants vocaux personnels tels que Google Assistant, Alexa d'Amazon, SIRI, et Cortana de Microsoft nécessite une conception efficace capable de retenir l'attention des utilisateurs pour des conversations prolongées et naturelles. L'interaction homme-machine (IHM) doit garantir une utilisabilité universelle. Cependant, l'utilisabilité, l'accessibilité et l'inclusivité des nouvelles technologies restent limitées pour certaines populations spécifiques. En explorant le domaine peu étudié des populations d'utilisateurs d'assistants vocaux, avec une attention particulière portée aux personnes âgées, aux adultes avec les intérêts spécialisés, et aux personnes malvoyantes, cette étude apporte une contribution significative aux domaines de l'interaction homme-machine (IHM), de la psychologie sociale et de la communication. Au niveau social, le développement d'agents conversationnels personnalisés pour répondre aux besoins individuels des utilisateurs a le potentiel de traiter les disparités d'accès à l'information et aux services. Ces agents ont le potentiel de contribuer de manière significative à la promotion de la santé, du bien-être et de la qualité de vie en général, en particulier pour les groupes vulnérables. En facilitant l'accès à l'information et aux services, ces systèmes ont la capacité d'atténuer efficacement les défis rencontrés par ces groupes d'utilisateurs, abordant ainsi directement les problèmes liés à l'inégalité sociale. L'intégration de techniques de coconception et de méthodologies centrées sur l'utilisateur dans le développement de ces agents garantit leur utilisabilité et leur pertinence, maximisant ainsi leur impact social. L'implication active des utilisateurs finaux dans le processus de conception est de la plus haute importance pour des solutions culturellement pertinentes, non stéréotypées et inclusives. L'objectif ultime est de créer des agents computationnels humanisés qui répondent aux besoins diversifiés de la population, contribuant à un environnement numérique plus inclusif et accessible. L'utilisation innovante de la technique du Magicien d'Oz (WoZ) est une contribution méthodologique significative. Cette technique permet aux scientifiques sociaux de manipuler diverses caractéristiques humaines sans programmation, offrant ainsi une approche plus flexible et adaptable pour comprendre les interactions homme-machine. En intégrant le WoZ, cette étude ouvre de nouvelles opportunités pour la recherche en HCI, en particulier pour ceux qui n'ont pas de formation technique. De plus, l'approche mixte unique, combinée à des quiz avant et après la visite, des évaluations de tests momentanés, des entretiens avant et après la visite, des enquêtes, et des échelles quantifiables dans chaque chapitre, crée une compréhension complète et détaillée des interactions des utilisateurs avec les agents computationnels. Cette recherche contribue à une compréhension plus nuancée des dynamiques lors des interactions entre les humains et les entités artificielles en introduisant un cadre holistique et inclusif pour interpréter ces interactions. Notre seconde chapitre se penche sur l'influence des signaux vocaux liés au genre et sur le style de conversation, en se concentrant sur le niveau d'auto-révélation exhibé par les agents conversationnels (AC). Nous cherchons à examiner les effets de ces facteurs sur les résultats attitudels et comportementaux, y compris la réciprocité de l'auto-révélation et la confiance. Cette étude a utilisé un prototype d'agent conversationnel (AC) basé sur la parole intégré dans un système d'assistant vocal reposant sur des enceintes intelligentes, spécifiquement Google Home. Nous avons employé la technique du Magicien d'Oz pour simuler un AC entièrement fonctionnel, impliquant des opérateurs humains contrôlant les réponses du système. Notre conception de recherche a également incorporé une approche multi-méthodes complète, incluant la participation de 40 utilisateurs adultes dans un cadre d'environnement domestique naturel. Le concept présenté dans notre recherche est basé sur le paradigme "Les ordinateurs sont des acteurs sociaux" (CASA) et est conçu pour être rentable. Les résultats de cette étude indiquent que l'acte d'autorévélation par les agents conversationelles (AC) joue un rôle crucial dans l'établissement de connexions interpersonnelles et la cultivation de la confiance. Les données qualitatives révèlent des stéréotypes de genre implicites envers les AC, mettant l'accent sur la conception centrée sur l'utilisateur et le potentiel de reproduction de biais et stéréotypes des agents conversationnels. Les utilisateurs ont tendance à suivre instinctivement les conventions conversationnelles telles que prendre leur tour pour parler et fournir des réponses de retour. Les découvertes susmentionnées soulignent l'importance de prendre en compte les conventions conversationnelles en fonction du contexte et d'intégrer des sources de connaissances contextuelles pertinentes lors du développement d'assistants vocaux basés sur des enceintes intelligentes. Cette approche facilite la promotion de la pertinence culturelle, de l'empathie utilisateur et de l'engagement, favorisant ainsi des interactions plus significatives. L'objectif du troisième chapitre est de souligner la nécessité d'améliorer les compétences des agents conversationnels afin de répondre aux besoins des groupes défavorisés, tels que les personnes âgées. Cette étude a utilisé une approche mixte pour enquêter sur le potentiel des assistants vocaux (AV) pour une démographie spécifique, à savoir les personnes âgées entre 65 et 75 ans. Ce groupe d'âge a été fortement impacté par la pandémie de Covid-19 et fait face à l'obstacle supplémentaire de la fracture numérique. L'objectif était d'identifier leurs besoins et défis lorsqu'ils interagissent pour la première fois avec un AV basé sur une enceinte intelligente (Google Home). Pour répondre aux contraintes d'une approche universelle, notre prototype d'assistant vocal offre un AV empathique avec des voix de différents âges adaptées aux origines socio-culturelles des personnes âgées. Ceci a été réalisé grâce à l'utilisation de flux de dialogue spécifiques au contexte et centrés sur l'utilisateur. L'étude a inclus 60 personnes âgées qui ont interagi avec un prototype d'agent conversationnel (AC) basé sur la parole utilisant l'approche du Magicien d'Oz au sein d'un assistant vocal basé sur une enceinte intelligente (Google Home). Nous avons étudié les effets des caractéristiques vocales de l'AV (voix mature vs jeune) et de la présence d'expression empathique (élevée vs faible) sur les résultats sociaux (soutien et confiance perçus) et fonctionnels (auto-efficacité perçue) envers les assistants vocaux en utilisant le paradigme "Les ordinateurs sont des acteurs sociaux", la théorie de l'attraction par similitude, et la théorie des dimensions culturelles de Hofstede. Les résultats suggèrent que : (1) le style conversationnel de l'assistant vocal est plus important que son apparence pour les personnes âgées, et l'anthropomorphisme se produit même en l'absence d'une incarnation physique, et (2) une forte expression empathique est un puissant motivateur pour percevoir l'AV comme un "confident discret au-delà de l'interaction humaine" basé sur le background et les croyances socio-culturels des personnes âgées. (3) Il n'y avait aucune preuve que l'effet d'attraction par similitude fonctionnait sur les personnes âgées lorsque la similitude était médiatisée, car une voix mature n'avait aucun effet sur le soutien ou la confiance ressentis. De manière intéressante, les personnes âgées ont rejeté l'assistant vocal avec une voix mature. En tenant compte des réflexes générationnels des personnes âgées et d'une conception sensible à la culture, notre étude souligne l'importance d'intégrer l'expression empathique et la conception de la voix dans un assistant vocal "sans corps", centré sur l'utilisateur et basé sur le contexte, pour une interaction optimale avec les personnes âgées. Dans la quatrième phase de notre étude, nous avons orienté notre attention vers les personnes malvoyantes qui rencontrent souvent des limites pour accéder à la connaissance culturelle, historique et pratique à cause des caractéristiques principalement visuelles de l'environnement physique. La disponibilité limitée d'accès constitue des obstacles à la participation à des activités de loisirs intérieures et extérieures. Si les musées offrent des opportunités d'exploration, d'interaction sociale et d'éducation, l'accessibilité est souvent négligée. De légères modifications peuvent considérablement améliorer l'expérience muséale pour les personnes malvoyantes. Afin de surmonter ces obstacles, nous avons élaboré le modèle iMuse, un cadre de recherche reproductible conçu pour établir des environnements muséaux à la fois accessibles et inclusifs pour les personnes malvoyantes. Le cœur de ce modèle concerne la co-conception d'un prototype d'assistant vocal, mis en œuvre via Google Home, pour la navigation à distance dans le musée, spécifiquement au sein de la Basilique Citerne en Turquie. Le modèle comporte une étude à deux niveaux. Le premier niveau implique la co-conception d'un cadre en quatre phases avec des utilisateurs malvoyants et leurs instructeurs, se concentrant sur leurs besoins et défis spécifiques. La deuxième couche implique de tester cette conception avec 30 autres individus malvoyants, en utilisant plusieurs méthodologies, dont la technique du Magicien d'Oz. Dans notre prototype, nous avons intégré des descriptions audio inclusives et compréhensibles, incorporant des éléments sensoriels, émotionnels, historiques et structurels, ainsi que des sons spatialisés de l'environnement du musée, comme l'eau qui goutte ou des bruits de fond. Cette méthodologie s'est avérée renforcer la compréhension spatiale et le développement de cartes cognitives. Notant la lassitude des blagues formatées des assistants vocaux conventionnels et des interactions utilitaires, nous avons intégré des capacités interpersonnelles dans nos deux versions de l'assistant vocal. Ces versions ont des caractéristiques distinctes, l'une mettant l'accent sur l'humour par le rire, tandis que l'autre se concentre sur des interactions non humoristiques. Les résultats qualitatifs et quantitatifs ont indiqué une préférence pour la version humoristique, qui a augmenté l'interaction, l'immersion et même l'apprentissage social. Cette étude met en évidence le potentiel du modèle iMuse dans l'utilisation d'assistants vocaux co-conçus, imprégnés d'humour, et culturellement sensibles pour aider les personnes malvoyantes à naviguer dans des espaces inconnus. De plus, elle souligne comment ces assistants vocaux peuvent renforcer l'apprentissage social, l'engagement et l'appréciation du patrimoine culturel au sein de ces environnements. Globalement, les résultats de cette étude devraient offrir des perspectives précieuses qui peuvent guider la création et l'avancement des agents conversationnels plus captivants, centrés sur l'utilisateur et inclusifs. Cette initiative de recherche a le potentiel d'apporter des avancées théoriques et pratiques significatives, en particulier dans le domaine de la conception d'agents conversationnels plus immersifs et inclusifs. De plus, elle peut améliorer notre compréhension de l'Interaction HommeOrdinateur (IHO) et étendre l'utilisation des idées des sciences sociales dans le domaine technologique.

Yazar

Dr. Yeliz Yücel

Bu Yayına Nasıl Atıf Yapılır

Yeliz Yücel (Doctorate thesis). Herkes için diyalog: Farklı topluluklar için kapsayıcı ve insani sesli asistanlar oluşturmak üzerine disiplinler arası bir yaklaşım, 2023, Galatasaray University.

Lisans

Tüm Hakları Saklıdır

Bu eser belirtilen lisans koşulları altında paylaşılmaktadır.

Galatasaray University tezlerinden daha fazlası