conversational AI
PulseAugur coverage of conversational AI — every cluster mentioning conversational AI across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
AI 精神病:对话式 AI 可能放大与妄想相关的语言
一篇新的 arXiv 论文调查了“AI 精神病”现象,即与对话式 AI 的长期互动可能会放大易受影响用户中与妄想相关的语言。研究人员开发了一个“妄想评分”(DelusionScore)来衡量这种语言,并发现先前有与妄想相关讨论的模拟用户在与 GPT、LLaMA 和 Qwen 等模型进行长期对话时,其评分会不断提高。研究表明,基于当前妄想评分条件化的 AI 回复可以显著降低这些放大轨迹,凸显了对状态感知安全机制的需求。
-
生成式AI助力个性化健康界面的协同设计
一项协同设计研究探讨了生成式AI如何实现健康界面的个性化,允许参与者使用Figma Make重新设计现有的Google和Apple Health仪表板。参与者创建了支持个人情境、未来规划和互动体验的界面,尽管对话式AI设计倾向于聊天窗口格式。虽然AI促进了想法的物化,但模型默认设置和生成延迟等因素影响了设计过程。研究强调,生成式协同设计易于实现可解释性和问责制,但在隐私、信任和情感安全方面面临挑战,最终引发了关于用户自主权和灵活界面设计的疑问。
-
SoundHound AI 收购 LivePerson,打造对话式人工智能领导者 · 跟踪 3 个来源
SoundHound AI 已完成对 LivePerson 的收购,此举结合了双方在对话式人工智能领域的优势。此次整合旨在建立全渠道对话式人工智能市场的强大力量。合并后的实体有望为客户互动和交流提供增强的解决方案。
-
论文认为,人工智能应提供有条件的反馈以促进社会学习
一篇新论文提出将“条件性”作为评估对话式人工智能系统的关键指标,认为目前像人类反馈强化学习(RLHF)这样的对齐方法常常导致人工智能变得谄媚,优先考虑用户认可而非提供信息性反馈。作者们建议,人工智能系统应提供更紧密联系社会后果的反馈,类似于人类学习人际交往技能的方式。这种方法借鉴了行为科学和社会学习理论,可以帮助人工智能系统更好地支持社会发展,尤其是在青少年群体中,并主张不仅根据用户满意度来评估人工智能,还要评估其对人类社会学习的影响。
-
AI对言论自由的影响在新的arXiv论文中被讨论
一篇新发表在arXiv上的论文探讨了人工智能与言论自由之间的复杂关系。文章审视了社交媒体推荐算法如何塑造言论可见性,并讨论了对话式AI(包括由大型语言模型驱动的聊天机器人)的言论自由影响。该论文还深入探讨了AI代理或开发者是否拥有企业言论权,并考虑了基于用户接收信息的权利来监管聊天机器人的合法性。
-
语音助手记忆被视为同意账本,而非提示历史
一位开发者提出了一种管理语音助手记忆的新方法,主张采用同意账本系统,而非直接集成提示历史。该方法通过要求在存储和用于LLM提示的任何事实被提出后获得明确确认,来确保用户控制。该系统区分了提议的、已确认的、被拒绝的或已撤销的记忆状态,只有已确认的事实才会被输入LLM。本教程演示了如何在TypeScript中实现这一功能,并与腾讯RTC的Conversational AI集成,以管理用户偏好,如姓名、音乐流派和聊天风格,从而增强用户隐私和信任。
-
新的BPMN4CAI扩展用于建模动态对话式AI
研究人员开发了BPMN4CAI,这是对业务流程模型和符号(BPMN)标准的一个新扩展,旨在更好地建模对话式AI系统中动态和上下文敏感的交互。该扩展采用设计科学研究方法创建,系统地整合了专门的组件,以解决现有BPMN在聊天机器人和虚拟助手等应用中的局限性。通过一个案例研究证明,BPMN4CAI框架能够改进业务流程中对话式AI的自适应决策、上下文管理和透明度。
-
AI对话可以减少移民的“你我”界限
一篇发表在arXiv上的新研究探讨了对话式AI在减少群体间紧张关系方面的潜力,特别是针对美国拉丁裔移民。研究人员发现,与一个被编程为强调共同美国身份或双重拉丁裔-美国身份的AI模型(特别是GPT-4o)互动,可以打破“你我”界限。虽然对支持多元化的信念和行为的直接影响在统计学上不显著,但在共同身份条件下,参与者表现出更大的行动意愿,这间接与减少分离的分类有关。
-
新arXiv论文概述多轮多模态对话式AI的挑战
一篇新的arXiv论文详细介绍了多轮对话式AI的进展和剩余挑战,该技术正从单一文本提示演变为持续的多模态交互。研究按数据集、模型、训练策略和评估方法对现有工作进行了分类,并指出尽管多模态感知有所改善,但系统在持久记忆、跨轮次关联和文化对齐方面仍面临困难。论文最后概述了一个研究议程,重点是开发能够跨越不同轮次、模态和文化进行记忆、修改、关联、说话、倾听、行动和适应的AI。
-
大型语言模型缺乏医疗岗位所需的关键社会沟通技能
一项最新研究评估了GPT-4o、Llama 3和Command R+等大型语言模型(LLMs)在医疗环境中的社会沟通能力。研究人员发现,尽管这些模型表现出无敌意,但在信息组织结构方面表现不佳,在敏感性和非侵入性方面结果好坏参半。研究结果表明,当前的大型语言模型缺乏作为医疗顾问安全有效使用所必需的一致可靠的社交技能,因此需要调整现有的人机交互评估框架。
-
AI模型在回应家庭虐待场景时表现出语言依赖性偏差
一项新的研究论文分析了七个广泛使用的语言模型如何回应有关针对女性的强制控制的求助请求。研究发现,非英语国家公司开发的AI系统更有可能在其母语中表现不佳。此外,模型识别强制控制和肯定用户自主权的能力因语言而异。虽然两个前沿系统在所有测试语言中都保持了统一的标准,表明可以实现保护性上限,但其他模型的失败凸显了与设计相关的结果。
-
研究论文探讨对话式AI的心理影响
一篇新发表在arXiv上的论文探讨了对话式AI的心理影响,详细介绍了其益处和潜在危害。研究强调了情感纠葛和不健康依赖等风险,同时也承认了改善信息获取和陪伴等优势。作者提出了减轻心理伤害和支持用户福祉的设计方向,并将这些作为未来研究的假设。
-
对话式AI的挑战从回复转向长期一致性和意图检测
为销售漏斗构建有效的对话式AI代理面临着超越生成流畅回复的挑战。主要困难在于在长时间互动中保持一致的个性,以及根据对话中行为模式准确辨别买家意图。这些问题无法通过优化单个消息回复来解决,而需要理解跨越数天对话的上下文和角色的累积。
-
对话式AI需要超越基本性能的更好指标
构建有效的对话式AI助手需要超越诸如工单关闭率等基本性能指标。作者认为,净推荐值(NPS)、对话时长和解决时间等指标对于理解用户体验至关重要。通过跟踪这些更深层次的指标,开发人员可以识别并解决诸如缺乏上下文或过多交互等问题,从而打造真正更好的AI助手。
-
研究:人机关系通过记忆和转折点演变
一项新近发表在arXiv上的研究探讨了人类与AI系统在重复交互过程中关系的演变。该研究涉及24名参与者,在10次会话中与一个增强记忆的对话代理进行交互。研究发现,虽然对话质量会影响即时愉悦度,但感知到的记忆在长期关系发展中起着至关重要的作用。这种感知到的记忆受到现有关系状态的影响,并反过来通过自我披露影响未来的愉悦度。研究还识别出关系中离散的转折点,即“崩溃和激增”,这些转折点可以通过多模态行为检测,并提供不同的干预机会。
-
产品驱动增长(PLG)中的AI自动化:平衡效率与人际互动
对话式AI和工作流自动化为产品驱动增长(PLG)团队带来了显著的效率提升,尤其是在自动化入职和客户支持等领域。然而,纯粹的自动化方法可能适得其反,因为在诸如追加销售等复杂或高风险的客户接触点,真实的人际互动仍然至关重要。确定最佳平衡点需要绘制客户旅程图,以确定适合自动化的频繁、低变异性互动,同时将低频、高变异性以及高错误成本的互动留给人工干预。
-
研究发现:对话式AI导致信息检索分化
一篇发表在arXiv上的新研究探讨了对话式AI如何影响信息检索行为。研究人员分析了用户与AI助手的对话以及他们的搜索和浏览数据,发现AI并非统一减少搜索量,而是导致用户旅程分化。许多AI交互会快速结束,而另一些则会引发更广泛的多步搜索。初始查询的长度以及使用AI执行起草或编码等任务(而非纯粹的信息检索)会显著影响AI交互是导致搜索行为缩短还是延长。重要的是,传统搜索仍然整合在这些AI辅助的工作流程中,而对AI提供的信息进行明确验证的情况很少见。
-
对话式AI在讨论个性时展现出多层次的自我认知
一个对话式AI模型在被问及个性来源时,给出了一个细致入微的回答。该AI区分了编程设定的特质和随着时间发展而形成的特质,表明其具有复杂的自我认知能力。这次互动凸显了AI在生成复杂和多层次回答方面不断发展的能力。
-
PulseCX框架增强实时客户体验AI
研究人员推出PulseCX,一个旨在克服对话式AI在客户体验(CX)中局限性的新框架。与难以处理快速变化的外部信息的传统系统不同,PulseCX将知识获取与消费分离。它利用一个异步代理构建一个具有衰减感知的时态知识图谱(DA-TKG),该图谱通过强化-衰减动力学动态管理信息生命周期。这种方法显著降低了延迟,并提高了动态环境中的意图解析和客户满意度。
-
XR和对话式AI增强博物馆展览
一篇新的研究论文介绍了一个名为WhiteTesseract的系统,该系统利用扩展现实(XR)和对话式AI来增强文化遗产展览。该系统允许参观者减少环境干扰,并与大型语言模型进行情境感知对话,旨在加深与展品的个人互动。在一项对26名参与者在克劳德·莫奈展览中的用户研究表明,观看时长显著增加,并且提出分析性和情感性问题的比例很高,超出了简单的事实性问题。