software engineering
PulseAugur coverage of software engineering — every cluster mentioning software engineering across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
AI 对软件工程的全球影响引发讨论
人工智能对软件工程的全球影响是一个讨论的主题,人们对它将如何塑造该领域的未来提出了疑问。这涉及到考虑将人工智能融入软件开发过程的潜在好处和坏处。
-
AI 软件工程:多租户与分布式系统的陷阱
本文讨论了软件工程中一个常见的误解,即将多租户等同于分布式系统,尤其是在人工智能开发背景下。文章强调,虽然这两个概念都涉及管理多个用户或实例,但它们在根本上是不同的,并且经常被混淆,导致错误的架构决策。本文旨在阐明这些区别,以避免在构建可扩展且高效的 AI 系统时出现常见陷阱。
-
新框架使用科学软件训练AI终端代理
研究人员开发了一个名为软件在环重建(SWR)的自监督框架,用于在科学领域创建终端代理的训练环境。该方法利用现有的科学软件工作流程生成参考行为和验证目标,减少了手动工程的需求。当应用于Qwen3.8-Max时,该框架促进了838个任务的解决,并产生了1400多个已验证的轨迹。使用这些数据对Qwen3.8-27B进行进一步微调,显著提高了在Terminal-Bench 2基准测试上的性能,表明了来自科学软件的可扩展监督的潜力。
-
软件设计规则:如果你不能简单地解释它,那么它就没有完成
软件工程的一个原则强调,一个产品在能够用简单的术语清楚地解释其功能之前,才算真正完成。这种清晰度不仅被视为一种沟通工具,而且是设计过程本身的根本方面。解释一个复杂系统所遇到的困难,往往表明在尝试解释之前,系统架构中就存在固有的纠缠或问题。
-
AI从业者将数据质量的定义从输入扩展到模型行为
一篇新论文探讨了从业者如何定义、评估和管理人工智能驱动系统中的数据质量,超越了将数据视为纯粹输入的传统观点。该研究基于对16名从业者的访谈,确定了六个关键主题,包括可追溯性从调试转向归因模型行为的变化,以及当模型本身评估质量时引入的循环性。研究还强调了对合成数据真实性的担忧,以及合法性和代表性在基础模型训练数据中的关键作用。
-
新研究论文详述嵌入式软件公司的AI路线图
一篇新研究论文概述了组织向人工智能优先结构转型的路线图,重点关注嵌入式软件开发中的特定挑战。该研究对一家大型嵌入式系统公司中的40名参与者(包括Scrum Master、架构师和产品负责人)进行了研究,揭示了由于自主AI代理的兴起,团队结构、所需技能和整体组织战略将受到重大影响的预期。该论文提出了组建联邦AI团队和整合“人在回路”实践的策略,以实现AI在嵌入式软件工程中的可持续采用。
-
新的CineSubBench基准评估LLM对电影的理解能力
研究人员推出CineSubBench,这是一个旨在利用多语言电影字幕评估大型语言模型(LLM)长上下文理解能力的新基准。该基准包含来自六种语言的1000多部电影,总计超过800万条带时间戳的字幕条目。CineSubBench评估七项任务,包括叙事重建、类型预测、年龄适宜性和语言安全,旨在将电影确立为评估LLM在叙事、多语言和文化理解方面能力的领域。
-
AI软件工程需要重新思考架构和流程
文章讨论了重新评估以AI为中心的软件工程的架构和开发流程的迫切需求。它强调了为构建和管理这些先进工具制定新原则的重要性。
-
Mastodon平台bug数月来悄无声息地阻止了AI代理
一位软件工程师遇到了一个持续存在的问题,即AI代理数月来一直没有生成任何输出。该问题被追溯到Mastodon平台内部系统中的一个细微bug。这个问题凸显了调试AI代理行为的复杂性,以及平台级问题可能悄无声息地阻碍AI功能的潜力。
-
退休工程师转向历史研究,利用AI工具
一位退休的航空航天和软件工程师正在探索转向专业历史研究的职业生涯,这源于他对历史话题的新热情。他正在考虑深入研究食品/营养史、运动科学史和计算机史。这一转变也受到人工智能工具在历史研究中日益普及和实用性的影响。
-
软件工程对AI的反应与流行病学应对COVID的比较
作者将软件工程行业对AI的反应与流行病学领域应对COVID-19的方式进行了类比。他们认为,当整个行业面临重大的现实挑战时,可能会陷入困境。
-
新研究质疑更深入审计对生成式CAD模型的价值
一篇题为“DepthBenchCAD:更深入的审计何时能带来更可靠的结论?”的新论文探讨了评估生成式CAD模型的权衡。研究表明,虽然增加参数编辑检查似乎可以提高可靠性,但它可能会减少被评估任务和独立生成的总体数量,从而可能降低模型级别的准确性。该研究定义了一个与审计深度无关的平均故障风险,并通过在两个CAD环境和五个生成系统中的实验表明,更深入审计的价值取决于评估不确定性的来源。
-
AI代码生成需要更强的管理,而非更少
将人工智能用于代码生成需要加强管理和领导力监督,而不是减少,特别是对于那些关注其工程人才发展的公司而言。这种方法对于确保人工智能工具能够促进而非阻碍软件开发团队的成长和能力至关重要。
-
AI在宏修复和代码生成中的作用引发争论 · 跟踪3个来源
使用AI修复复杂的宏,例如Visual Basic for Applications中的宏,通常会导致用户将代码复制到AI聊天窗口寻求解决方案的循环。这个过程突显了软件工程中的一个常见挑战:导航和修改不熟悉的代码库。“一次性”AI开发,即从单个提示生成整个项目,被认为是一个神话,因为它忽视了现实世界软件开发的复杂性。
-
AI发展重心从算力转向高质量数据
AI发展格局正在迅速演变,已超越简单的问答聊天机器人。近期讨论表明,先进AI和智能体开发的主要瓶颈正从计算能力转向高质量数据的可用性。这一演变表明,未来的进步将严重依赖于创新的数据来源和策展策略,而不仅仅是提高处理能力。
-
讨论AI集成在软件和招聘中的挑战 · 已追踪4个来源
此帖子集群讨论了将AI集成到软件开发和招聘流程中的挑战和最佳实践。它强调了幼稚AI实现的问题,例如生成过多的内容或提供过时的指令,并强调需要健壮的工程模式来创建可靠的系统。帖子还触及了人类监督在AI辅助招聘中的作用,认为简单的确认步骤不足以满足需求,需要更结构化的方法。
-
AI 对话式编程提高效率但存在软件质量风险
一项发表在 arXiv 上的新研究评估了“Vibe Coding”,这是一种 AI 驱动的对话式编程方法,开发人员通过自然语言提示与大型语言模型生成软件。研究发现,与传统编码相比,Vibe Coding 将开发效率显著提高了 27%,与 AI 辅助方法相比提高了 12%。然而,这种效率是以软件可维护性降低和安全漏洞增加为代价的,参与者报告称对 AI 生成的代码失去了控制感,透明度降低。该研究提出了一个负责任采用的框架,强调混合集成、人…
-
LLM正在改变软件工程,提高生产力
软件工程领域正在经历重大变革,这在很大程度上是由大型语言模型(LLM)日益增长的能力和采用所驱动的。据报道,这些AI的进步正在提高生产力并改变传统的开发工作流程。这一转变预示着软件开发的新时代,其特点是效率提高和可能的新方法。
-
研究揭示 ChatGPT 高效代码生成的 3 个关键因素
一项新近发表在 arXiv 上的研究,探讨了用户如何与 ChatGPT 交互以完成代码生成任务,重点关注超越简单函数生成的项目级复杂性。该研究招募了 36 名参与者,他们使用了特定的提示策略与 ChatGPT 交互,并通过屏幕录像和聊天记录对其交互进行了分析。研究确定了三个持续提高生产力的关键交互特征,提出了五条增强人类-大型语言模型(HLI)在编码中交互的指南,并分类了 29 个常见错误及其建议的解决方案。
-
AI置信度鸿沟:区分模型流畅性与行动安全性
一篇近期文章强调了AI模型流畅性与其实际正确性之间的关键区别,尤其是在医疗保健和金融基础设施等高风险应用中。作者认为,当前的大型语言模型(LLMs)常常将统计概率与事实准确性混淆,导致“置信度鸿沟”,在这种情况下,系统尽管表现出自信,但可能采取不安全的行动。为解决此问题,文章提出将令牌概率等指标与声明可靠性、决策置信度和行动安全性分开,主张进行系统层面的不确定性控制,而不是仅仅依赖于以模型为中心的微调。