两篇新研究论文介绍了使用大型语言模型进行源代码嵌入的新方法。第一种方法 LSem2Vec 结合了大型语言模型和句子嵌入模型,无需任务特定的微调即可提取代码语义,在各种编程语言上表现优异。第二篇论文介绍了 jina-code-embeddings,这是一套更小、更高效的模型,利用在文本和代码上训练的自回归骨干网络,在自然语言代码检索和语义相似性识别等任务上取得了最先进的成果。 AI
影响 这些进展可以改进软件工程工作流程中的代码分析、检索和理解。
排序理由 两篇在 arXiv 上发表的学术论文,介绍了源代码嵌入的新方法。
- arXiv
- Han Xiao
- Hugging Face
- jina-code-embeddings
- alphaXiv
- artificial intelligence
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Influence Flower
- large-language models
- LSem2Vec
- ScienceCast
- Sentence Embedding Models
- software engineering
- Source Code Embedding
- Zixiang Xian
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →