官方博客-第6页-阿里云开发者社区

米基

2024-05-15

4099

大模型推理优化实践：KV cache复用与投机采样

在本文中，我们将详细介绍两种在业务中实践的优化策略：多轮对话间的 KV cache 复用技术和投机采样方法。我们会细致探讨这些策略的应用场景、框架实现，并分享一些实现时的关键技巧。

米基

4,099

刘军

2024-10-17

3375

阿里云开源 AI 应用开发框架：Spring AI Alibaba

阿里云开源 Spring AI Alibaba，旨在帮助 Java 开发者快速构建 AI 应用，共同构建物理新世界。

刘军

3,375

夏冬

2025-04-01

3668

RAG 调优指南：Spring AI Alibaba 模块化 RAG 原理与使用

通过遵循以上最佳实践，可以构建一个高效、可靠的 RAG 系统，为用户提供准确和专业的回答。这些实践涵盖了从文档处理到系统配置的各个方面，能够帮助开发者构建更好的 RAG 应用。

夏冬

3,668

任庆盛

2023-02-22

23531

Flink CDC+Kafka 加速业务实时化

阿里巴巴开发工程师，Apache Flink Committer 任庆盛，在 9 月 24 日 Apache Flink Meetup 的分享。

任庆盛

23,531

澄潭计缘望宸

2025-03-14

1216

大模型无缝切换，QwQ-32B和DeepSeek-R1 全都要

通义千问最新推出的QwQ-32B推理模型，拥有320亿参数，性能媲美DeepSeek-R1（6710亿参数）。QwQ-32B支持在小型移动设备上本地运行，并可将企业大模型API调用成本降低90%以上。本文介绍了如何通过Higress AI网关实现DeepSeek-R1与QwQ-32B之间的无缝切换，涵盖环境准备、模型接入配置及客户端调用示例等内容。此外，还详细探讨了Higress AI网关的多模型服务、消费者鉴权、模型自动切换等高级功能，帮助企业解决TPS与成本平衡、内容安全合规等问题，提升大模型应用的稳定性和效率。

澄潭计缘望宸等

1,216

ModelScope

2025-05-23

1851

通义灵码 + 魔搭MCP：全流程构建创空间应用

最近，通义灵码上线 MCP（ModelScope Cloud Platform）功能，从之前代码生成及修改的基础功能，到可以使用MCP服务连接更多功能，开发者可以实现从代码爬取、模型推理到应用部署

ModelScope

1,851

元丹

2024-05-15

283097

深入浅出LangChain与智能Agent：构建下一代AI助手

LangChain为大型语言模型提供了一种全新的搭建和集成方式，通过这个强大的框架，我们可以将复杂的技术任务简化，让创意和创新更加易于实现。本文从LangChain是什么到LangChain的实际案例到智能体的快速发展做了全面的讲解。

元丹

283,097

唐殊

2024-11-01

2338

探索LLM推理全阶段的JSON格式输出限制方法

文章详细讨论了如何确保大型语言模型（LLMs）输出结构化的JSON格式，这对于提高数据处理的自动化程度和系统的互操作性至关重要。

唐殊

2,338

ModelScope

2024-05-15

15471

Llama 3开源，魔搭社区手把手带你推理，部署，微调和评估

Meta发布了 Meta Llama 3系列，是LLama系列开源大型语言模型的下一代。在接下来的几个月，Meta预计将推出新功能、更长的上下文窗口、额外的模型大小和增强的性能，并会分享 Llama 3 研究论文。

ModelScope

15,471

官方博客-第6页-阿里云开发者社区

类目筛选

内容类型

大模型推理优化实践：KV cache复用与投机采样

阿里云开源 AI 应用开发框架：Spring AI Alibaba

RAG 调优指南：Spring AI Alibaba 模块化 RAG 原理与使用

Flink CDC+Kafka 加速业务实时化

大模型无缝切换，QwQ-32B和DeepSeek-R1 全都要

通义灵码 + 魔搭MCP：全流程构建创空间应用

深入浅出LangChain与智能Agent：构建下一代AI助手

探索LLM推理全阶段的JSON格式输出限制方法

Llama 3开源，魔搭社区手把手带你推理，部署，微调和评估

官方博客-第6页-阿里云开发者社区

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

类目筛选

内容类型

大模型推理优化实践：KV cache复用与投机采样

阿里云开源 AI 应用开发框架：Spring AI Alibaba

RAG 调优指南：Spring AI Alibaba 模块化 RAG 原理与使用

Flink CDC+Kafka 加速业务实时化

大模型无缝切换，QwQ-32B和DeepSeek-R1 全都要

通义灵码 + 魔搭MCP：全流程构建创空间应用

深入浅出LangChain与智能Agent：构建下一代AI助手

探索LLM推理全阶段的JSON格式输出限制方法

Llama 3开源，魔搭社区手把手带你推理，部署，微调和评估