亚马逊AWS官方博客

后端即服务:AI时代应用部署新范式

AI Agent 创建数据库已成为行业新常态——在主流 Serverless 数据库平台上,80% 以上的数据库已由 Agent 创建。本文介绍如何基于 Aurora PostgreSQL + Supabase 构建后端即服务(BaaS)方案,为 AI Coding 场景提供开箱即用的数据库、认证、API 自动生成等能力。

Text-only LLM SFT 训练数据预处理:从收集到数据打包的完整指南

本文将系统介绍 Text-only LLM SFT 训练数据预处理的完整流程,涵盖从数据收集到最终打包的每一个环节,并结合真实客户案例给出实操建议。这里需要说明的是,本文聚焦于纯文本场景,且不涉及代码生成和 SQL 相关的场景。从 2025 年的行业趋势来看,代码和 SQL 相关场景基本上都是基于开源模型权重或闭源模型来构建实现的,需要针对代码和SQL相关场景做post training 的客户相对要少很多。此外,SFT 和 RFT(Reinforcement Fine-Tuning)的训练数据预处理存在差异,本文只讨论 SFT 的部分。虽然 SFT 本身又分为全参数 SFT 和 PEFT(主要是 LoRA 及其变体),但数据集的预处理流程对两者是一致的。