array_chunk() 不能按目标段数直接切分,需先计算每块最小长度ceil(count($lines)/$target_chunks),再传入该值;否则会得到错误段数或空块,且需预处理换行符、过滤空行、处理富文本及语义断裂。
想把一段 127 行的客服对话严格切成 5 段送给大模型?别直接写 array_chunk($lines, 5)——那会得到 26 段(每段 5 行),完全偏离目标。PHP 的 array_chunk() 只认「每块多少元素」,不接受「我要几块」这个参数。
真正可控的做法是先算最小块长:ceil(count($lines) / $target_chunks)。比如 127 行切 5 段,ceil(127 / 5) = 26,再传给 array_chunk($lines, 26),结果就是 [26,26,26,26,23] —— 严格 5 段,末段略短但数据不丢。
容易踩的坑:
intdiv() 替代 ceil(),会导致段数不足(如 127÷5=25,array_chunk($lines, 25) 实际产出 6 段)explode("n", $text) 后没 array_filter($lines, 'trim'),空行被当有效行计入总数,算出来的 $size_per_chunk 偏小,段数超标ceil(3/5)=1 会生成 5 个单行块,其中两块是空数组 —— 若下游逻辑未判空,可能触发 Notice 或逻辑错位大模型输入常受限于 token 数,但 array_chunk() 本身不感知字符或 token,只处理数组元素。所以必须先把文本「结构化」:按语义单位拆成数组,再分块。
立即学习“PHP免费学习笔记(深入)”;
按行切是最常用且安全的起点,尤其适合日志、对话、工单类文本:
explode("n", trim($text)) 拆,比 str_split() 保留原始段落边界rn,先 str_replace("rn", "n", $text) 统一,否则 explode() 可能漏拆strip_tags() 再 explode(),避免标签碎片污染分块逻辑注意:这不是万能解法。技术文档含代码块时,单纯按行切会把 ```python 和其内容割裂。此时应先用正则提取并暂存代码段,分块后再注入,而非强依赖 array_chunk() 一招鲜。
array_chunk() 保证段数准确,但不保语义完整。8 行文本切 5 段得 [2,2,2,1,1],最后一段可能只有半句话,直接喂给 AI 容易触发幻觉或理解偏差。
实操中建议加一层校验与微调:
。!?、英文 .!?)结束,不是则向前合并到上一块末尾的最近标点处// context: 风控策略,不参与模型输入但可被检索模块识别这步无法靠 array_chunk() 自动完成,必须手动后处理 —— 否则分得再准,AI 也容易答非所问。
有人为凑够段数,把 $size_per_chunk 设得极小(如 1~3 行)。这看似满足「5 段」要求,实际导致严重问题:
经验阈值:单块至少保持 80~120 字(中文),对应 OpenAI 的 150~250 tokens。低于此值,宁可少分一段,也要确保每块有基本语义主干。真正的优化不在「切得更多」,而在「每块更准」。