PHP HTML代码串 截取实现代码


Posted in PHP onJune 29, 2009

而且给的数据是HTML代码串,比如这样:

<div class=”aaa”><a href=”/aaa.php?id=1″>张三</a>  评论了 <a href=”/aaa.php?id=444″>李四</a> 分享的 <a href=”bbb.html”>一篇文章文章一长串的东西</a></div>

截取的时候是要截取 div 标签内部的东西,而且要保留HTML标签,只是对其中的文字做处理。比如我可能只是截取到“李四”的“李”字,但是如果就这样放到前端的话,“李四”前面的 a 标签是没有闭合的,所以截取之后要保证HTML的语法正确。

这个问题确实不太好搞,让我郁闷了两天。请注意,这只是一个字符串,只不过内容是HTML代码,是没有什么DOM的。如果是在前端处理就好办了,直接DOM获取,然后对里面的节点进行处理,最后把innerHTML 之类的东西输出就搞定了。现在可不行了,得换个思路。同事的思路是这样的:

遍历字符串的每一个字符。设置一个标记,碰到标签开始的标记< 就置为1,接下来的字符都不记数,然后碰到>之后再开始计数。对标签内部的字符串处理的时候,还要先判断当前字符的编码是不是可能是中文,一般来说PHP中 UTF-8 编码的中文字符的长度都是3,所以如果碰到是中文字符编码,就要跳过两个不记数……说到这里我自己头已经开始大了。个人认为这种方法很不爽,首先这种精致的逻辑不太容易控制,而且 UFT-8 编码下中文产生的长度有可能是3个或4个 所以代码的严密性值得怀疑。

我个人的思路是,用 Tidy 来搞(具体用法请看PHP手册吧)。昨天研究了一下那个 Tidy ,发现这个东西还是挺好用的。首先,把这个字符串转换成 Tidy 对象,这样:

$tidy = tidy_parse_string($str, array(), ‘utf8′);  // 最后一个是设置编码的,注意,这里是utf8 ,不是utf-8,没有中间那个连线。

然后获取$tidy中的 body(因为转换之后$tidy会自动加上<head><body>等标签):

$body =  tidy_get_body($tidy);

这个时候你可以用 var_dump 看一些 $body 的结构,会发现它把每个标签都变成了一个对应的对象,里面有相应的属性。举例来说,比如 <a href=”#”>sdf</a> ,这么一条语句对应的一些属性有:

name=>”a”
value => “<a href=”#”>sdf</a>”
child=> array{[0]=>一个文本节点对象,value是 sdf}
attribute=array{”href”=>”#”}
…..其他属性

可以看到,我们其实是可以单独去处理 a 标签对应节点下面的文字节点的值的,那样就不会破坏任何HTML完整性。原来我以为改变 a 标签中文字节点的值之后, a 标签的value也会跟着改变,那样我直接返回a标签对应节点的value就OK了,没想到不是那个样子,哎,所以处理过其中的文字之后还是要自己拼出新的HTML。

知道了Tidy对象的结构之后,一切就好办了,只要遍历所有的节点,对于本需求来说,就是找到那个 div 标签,然后开始处理里面的节点。代码如下:

if(mb_strwidth($subchild->value, ‘utf-8′) >= $len)
{
$subchild->value = mb_strimwidth($subchild->value, 0, $len, ‘…', ‘utf-8′);
$trimed_str .= $subchild->value;
break;
}
else
{
$trimed_str .= $subchild->value;
$len = $len - mb_strwidth($subchild->value, ‘utf-8′);
}

里面的$subchild 就是一个子节点。注意,这里使用了 mb_strwidth 来获取字符串长度。严重推荐一下这个 mb_strwidth,很好用,它会把中文当作两个字符长度处理,正好符合这里的需求!而且截取字符串的时候用到了 mb_strimwidth,这个函数也会把中文当作两个字符长度处理,mb_ 开头的函数真是好用啊。

具体代码我就不写出来了,因为是针对一个需求写的,没做成通用的形式。哪天我有时间做成通用的再发布一下。

另外,可惜FireFox不支持 text-overflow 属性,不然也不用后台那么辛苦地去截断了。如果大家有更好的方法,欢迎提出!不胜感激。

PHP 相关文章推荐
php+dbfile开发小型留言本
Oct 09 PHP
php在文件指定行中写入代码的方法
May 23 PHP
php面向对象 字段的声明与使用
Jun 14 PHP
PHP设计模式之责任链模式的深入解析
Jun 13 PHP
ie与session丢失(新窗口cookie丢失)实测及解决方案
Jul 15 PHP
PHP 线程安全与非线程安全版本的区别深入解析
Aug 06 PHP
php 启动报错如何解决
Jan 17 PHP
PHP准确取得服务器IP地址的方法
Jun 02 PHP
php使用ZipArchive函数实现文件的压缩与解压缩
Oct 27 PHP
PHP 访问数据库配置通用方法(json)
May 20 PHP
PHP基于mcript扩展实现对称加密功能示例
Feb 21 PHP
PHP常用正则表达式精选(推荐)
May 28 PHP
PHP 网页过期时间的控制代码
Jun 29 #PHP
PHP 超链接 抓取实现代码
Jun 29 #PHP
PHP 文件上传功能实现代码
Jun 24 #PHP
php addslashes 函数详细分析说明
Jun 23 #PHP
PHP n个不重复的随机数生成代码
Jun 23 #PHP
PHP 七大优势分析
Jun 23 #PHP
php 404错误页面实现代码
Jun 22 #PHP
You might like
一段php加密解密的代码
2007/07/16 PHP
php传值和传引用的区别点总结
2019/11/19 PHP
php查看一个变量的占用内存的实例代码
2020/03/29 PHP
Laravel 框架控制器 Controller原理与用法实例分析
2020/04/14 PHP
[对联广告] JS脚本类
2006/08/27 Javascript
jQuery瀑布流插件Wookmark使用实例
2014/04/02 Javascript
点击表单提交时出现jQuery没有权限的解决方法
2014/07/23 Javascript
JS实现仿google、百度搜索框输入信息智能提示的实现方法
2015/04/20 Javascript
jQuery解决浏览器兼容性问题案例分析
2016/04/15 Javascript
jQuery Tree Multiselect使用详解
2017/05/02 jQuery
Django模板继承 extend标签实例代码详解
2019/05/16 Javascript
基于vue hash模式微信分享#号的解决
2020/09/07 Javascript
vue实践---根据不同环境,自动转换请求的url地址操作
2020/09/21 Javascript
如何在面试中手写出javascript节流和防抖函数
2020/10/22 Javascript
[01:45]DOTA2新英雄“神谕者”全方位展示
2014/11/21 DOTA
[01:12:44]VG vs Mineski Supermajor 败者组 BO3 第二场 6.6
2018/06/07 DOTA
Python实现文件按照日期命名的方法
2015/07/09 Python
Python自定义进程池实例分析【生产者、消费者模型问题】
2016/09/19 Python
简单谈谈Python中的几种常见的数据类型
2017/02/10 Python
Pycharm 2020最新永久激活码(附最新激活码和插件)
2020/09/17 Python
浅析python表达式4+0.5值的数据类型
2020/02/26 Python
python中sklearn的pipeline模块实例详解
2020/05/21 Python
python实现scrapy爬虫每天定时抓取数据的示例代码
2021/01/27 Python
使用CSS3实现圆角,阴影,透明
2014/12/23 HTML / CSS
用HTML5 Canvas API中的clearRect()方法实现橡皮擦功能
2016/03/15 HTML / CSS
HTML5 本地存储之如果没有数据库究竟会怎样
2013/04/25 HTML / CSS
Michael Kors加拿大官网:购买设计师手袋、手表、鞋子、服装等
2019/03/16 全球购物
可以使用抽象函数重写基类中的虚函数吗
2013/06/02 面试题
18岁生日感言
2014/01/12 职场文书
优秀员工获奖感言
2014/03/01 职场文书
商业融资计划书
2014/04/29 职场文书
农村党员对照检查材料
2014/09/24 职场文书
第二批党的群众路线教育实践活动总结报告
2014/10/30 职场文书
2016年度基层党建工作公开承诺书
2016/03/25 职场文书
《悬崖边的树》读后感2篇
2019/12/02 职场文书
方法汇总:Python 安装第三方库常用
2022/04/26 Python